FEATUREDHacker News 首页· rssEN20:52 · 07·10
12 个模型写 4 个同样的 App:GPT-5.6、Grok 4.5、Claude 和 Muse Spark 现场比试
TryAI 让 12 个模型各试 5 次,去写一个伪 3D 迷宫、一个魔方、一个计算器和一个生命游戏。GPT-5.6 Sol 最稳,迷宫 5 次全过,但每次跑要花 1.35 美元;Grok 4.5 也是 5 次全过,只要 0.27 美元,性价比很高。Meta 新出的 Muse Spark 1.1 有点抽风,5 次里坏了 3 次,但能跑的那两次质量跟 S...
#Code#Benchmarking#TryAI#OpenAI GPT-5.6 Sol
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
GPT-5.6 Sol 最稳但每次 1.35 美元,Grok 4.5 同样全过只要 0.27 美元,性价比碾压。Muse Spark 1.1 五次崩三次,先别急着用。
锐评
TryAI 这次让 12 个模型各跑 5 次去写四个小应用,把随机性摊开来看,比单次跑分更有参考价值。GPT-5.6 Sol 在迷宫任务上 5 次全过,稳定性确实强,但代价是每次生成要花 1.35 美元,比 Grok 4.5 贵了整整五倍,而 Grok 同样做到 5 次全过。这说明如果你不是非要 Sol 那种极致一致性,Grok 4.5 是当前更划算的选择。
Meta 新出的 Muse Spark 1.1 表现不太稳定,迷宫任务 5 次里坏了 3 次,正文说能跑的那两次质量跟 Sol 差不多,但这么高的失败率在实际开发里会很耽误事。另外,这次测试只覆盖了前端小应用的生成,没涉及复杂后端逻辑或多文件项目,所以结论主要适用于这类单文件代码生成场景。所有原始构建和视频都公开了,你可以自己点开看每次尝试到底差在哪。
HKR 分解
hook ✓knowledge ✓resonance ✓