FEATUREDAI HOT 精选· aihot-apiZH23:41 · 07·12
Ploy 把生产环境 AI 智能体从 Claude Opus 4.8 换到 GPT-5.6 Sol:构建快 2.2 倍,成本降 27%
Ploy 的 AI 智能体负责搭建真实的营销网站。Claude Opus 4.8 在这个位置上坐了四个月,没有对手能撼动它,直到 GPT-5.6 Sol 发布当天。直接对比的结果:平均构建时间从 8 分钟降到 3 分 42 秒,单次成本从 3.06 美元降到 2.22 美元,视觉评分从 0.936 升到 0.970。但切换过程不是即插即用。他们的评测框...
#Agent#Code#Benchmarking#Ploy
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
Ploy 实测把默认模型从 Claude Opus 4.8 换成 GPT-5.6 Sol,搭网站时间从 8 分钟砍到 3 分 42 秒,成本降了 27%。但注意,早期有三分之一失败是测试框架自己没适配好,不是模型不行。
锐评
这条迁移记录最值钱的地方,是它把“换模型”这件事的坑讲清楚了。Ploy 的 AI 负责直接搭营销网站,之前 Claude Opus 在这个位置上坐了四个月没对手。GPT-5.6 Sol 一出来,直接对比的结果很硬:平均构建时间从 8 分钟降到 3 分 42 秒,单次成本从 3.06 美元降到 2.22 美元,视觉评分还从 0.936 升到 0.970。代码也写得更精简,一个案例里 CSS 从近 1.8 万字符缩到 2500 多。
但别急着下结论说新模型全面碾压。他们发现自己的评测框架早就被旧模型“养刁了”。Opus 习惯一步步调工具,GPT-5.6 喜欢并行调用,结果直接冲爆了原来的工具调用预算,导致约三分之一的初期失败其实是框架的锅,不是模型出错。另外,GPT-5.6 产出的设计干净现代,但容易千篇一律,想保持品牌特色得额外加指令约束。
文章还提到工具定义、缓存和推理重放这些环节都要跟着改,但具体怎么修没细说。如果你也在考虑切模型,这篇相当于一份踩坑清单,提醒你先查自己的测试工具是否公平,别把新模型的“不一样”直接判成“不好”。
HKR 分解
hook ✓knowledge ✓resonance ✓