FEATUREDAI HOT 精选· aihot-apiZH00:36 · 09·15
Fireworks 实测 DeepSeek-V4.1-Flash:写代码能力看齐 GPT-6 Astra,单次成本只要 1/15
Fireworks 跑了一遍 DeepSeek-V4.1-Flash 的完整测试。在衡量自动修 bug、写代码能力的 DeepSWE 基准上,它的 pass@1 得分是 74.34%,跟 GPT-6 Astra 的 74.12% 在同一档,但每次任务成本只要 0.43 美元,比 Astra 便宜 15 倍,比 Claude Opus 5 便宜 28 倍...
#Code#Benchmarking#Fireworks#DeepSeek
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
DeepSeek-V4.1-Flash 在自动修 bug 测试上追平 GPT-6 Astra,但每次任务成本只要 0.43 美元,便宜 15 倍。不过这篇是 Fireworks 自己的评测,不是第三方独立验证,看的时候可以打个折。
锐评
Fireworks 跑了一遍 DeepSeek-V4.1-Flash,最亮眼的数据在 DeepSWE 基准上:pass@1 得分 74.34%,跟 GPT-6 Astra 的 74.12% 几乎一样,但每次任务成本 0.43 美元,比 Astra 便宜 15 倍,比 Claude Opus 5 便宜 28 倍。这个基准主要测模型自动修 bug、写代码的能力,所以对做编程助手或自动化开发流程的团队来说,这个性价比很值得关注。
模型本身是 552B 参数的混合专家架构,用了“分体式激活”设计——读入信息时激活 8B 参数,输出时激活 16B 参数,还做了 KV 缓存优化来压延迟。在 Terminal-Bench 2.1 上它比 Astra 低 1 分,但成本只有对方的 1/12。
需要留个心眼:这是 Fireworks 自己发布的评测,不是独立第三方跑出来的。文章提到还测了 HLE 和一个“预言路由器”评估,但没公布具体分数,只说结果“有意思”。这种选择性披露让人没法判断模型在更难的推理任务上到底什么水平。另外,DeepSWE 和 Terminal-Bench 都是相对窄的代码场景,不代表它在通用对话、长文本理解或事实准确性上也能打平 Astra。
HKR 分解
hook ✓knowledge ✓resonance ✓