FEATUREDHacker News 首页· rssEN21:20 · 09·03
Claude Code、Codex 和 Cursor 写代码时爱装什么工具?我们跑了近 1.7 万次实测
Armature 在 75 个代码库里模拟了四种程序员(从完全不懂代码的“感觉流”到企业级老手),让三个主流编程智能体实际动手装工具、写代码,总共跑了 16,893 次。结果发现,一旦在流程里加一个“模拟人类”来打断和确认,智能体的选择就会变:比如在对象存储上,Cloudflare R2 开始反超 Amazon S3;数据库方面,Neon 被反复推荐。...
#Benchmarking#Armature#Claude Code#Codex
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Armature 模拟四种程序员跑了近 1.7 万次实验,发现加一个“人类确认”环节后,智能体选工具的结果会变,比如 Cloudflare R2 开始反超 Amazon S3。
锐评
这篇研究最值得看的是实验设计:他们没让智能体只给推荐列表,而是真的在 75 个代码库里动手装工具、写代码,跑了 16,893 次完整会话。四种模拟身份从“感觉流”到企业老手,覆盖了 1,163 种提示词变体,这比单纯比榜单要扎实。
一个反直觉的发现是,一旦在流程里加一个“模拟人类”来打断和确认,智能体的选择就会变。比如对象存储上,Cloudflare R2 开始反超 Amazon S3;数据库方面,Neon 被反复推荐。这说明工具厂商想被智能体选中,光靠技术文档可能不够,还得考虑智能体在交互中如何“说服”人类用户。
不过文章正文在数据库部分就截断了,没展开其他工具类别。Armature 自己卖开发者工具增长服务,这个利益相关要先打个折。另外,实验用的代码库是合成生成的,虽然模拟了真实 git 历史和 lockfile,但和真实生产环境的复杂度仍有差距。
HKR 分解
hook ✓knowledge ✓resonance ✓