FEATURED新智元 · 公众号· rssZH05:46 · 06·06
Anthropic 花 280 美元一单,请 1000 名工程师给 Claude 的代码打分
Anthropic 通过 Snorkel 的 Marlin 项目招募了约 1000 名软件工程师,专门审查 Claude 写的代码。每完成一单任务给 280 美元,工作流包括在 GitHub 仓库里提 Pull Request、对 AI 生成的两版代码做 A/B 对比,然后从正确性、安全性、可靠性和可维护性四个维度打分。正文没披露这些工程师的资历门槛、...
#Agent#Code#Benchmarking#Anthropic
精选理由
精选 · 重要度 74 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 花 280 美元一单请工程师给 Claude 的代码挑刺,但正文没披露工程师的资历门槛,这个价格能请到什么水平的 reviewer 要打个问号。
锐评
Anthropic 通过 Snorkel 的 Marlin 项目招募了约 1000 名软件工程师,专门审查 Claude 写的代码。每完成一单给 280 美元,工作流是在 GitHub 仓库里提 Pull Request,对 AI 生成的两版代码做 A/B 对比,然后从正确性、安全性、可靠性和可维护性四个维度打分。这个做法本质上是用人工反馈来校准代码生成质量,比单纯跑基准测试更贴近真实开发场景。
但正文没披露这些工程师的资历门槛、审查标准的具体细则,也没说 280 美元一单对应多大规模的代码审查任务。如果只是看几十行代码,这个单价不低;如果要审一个完整模块,那可能请不到足够资深的工程师。另外,1000 人的规模听起来不小,但分散到不同语言和框架上,每个细分领域的样本量可能很有限。
还缺一个关键信息:这些人工评分最终怎么反馈到模型训练里,是直接做偏好对齐还是只当评估数据用。如果是前者,标注质量会直接影响模型行为;如果是后者,那更像是一次大规模的用户调研。
HKR 分解
hook ✓knowledge ✓resonance ✓