Anthropic CI 团队工程师写了个 agent,让 Claude Tag 自动响应 CI/CD 流水线失败。设计思路是用 Claude 做故障初筛(triage),减少人工值班负担。但正文没披露具体架构、延迟或成功率,所以这点先别太激动——不知道它多快、多准,也不知道成本。
#Agent#Anthropic#Claude Tag
一句话点评
Anthropic CI 团队用 Claude Tag 写了个 agent,自动响应 CI/CD 流水线故障,做初筛(triage)来减少人工值班负担。思路挺实用:让模型进业务流程干活,先判断问题归属。但正文没披露具体架构、延迟或成功率,所以这点先别太激动——不知道它多快、多准,也不知道成本。如果是真的挺省钱,但缺验证数据,建议观望。
Google AI 工程师 Katie McLaughlin 开了一个系列博客,讲怎么用开源框架(Inspect AI、Harbor)给 agent 技能做客观评测。这篇是开篇,重点在流程——跑一个 codelab 里的 benchmark 脚本,然后用 Google Sheets 和 Data Studio 做可视化看趋势,并没有给出具体的评测结果。...
#Google AI#Katie McLaughlin#Inspect AI
一句话点评
Google AI 工程师开了一个系列博客,讲怎么用开源框架(Inspect AI、Harbor)给 agent 技能做客观评测。这篇是开篇,重点在流程——跑 benchmark 脚本,然后用 Google Sheets 和 Data Studio 做可视化看趋势。没有给出具体的评测结果,适合想自己搭评测管线的团队参考,但别指望有现成结论。