FEATUREDAI 群聊日报· atomZH07:39 · 06·23
Anthropic 40 万条编程会话报告:管理者成功率超工程师;Gemini 3.5 Flash 输出截断根因是思考独白吃光 token
Anthropic 分析了约 40 万条 Claude Code 真实会话,发现管理者在需要 git commit、PR 合并、测试通过等硬证据的“已验证成功”指标上得分最高,超过软件工程师。群里指出这有明显选择偏差——管理者只管灵光一现,不管边界情况死活。Sakana AI 发布多模型编排产品 Fugu,SWE Bench Pro 得分 73.7,特...
#Anthropic#Claude Code#Sakana AI
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
管理者用AI写代码得分比程序员高?别急着信,他们只管灵光一现,边界情况炸了不用自己修。
锐评
这条日报信息量很大,但最值得点开的是Anthropic那篇报告。它基于40万条真实会话,发现管理者在需要硬证据的“已验证成功”指标上得分最高。群里一眼看穿选择偏差:管理者只追求那个“啊哈时刻”,不用管代码在极端情况下的死活。这个判断很关键,直接点出了这类统计的软肋——成功怎么定义,谁为失败兜底。
实操部分,Gemini 3.5 Flash输出截断的根因被挖出来了:是模型内部的思考独白吃光了token,导致正文没地方写。调大输出限制能缓解,但成本会涨到跟Pro差不多,而且还不稳定。这点对正在用Gemini干活的人很有用,能少踩一个坑。
Sakana AI的Fugu产品特意标注“不受美国出口管制”,摆明了要吃地缘政治的红利。OpenCode的数据面板也很有意思,日活13.6万,模型份额清一色国产,DeepSeek占了53.6%。这俩信息放一起看,能感觉到模型市场的分化正在加速。不过,Fugu的benchmark分数和实际交付之间还有多大距离,正文没细说,这点得留个心眼。
HKR 分解
hook ✓knowledge ✓resonance ✓