FEATUREDAI HOT 精选· aihot-apiZH00:00 · 05·18
Cursor 发布 Composer 2.5,用文字反馈教模型改掉坏习惯,合成数据规模翻了 25 倍
Cursor 把代码助手 Composer 升级到了 2.5 版,底层还是基于月之暗面的 Kimi K2.5 开源模型。这次主要做了三件事:一是用“文字反馈强化学习”,在模型犯错的地方直接插一句提示(比如“提醒:可用工具有这些”),让模型在那个点上学会纠正,而不是靠最后的总分去猜哪里做错了;二是把合成训练数据的量提到了上一代的 25 倍,并且动态生成更...
#Agent#Code#Fine-tuning#Cursor
精选理由
精选 · 重要度 83 · 吸引力 + 知识量 + 共鸣
一句话点评
Cursor 把代码助手的纠错信号从“最后打分”改成了“犯错当场插提示”,训练数据量翻了 25 倍,但底层模型没换,还是 Kimi K2.5。
锐评
这次 Composer 2.5 的核心变化不是换了个更强的底座模型,而是改了训练方法。他们用了一种叫“文字反馈强化学习”的方式:模型在生成代码的过程中一旦犯错,训练系统会直接在出错的位置插入一句提示,比如“提醒:可用的工具有这些”,让模型在那个点上学会纠正。这比传统方法聪明——以前是看整段输出的最终得分,模型得自己猜哪里做错了,信号很模糊。Cursor 说这能改善长任务里的持续工作能力和指令遵循度,还顺带调了模型的沟通风格和“努力程度”,但这些行为指标没有公开的基准测试可以验证,只能靠用户自己感受。
另一个值得注意的点是合成训练数据量提到了上一代的 25 倍,并且是从真实代码库里动态生成的。这解释了为什么他们敢说模型更“聪明”了——数据规模上去了,覆盖的场景更复杂。但正文没披露具体用了哪些代码库、数据质量怎么控制,也没说这种规模扩张对训练成本的影响有多大。
他们还提到正和 SpaceXAI 一起从头训练一个更大的模型,算力是这次的 10 倍,用了百万张 H100 等效卡。这是个远期饼,现在能用的还是基于 Kimi K2.5 微调出来的版本。如果你期待的是模型架构层面的突破,这次更新可能会让你觉得不够过瘾;但如果你关心的是代码助手在实际项目里能不能少犯低级错误、更听话,这个“当场纠错”的思路值得关注。
HKR 分解
hook ✓knowledge ✓resonance ✓