FEATUREDHacker News 首页· rssEN18:47 · 06·02
微软 MAI-Code-1-Flash 用 50 亿活跃参数在 SWE-Bench Pro 上拿到 51% 的分数
微软新放出的 MAI-Code-1-Flash 是个代码模型,只激活 50 亿参数就在 SWE-Bench Pro(一个让模型修真实 GitHub 问题的测试集)上跑出 51% 的分数。这个成绩放在小模型里算亮眼,但正文没披露它是在什么评测设定下跑的、用了哪些训练数据、什么时候发布,也没说部署条件。所以这个 51% 我先打个折看——不知道是不是挑过题、...
#Code#Benchmarking#Microsoft#Benchmark
精选理由
精选 · 重要度 75 · 吸引力 + 知识量 + 共鸣
一句话点评
微软这个代码模型只激活50亿参数就在SWE-Bench Pro上拿了51%,但正文没披露评测设定、训练数据和部署条件,这个分数我先打个折看。
锐评
微软放出的 MAI-Code-1-Flash 是个代码模型,只激活 50 亿参数就在 SWE-Bench Pro(一个让模型修真实 GitHub 问题的测试集)上跑出 51% 的分数。这个成绩放在小模型里算亮眼,但正文没披露它是在什么评测设定下跑的、用了哪些训练数据、什么时候发布,也没说部署条件。所以这个 51% 我先打个折看——不知道是不是挑过题、有没有用额外的工具辅助,或者测试环境跟别人不一样。
SWE-Bench Pro 本身是个比较硬的代码修复基准,能过一半说明模型在理解 issue、定位代码、生成补丁这条链路上有一定能力。但光一个数字不够,还得看它修的是哪些类型的 bug、修复质量怎么样、有没有反复提交才通过。这些信息目前都缺。
另外,模型只激活 50 亿参数意味着推理成本可能比较低,适合本地跑或者批量处理。但正文完全没提内存占用、推理速度、是否开源、能不能商用,这些才是决定它能不能真用起来的关键。等微软把技术报告或者模型权重放出来再判断不迟。
HKR 分解
hook ✓knowledge ✓resonance ✓