FEATUREDHacker News 首页· rssEN11:12 · 09·03
陈大年带着 27B 本地模型杀回来了,在信通院 MCP 评测里只比 DeepSeek-V4-Pro 低 1.3 分
陈大年复出创办了 StartLux,第一款模型 StartLux-V1.0-27B-Preview 只有 270 亿参数,能直接在消费级电脑上跑,不用联网。在信通院 MCP 专项评测里,它综合得分 39.25%,排第二,比 1.6 万亿参数的 DeepSeek-V4-Pro 只差 1.3 个百分点,还在位置导航、金融分析和浏览器自动化三个单项拿了第一。...
#Agent#StartLux#Chen Danian#DeepSeek
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
陈大年带了个27B小模型回来,在信通院MCP评测里总分第二,只比1.6万亿参数的DeepSeek-V4-Pro低1.3个百分点,而且能直接在个人电脑上跑。
锐评
这条新闻最值得看的是效率:一个270亿参数的模型,在信通院MCP专项评测里拿了39.25%的综合分,排第二,跟第一名的差距只有1.3个百分点。而第一名是1.6万亿参数的DeepSeek-V4-Pro,参数规模是它的近60倍。在位置导航、金融分析和浏览器自动化三个单项上,StartLux甚至拿了第一。这说明在特定任务上,小模型靠针对性训练确实能打出很高的性价比,不用非得堆参数、上云端。
不过先别太激动。正文只给了两个案例:算微软两年回报时,Claude Sonnet 4.6因为缺原始数据搞错了交易日,StartLux回溯后算对了;让Claude搜航班,它说打不开浏览器。这两个例子更像在展示竞品的短板,而不是StartLux自己的上限。评测总分39.25%本身也不高,说明MCP这类让模型真干活的测试,整体通过率还很低。
陈大年公开说本地模型三年内追上Claude、吃掉80%市场,这个判断目前还缺更多第三方验证和实际部署数据。27B模型在消费级电脑上跑起来到底稳不稳、延迟多少、能覆盖多少真实业务流程,正文都没披露。
HKR 分解
hook ✓knowledge ✓resonance ✓