FEATUREDHacker News 首页· rssEN02:18 · 07·28
花 500 美元微调一个 9B 开源模型,在商品目录审核上干掉了顶尖闭源模型
Fermisense 用 GRPO 强化学习微调了一个 9B 开源模型做商品目录审核,质量得分达到 87.3%,而他们测试的最强闭源模型组合只拿到 76.9%。成本差距更夸张:微调模型审一千条商品只要 0.5 美元,闭源方案则要 19 到 172 美元,便宜了 40 到 340 倍。文章管这叫“智能所有权”——拿自己的数据、工具和评分标准训一个专干这活...
#Benchmarking#Fermisense#Ramp#Bridgewater
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
一个 9B 开源模型花 500 美元微调,审商品目录的质量干翻了所有闭源大模型组合,成本只要它们的几十分之一到几百分之一。
锐评
Fermisense 这篇博客的核心结论很直接:用 GRPO 强化学习微调一个 9B 开源模型,专门做商品目录审核,质量得分 87.3%,而他们测试的最强闭源模型组合只有 76.9%。成本差距更夸张,微调模型审一千条商品只要 0.5 美元,闭源方案要 19 到 172 美元,便宜了 40 到 340 倍。文章管这叫“智能所有权”——拿自己的数据、工具和评分标准训一个专干这活的模型,比对着通用大模型反复调提示词更准也更省钱。
不过得注意,这是厂商自己发的技术博客,不是第三方评测。文章没披露测试用的商品目录具体长什么样、质量评分标准怎么定的、有没有人工复核,也没说这个 87.3% 的质量分在实际业务里意味着多少人工纠错成本。另外,Ramp 那组“AI 投入前四分之一的公司收入翻倍”的数据,只给了起点和终点的指数曲线,没披露样本量、行业分布和收入基数,相关性不等于因果,这点先别太激动。
还缺什么:微调模型在不同品类、不同语言商品上的泛化能力没提;GRPO 训练的具体配置和超参没给;和最近其他小模型微调方案的横向对比也没有。如果这些缺口能补上,这个“500 美元干翻闭源”的故事会更有说服力。
HKR 分解
hook ✓knowledge ✓resonance ✓