FEATUREDHacker News 首页· rssEN19:44 · 08·04
DeepGrove 开源 Maple-Preview:一个 20B 参数的三值 MoE 模型,在 iPhone 上跑到 127 tok/s
DeepGrove 放出了一个叫 Maple-Preview 的开源模型,总参数量 200 亿,但每次推理只激活 10 亿参数,权重用的还是三值(-1, 0, 1),所以模型文件只有 5.31 GB。它在 M4 Mac mini 上能跑到每秒 218 个 token,在 iPhone 上跑到 127 tok/s,比 1-bit 的 Bonsai 27B...
#Reasoning#DeepGrove#Maple-Preview#Bonsai 27B
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
一个200亿参数模型在iPhone上每秒跑127个token,靠的是把权重压到三值(-1,0,1),模型文件只有5.31GB。推理速度确实快,但正文没披露训练数据、污染检查和智能体跑分,先当推理专长生看。
锐评
Maple-Preview 最值得看的是它的三值权重设计:总参数200亿,每次推理只激活10亿,权重只有 -1、0、1 三种状态,所以模型文件压缩到了 5.31 GB。在 M4 Mac mini 上跑到每秒 218 个 token,iPhone 上 127 tok/s,比 1-bit 的 Bonsai 27B 快了 13 倍。这个速度对端侧部署确实友好,矩阵乘法可以简化成加法,省算力也省电。
推理成绩方面,它在 IMO 2024 第一题拿了满分 7 分,AIME 等推理基准上跟更大模型有来有回。但 DeepGrove 自己也在文章里说,智能体任务的表现可能跟不上纯推理分数,而且没有给出具体的智能体跑分。这点先别太激动,会做数学题不代表能在业务流程里稳定干活。
另外,正文没提训练数据来源、有没有做污染检查,也没说上下文 131K 在实际长文本任务里表现如何。这些缺口让模型的可复现性和泛化能力打了折扣。整体看,这是一个在端侧推理效率上很有想法的模型,但离“全能端侧助手”还差几项关键验证。
HKR 分解
hook ✓knowledge ✓resonance ✓