FEATUREDHacker News 首页· rssEN04:49 · 07·28
Fermion 发布 Neutrino-1 8B:一个 3.88 GB 的模型文件,能在 H100、L4 和 MacBook 上直接跑
Fermion Research 放出了一个叫 Neutrino-1 8B 的模型,参数量 81.9 亿,但整个模型文件只有 3.88 GB,是常规 fp16 格式的八分之一大小。它把模型里 252 个线性层的权重用一种他们自研的“三值家族”格式压缩存储,用的时候在计算核心里直接解码,全程不产生 fp16 或 fp32 的权重数据。这么小的体积直接改变...
#Fermion Research#Alibaba Cloud#Qwen3-8B
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
一个8B模型压缩到3.88GB,H100上能跑763 tok/s,M5 MacBook也能跑33.7 tok/s,但正文没披露训练数据和压缩方法细节,这点先别太激动。
锐评
Fermion Research 放出的 Neutrino-1 8B 最直接的价值是让大模型跑在了更便宜的硬件上。它把81.9亿参数模型里252个线性层的权重,用一种自研的“三值家族”格式压缩存储,整个模型文件只有3.88GB,是常规fp16格式的八分之一。这意味着它可以直接塞进8GB显存的GPU或16GB内存的笔记本里,不用再为跑一个8B模型专门上大显存卡。
速度数据挺亮眼:H100上普通解码396 tok/s,投机解码能冲到763 tok/s;M5 MacBook用MLX跑33.7 tok/s,纯CPU也有24.9 tok/s。单流解码的瓶颈本来就是每生成一个token要搬运多少数据,3.88GB的工作集天然比16GB的fp16模型快。模型基于阿里的Qwen3-8B,用了Apache-2.0协议,MMLU 5-shot得分72.1。
但要注意,官方博文没提训练数据来源和具体的压缩训练方法,只说了“三值家族格式”和“在计算核心里直接解码”。压缩后62.63%的权重为零,正负权重几乎完美对称,这个结果是怎么训出来的、有没有精度损失、在其他基准上的表现如何,正文都没披露。想在生产环境用的话,这些信息缺口得先补上。
HKR 分解
hook ✓knowledge ✓resonance ✓