FEATUREDHacker News 首页· rssEN20:59 · 09·16
三元大模型打破 1.58 比特的存储下限:BITCOS 靠利用大量零权重把每权重压到 1.485 比特
三元模型把每个权重存成 -1、0 或 +1,理论上每个权重至少需要约 1.585 比特,实际打包时通常要 1.625 比特。Intel 作者测了 29 个三元大模型,发现零权重占比最高能到 51.5%。他们据此提出 BITCOS,不再用固定打包,而是用一个位图标记哪些位置是零,再单独存非零权重的正负号,这样每权重的存储成本变成 2 减去零权重比例。在 ...
#Inference-opt#Intel#Evangelos Georganas#Alexander Heinecke
精选理由
精选 · 重要度 72 · 吸引力 + 知识量
一句话点评
Intel 发现三元模型里零权重最多占一半,干脆用位图跳过零,把存储压到 1.485 比特,比理论下限还低。
锐评
这条值得看,因为它没改模型,只改了权重怎么存。三元模型每个权重存成 -1、0 或 +1,理论上最少要 1.585 比特,实际打包通常要 1.625 比特。Intel 这帮人测了 29 个三元大模型,发现零权重占比最高能到 51.5%,也就是说一半以上的权重其实不干活。他们提出的 BITCOS 方法很简单:用一个位图标记哪些位置是零,再单独存非零权重的正负号。零越多越省,最稀疏的模型压到了 1.485 比特,比理论下限还低。在 29 个模型里,26 个都比传统打包更省空间。
实际跑起来也有收益。他们在 AVX-512、AVX2 和 Xe2 GPU 上做了优化解包,矩阵向量乘法最快能快 1.28 倍。端到端推理吞吐,CPU 上最高提升 18%,GPU 上最高提升 27%。
不过正文没披露这 29 个模型的名字和参数量,也没说是不是公开可用的。这点先别太激动——如果测的都是小模型或者自己训的,通用性要打折扣。另外,位图解包虽然加速了,但实际部署时内存带宽和缓存命中的影响没细说,这些才是端侧推理的真正瓶颈。
HKR 分解
hook ✓knowledge ✓resonance —