FEATUREDAI HOT 精选· aihot-apiZH14:36 · 05·22
首个在华为昇腾910B上全栈训练的1.58比特开源模型BitCPM-CANN发布
ModelBest、清华和OpenBMB搞了个BitCPM-CANN,从0.5B到8B都有,全程用华为昇腾910B NPU训练,没走英伟达路线。1.58比特三元量化意味着每个权重只取三种值,内存比BF16省了约6倍,能塞进手机、电脑和车载设备里跑。基准测试成绩保住了全精度模型的95-97%,这点挺实在。我会先打个折:正文没披露具体推理延迟和功耗数据,也...
#Inference-opt#Benchmarking#ModelBest#Tsinghua University
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
首个用华为昇腾910B全栈训练的1.58比特开源模型,内存省了约6倍,基准保住95-97%。但没给推理延迟和功耗,先别急着喊落地。
锐评
这条消息的看点不是1.58比特量化本身——三元权重(每个参数只取-1、0、+1三种值)在学术圈不算新——而是整个训练栈都跑在华为昇腾910B NPU上,从量化算子到框架都是原生构建,没走英伟达CUDA生态的移植路线。这对国内算力自主可控的叙事有直接支撑。模型家族覆盖0.5B到8B,内存比BF16省了约6倍,塞进手机、车载设备跑确实有想象空间。基准测试保住了全精度模型的95-97%,这个数字看着不错,但正文没披露具体用了哪些benchmark、对比的baseline是什么版本,也没给推理延迟和端侧功耗数据。1.58比特模型在边缘设备上跑得快不快、烫不烫手,才是工程落地要回答的核心问题。另外,训练数据来源、清洗流程和许可证也没提,开源了代码和权重,但复现链条还不完整。整体看,这是一次硬件生态+模型架构的联合站队,技术验证意义大于即战力。
HKR 分解
hook ✓knowledge ✓resonance ✓