FEATUREDr/LocalLLaMA· rssEN18:09 · 05·19
英伟达放出 Nemotron-Labs-Diffusion 模型,用扩散解码把 8B 模型跑到 850 tok/s
英伟达发了 Nemotron-Labs-Diffusion 系列,包含 3B、8B 和 14B 三个稠密模型。这组模型同时支持传统的自回归解码和新的扩散并行解码,还带了一种叫 self-speculation 的加速技巧。最抓眼球的是 8B 版本在 GB200 上单并发能跑到每秒 850 个 token,作为对比,同样条件下自回归解码是 253 tok...
#Inference-opt#Multimodal#Vision#NVIDIA
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
英伟达把扩散模型思路搬到大语言模型上,8B模型在GB200上跑到850 tok/s,比传统方式快两倍多,但正文没披露具体任务和精度损失。
锐评
这条消息最值得看的是推理速度。8B模型在GB200上单并发跑到每秒850个token,对比传统自回归解码的253 tok/s,确实快了一大截。他们用的是一种叫扩散并行解码的方法,简单说就是让模型一次生成一整段文本,再逐步修正,而不是一个字一个字往外蹦。还加了个self-speculation技巧,相当于模型自己给自己做推测解码,进一步压榨速度。
但这里有几个信息缺口。正文没说明850 tok/s是在什么任务上测的,是简单对话还是长文生成,也没提输出质量有没有打折。扩散模型在图像生成里很成熟,搬到文本上最大的坑就是连贯性和事实准确性,这两点原文完全没提。另外,测试硬件是GB200,这是英伟达最新的高端卡,普通开发者手里的设备能不能复现这个速度,要打个大问号。
我会先观望。如果后续有独立评测验证精度没塌,这套方法对需要低延迟的场景确实有用。但眼下只能把它当成一个有意思的工程探索,别急着对标生产环境。
HKR 分解
hook ✓knowledge ✓resonance ✓