FEATUREDAI HOT 精选· aihot-apiZH00:00 · 07·07
NVIDIA 把自回归、扩散和自我推测解码塞进同一个模型:Nemotron-Labs-Diffusion
NVIDIA 这篇论文放出了一个叫 Nemotron-Labs-Diffusion 的模型,一个模型里集成了三种生成方式:逐 token 预测(自回归)、一次性去噪生成整段(扩散),以及让扩散先打草稿、自回归再校验的“自我推测”模式。训练时用了自回归和扩散的联合目标,扩散负责往前多看几步做规划,自回归提供从左到右的语言先验,两者互补。自我推测模式下,扩...
#NVIDIA#Nemotron-Labs-Diffusion#Qwen3-8B
精选理由
精选 · 重要度 72 · 吸引力 + 知识量
一句话点评
NVIDIA 把三种生成方式塞进一个模型,扩散打草稿、自回归校验的“自我推测”模式比主流多 token 预测更快,8B 模型吞吐量是 Qwen3-8B 的 4 倍,但没提开源和发布时间。
锐评
这篇论文放出了一个叫 Nemotron-Labs-Diffusion 的模型,最大卖点是把自回归、扩散和“自我推测解码”三种模式做进了同一个架构里。你可以把它理解成:平时用自回归逐字写,需要快的时候让扩散一次性生成整段草稿,再由自回归校验,相当于自己给自己当校对。训练时两个目标一起上,扩散负责往前多看几步做规划,自回归提供从左到右的语言习惯,两者互补。
数字上,8B 版本一次前向传播能解码的 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上用 SGLang 跑 SPEED-Bench 吞吐量高出 4 倍,精度还差不多。论文还做了一个“光速分析”,说在理想采样器下扩散比自我推测模式还能再多出 76.5% 的 token 产出,说明天花板还没到。模型覆盖 3B、8B、14B 三个尺寸,有基础版、指令版和视觉语言版。
不过这篇是纯论文,正文没披露任何开源权重计划或发布时间线。所有性能数据都来自论文自报,没有第三方复现验证。如果是真的,这个吞吐提升挺省钱,但在看到实际跑分和开放模型之前,我会先打个折。
HKR 分解
hook ✓knowledge ✓resonance —