FEATUREDHacker News 首页· rssEN13:24 · 08·20
DiffusionGemma 技术报告:用离散扩散一次生成 256 个 token,单卡跑到每秒 1500 token
Google 放出了一个实验性的开源模型 DiffusionGemma,它不按传统方式一个字一个字往外蹦,而是每次并行处理并逐步修正一个 256 个 token 的文本块。这带来一个直接好处:在单张 H100 上实测生成速度能达到每秒约 1500 个 token,比用了投机解码的常规自回归模型还快。模型本身不是从头训练的,而是拿 MoE 架构的 Gem...
#Google#DiffusionGemma Team#Gemma 4
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
Google 把 Gemma 改成了并行出字的扩散模型,单卡 H100 跑到每秒 1500 token,但只用了不到 10% 的原始训练数据做微调。
锐评
这条技术报告最值得看的是速度。DiffusionGemma 不按传统自回归模型那样一个字一个字往外蹦,而是每次并行处理并逐步修正一个 256 个 token 的文本块,在单张 H100 上实测跑到每秒约 1500 个 token,比用了投机解码的常规模型还快。模型不是从头训练的,而是拿 MoE 架构的 Gemma 4(激活参数 3.8B,总参数 25.2B)做微调,整个训练只用了原始模型不到 10% 的训练 token 预算,分两步走:先做监督微调让模型学会双向去噪,再用强化学习加采样器蒸馏来同时提质量和推理效率。
我会先打个折:速度数字很漂亮,但这是实验性开源模型,论文没披露它在复杂推理或长文本任务上的具体退化程度,只说自回归解码时会有轻微质量下降。另外,并行生成 256 个 token 的块,在实际应用里怎么处理不同长度的输出、怎么保证连贯性,这些细节正文也没展开。如果是真的省钱又好用,后续得看社区实测和更多消融实验。
HKR 分解
hook ✓knowledge ✓resonance ✓