FEATUREDComputing Life · Share · 鸭哥调研· rssZH00:00 · 08·16
Google 开源 DiffusionGemma:把 Gemma 4 改成扩散模型,解码飙到 1456 tok/s,但复杂推理掉分明显
Google 把训练好的 Gemma 4 26B-A4B 模型权重直接转成了离散多项式扩散模型,并在 Hugging Face 上开源。它不再从左到右逐个 token 写,而是在 256 个 token 的“画布”里通过多轮去噪并行生成。在单张 H100、FP8、单请求的纯解码测试中,速度达到每秒 1456 个 token,是原自回归模型的 7 倍多,...
#Reasoning#Agent#Code#Google
精选理由
精选 · 重要度 82 · 吸引力 + 知识量 + 共鸣
一句话点评
Google把Gemma 4改成了能并行改稿的扩散模型,单卡H100跑到1456 tok/s,但数学分从88掉到69。速度换质量的账本很清晰。
锐评
这条新闻最值得看的是“用成熟模型直接改生成方式”这条技术路线,终于有了一个完全开源、能直接部署的成品。DiffusionGemma 没从零训练,而是把现成的 Gemma 4 权重,通过离散扩散算法改造成了一个能在 256 个 token 的“草稿区”里反复修改的模型。这就像把一个人从只能顺着往下写的打字员,变成了可以先打草稿再局部润色的编辑。
速度提升很直接:在单张 H100、单请求、FP8 的纯解码测试里,它跑到每秒 1456 个 token,是原版自回归模型的 7 倍多。原理不复杂,它一次前向能同时处理 256 个候选 token,大幅减少了低并发下反复读取显存的带宽浪费。但代价也写在纸面上:AIME 数学推理从 88.3 分掉到 69.1 分,长上下文任务 MRCR 也从 44.1 降到 32.0。好消息是,模型切回自回归模式后分数能恢复到 84.2,说明底子没坏,是扩散生成这个动作本身导致了部分能力损失。
有几个关键信息报告没给:追加训练具体烧了多少算力和绝对 token 数,只说用了不到原训练预算的 10%。另外,首 token 延迟从 53 毫秒涨到 489 毫秒,在高并发下自回归的总吞吐量还会反超。所以这个模型目前最适合低并发、对延迟不那么敏感、但需要高吞吐生成的任务。
HKR 分解
hook ✓knowledge ✓resonance ✓