FEATUREDr/LocalLLaMA· rssEN20:42 · 05·29
网友实测 Gemma 4 和 Qwen 3.6 的 MTP 加速:vLLM 上推理速度提升 3.34 倍
一位老哥在 RTX PRO 6000 显卡上跑了 MTP(多 token 预测,一次猜好几个词来加速生成)的测试。他用 vLLM 跑 Gemma 4 31B 模型,开了 MTP 后速度从每秒 39.69 个 token 飙到 132.52 个,快了 3.34 倍。测试是跑 10 次、每次生成 1500 个 token 取的结果。不过帖子没提生成质量有没...
#Inference-opt#Benchmarking#vLLM#llama.cpp
精选理由
精选 · 重要度 73 · 吸引力 + 知识量 + 共鸣
一句话点评
老哥实测 MTP 在 RTX PRO 6000 上把 Gemma 4 31B 推理速度从 39.69 tok/s 拉到 132.52 tok/s,快了 3.34 倍,但没提生成质量有没有掉。
锐评
这条帖子最值钱的就是那个 3.34 倍的提速数字。测试环境是 RTX PRO 6000 这张 Blackwell 架构的新卡,用 vLLM 跑 Gemma 4 31B,开了 MTP(多 token 预测,一次猜好几个词来加速生成)后,每秒能吐 132.52 个 token,不开只有 39.69。测试跑了 10 次、每次生成 1500 个 token,样本量不算大但够看个趋势。
不过得打几个折。第一,正文没披露生成质量有没有下降,MTP 猜错词的时候可能会让输出变味,这点他没测。第二,没提显存占用变化,开 MTP 通常要多占显存,对本地跑大模型的人来说这点很关键。第三,帖子只测了 Gemma 4,Qwen 3.6 的数据没放出来,标题里写了但内容缺失。另外原帖被 Reddit 的网络安全拦了,我们只能看到摘要,具体配置和参数细节拿不到。
如果你也在本地跑大模型,这个提速幅度值得跟,但先别急着切生产——等有人补上质量对比和显存数据再说。
HKR 分解
hook ✓knowledge ✓resonance ✓