FEATUREDr/LocalLLaMA· rssEN11:12 · 05·28
一张 RTX 3060 12GB 跑通 Qwen3.6-35B-A3B,128K 上下文生成速度 37 token/秒
用户 old-mike 在一张 RTX 3060 12GB 显卡上,用 spiritbuun 的 llama.cpp 优化分支和 mudler 的 APEX 量化模型,成功跑起了 17.3GB 的 Qwen3.6-35B-A3B。在已填充 72K 上下文时,生成速度达到 37.17 token/秒;上下文塞到 129K 时,速度仍有 28.08 tok...
#Inference-opt#Benchmarking#Qwen#spiritbuun
精选理由
精选 · 重要度 79 · 吸引力 + 知识量 + 共鸣
一句话点评
一张3060 12G跑起17GB的35B模型,72K上下文生成37 token/秒,PPL 3.25。速度亮眼,但这是个人单卡测试,没披露长上下文下的输出质量。
锐评
这条帖子最直接的价值是给了一张消费级显卡跑大模型的实操参考。用户用一张RTX 3060 12GB,通过spiritbuun的llama.cpp优化分支和mudler的APEX量化,把17.3GB的Qwen3.6-35B-A3B模型跑了起来。在已填充72K上下文时,生成速度达到37 token/秒,上下文塞到129K时仍有28 token/秒,PPL 3.25。这个速度对于12GB显存的卡来说相当不错,说明针对CUDA的底层优化和特定的量化格式确实能压榨出更多性能。
不过得给这个结果打个折。首先,这是单次个人测试,没有披露测试用的具体文本类型和生成内容的质量,PPL 3.25也只是在enwik8上的跑分,不代表实际对话或推理任务的表现。其次,帖子提到MTP(多token预测)在这个配置下反而拖慢速度41%,这点挺反直觉,作者自己也解释不清,只猜测是显存布局问题。另外,虽然做了大海捞针测试且100%找回,但用的是学术markdown文本,跟真实场景的乱糟糟文档有差距。
还缺什么?没给功耗、温度数据,也没测更复杂的推理或代码任务。长上下文下的输出一致性、幻觉率都没提。如果你也想在12G卡上跑这个模型,可以参考他的命令行参数,但别指望所有场景都能复现这个速度。
HKR 分解
hook ✓knowledge ✓resonance ✓