FEATUREDr/LocalLLaMA· rssEN02:38 · 07·23
有人租了四张 20GB 3080 跑 Qwen3.6-27B 写代码,速度比四张 5060 Ti 还快
作者在 Vast AI 上租了四张 20GB 显存的 RTX 3080,跑 Qwen3.6-27B 模型测代码生成。开了 MTP(多 token 预测)后,在接近 256K 上下文长度时,解码速度跑到每秒 69 个 token;预填充速度掉到每秒 893 个 token,而且测试时没开提示缓存、显卡还锁了功耗,性能可能没跑满。他算了一笔账:二手 308...
#Code#Qwen3.6-27B#NVIDIA RTX 3080 20GB#NVIDIA RTX 5060 Ti
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
四张二手 3080 跑 Qwen3.6-27B 写代码,解码能到 69 token/秒,比四张 5060 Ti 还快。但作者没测代码准确率,速度好不等于代码质量好,这点先别太激动。
锐评
作者在 Vast AI 上租了四张 20GB 显存的 RTX 3080,跑 Qwen3.6-27B 测代码生成速度。开了 MTP(一次预测多个 token)后,在接近 256K 上下文长度时,解码速度跑到每秒 69 个 token,比四张 5060 Ti 还快。预填充速度掉到每秒 893 个 token,而且测试时没开提示缓存、显卡还锁了功耗,实际性能可能更高。
他算了一笔账:二手 3080 约 400 美元一张,X99 主板加 CPU 加 64GB 内存约 275 美元,整机不到 2000 美元就能跑轻量量化的密集模型。这个价格确实香,但正文没披露任何代码准确率或基准测试分数,只测了速度。速度好不代表生成的代码能用,这点是最大的信息缺口。
另外,测试在云租用环境跑,不是自组机器,散热、稳定性、长期满载表现都没提。如果你真想照这个配置攒一台,还得自己验证准确率和实际部署的坑。
HKR 分解
hook ✓knowledge ✓resonance ✓