FEATUREDr/LocalLLaMA· rssEN22:25 · 05·13
双卡 RTX 3090 跑 Qwen 3.6 27B:48G 显存、26 万上下文窗口,生成速度 113 token/秒
一位 Reddit 用户用两张 RTX 3090 在 Ubuntu 上跑 Qwen 3.6 27B 模型,没上 NVLink。处理长文本时每秒能啃 4000 个 token,生成回答的速度是每秒 113 个 token。这个速度日常聊天或做文档处理都够用。不过帖子正文被 Reddit 的安全策略挡了,看不到具体配置细节,比如用的是哪个量化版本、功耗和温...
#Code#Tools#Inference-opt#Qwen
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
双 3090 跑 Qwen 27B,生成 113 token/秒,日常够用。但帖子被 Reddit 挡了,量化版本和功耗都没说,别急着抄作业。
锐评
这条帖子展示了一个挺实在的本地部署方案:用两张 RTX 3090 显卡,总共 48G 显存,跑通 Qwen 3.6 27B 模型,没用到 NVLink 桥接器。处理长文本时每秒能啃 4000 个 token,生成回答的速度是每秒 113 个 token。这个速度对于日常聊天、文档处理来说完全够用,说明消费级显卡堆显存跑大模型这条路确实走得通。
但信息缺口也很明显。帖子正文被 Reddit 的安全策略挡了,我们看不到具体配置细节。最关键的是不知道用了什么量化版本——是 4-bit 还是 8-bit,这直接影响模型效果和显存占用。另外功耗、温度、双卡负载均衡这些实际部署中很要命的数据也没披露。如果是 4-bit 量化跑出这个速度,那效果可能打折;如果是全精度,那 48G 显存可能不够塞 27B 模型加长上下文。
还缺一个关键对比:单张 3090 跑同级别模型是什么表现?如果双卡只是勉强跑通,而单卡跑小一号模型速度更快,那性价比就要重新算了。
HKR 分解
hook ✓knowledge ✓resonance ✓