FEATUREDr/LocalLLaMA· rssEN00:41 · 05·20
用 4 张老 RTX 2080 Ti 在本地跑 DeepSeek-V4,预填充跑到 255 token/s
一个 Reddit 用户用 4 张 RTX 2080 Ti 显卡(总预算不到 2500 美元)在本地跑起了 DeepSeek-V4-Flash 模型。模型总参数 2840 亿,每次推理激活 130 亿参数。他用了 W8A8 量化(把权重和激活值都压到 8 位精度)来省显存,还自己写了适配老 Turing 架构的 CUDA 算子。机器配了 1TB 的 D...
#Inference-opt#DeepSeek#NVIDIA#Known_Ice9380
精选理由
精选 · 重要度 76 · 吸引力 + 知识量 + 共鸣
一句话点评
4 张老 RTX 2080 Ti 跑 DeepSeek-V4,每秒能吐 255 个 token,总花费不到 2500 美元。但正文被 Reddit 安全策略挡了,看不到具体延迟和量化损失。
锐评
这条帖子的亮点是用 4 张 RTX 2080 Ti 这种老卡,靠 W8A8 量化(把模型权重和计算中间值都压到 8 位精度)和手写的 Turing 架构 CUDA 算子,在本地跑起了 DeepSeek-V4-Flash。2840 亿总参数、每次只激活 130 亿参数的设计本身就省资源,配上 1TB 内存做卸载,255 prefill tok/s 的速度对个人折腾来说相当能打。总预算不到 2500 美元,比一张新旗舰卡还便宜。
但 Reddit 原文被 403 挡了,我们看不到实际推理延迟、量化后回答质量有没有明显下降、多轮对话稳不稳。手写算子虽然能榨性能,但通用性和维护成本是另一回事。这点先别太激动,等有人复现或者原帖主补上完整测试再看。
HKR 分解
hook ✓knowledge ✓resonance ✓