FEATUREDr/LocalLLaMA· rssEN08:17 · 06·01
网友在双 DGX Spark 上跑 DeepSeek V4 Flash:预填充 1680 token/s,解码 39.8 token/s
一位 Reddit 用户用两台华硕 GX10(DGX Spark)组了个小集群,通过 vLLM 加载 DeepSeek-V4-Flash 模型。在 256K 上下文窗口、开启多 token 预测(MTP=2)的设置下,测得预填充速度 1680 token/s,解码速度 39.8 token/s。部署用了张量并行(TP=2),两台机器通过 RoCE 网络...
#Inference-opt#Reasoning#Tools#DeepSeek
精选理由
精选 · 重要度 74 · 吸引力 + 知识量 + 共鸣
一句话点评
两台 DGX Spark 跑 DeepSeek-V4-Flash,解码速度 39.8 token/s,勉强够用但别指望流畅聊天。
锐评
这个测试用两台华硕 GX10(也就是 DGX Spark)组了个小集群,通过 vLLM 加载 DeepSeek-V4-Flash,开了 256K 上下文窗口和多 token 预测(MTP=2,一次猜两个 token 来提速)。预填充速度 1680 token/s 还行,但解码速度只有 39.8 token/s,实际对话时会觉得有点卡。部署用了张量并行(TP=2),两台机器通过 RoCE 网络连接,KV 缓存用 fp8 压缩后能塞下约 100 万 token,这点挺省显存。
不过要注意,这个帖子正文被 Reddit 屏蔽了,我们只能看到摘要里的数字,没法确认测试的具体 prompt、温度参数、是否用了投机解码等细节。39.8 token/s 这个速度是在两台机器上跑出来的,单台会更慢。如果你只有一台 DGX Spark,这个模型可能不太适合实时交互,更适合后台批处理或者跑长文档分析。另外,MTP=2 对解码速度的提升有多大,摘要里也没说清楚,这点先别太激动。
HKR 分解
hook ✓knowledge ✓resonance ✓