r/LocalLLaMA· rssEN06:46 · 07·30
4090 + 5060 Ti + 64GB 内存跑 35B 模型冲到 206 token/s,122B 也有 37 token/s
Reddit 用户晒出本地推理跑分:一张 RTX 4090 加一张 RTX 5060 Ti,配合 64GB 系统内存,跑 35B-A3B 模型达到 206 token/s,122B 模型也有 37 token/s。这个速度对本地部署来说相当亮眼——尤其是 122B 还能跑到 37 token/s,说明异构多卡方案确实能打。不过正文被 Reddit 屏蔽...
#NVIDIA RTX 4090#NVIDIA RTX 5060 Ti#Benchmark
一句话点评
RTX 4090加5060 Ti混插,64GB内存,35B模型跑到206 token/s,122B也有37 token/s——这个速度对本地部署来说很亮眼,说明异构多卡方案确实能打。但正文被Reddit屏蔽,没披露具体模型名、量化精度和推理框架,跑分含金量要打个折。如果是真的,122B跑到37 t/s意味着低成本本地跑大模型又近了一步。
HKR 分解
hook ✓knowledge —resonance —