FEATUREDr/LocalLLaMA· rssEN17:34 · 09·06
Qwen 3.8-27B 的 4-bit 量化版调两个参数后,跑分反超 Q5 量化并逼近官方满血版
一位老哥在 5090 上对比了 Qwen 3.8-27B 的两种本地运行方式:用 NInfer 跑的 NVFP4(4-bit 量化)和用 llama.cpp 跑的 Q5_K_M。一开始用默认采样参数(temp=1.0, min_p=0.0)跑 IFBench 指令遵循测试,Q5 严格分 76% 略高于 NVFP4 的 74%。但他发现 NVFP4 的宽...
#Benchmarking#Qwen#NInfer#Unsloth
精选理由
精选 · 重要度 72 · 吸引力 + 知识量 + 共鸣
一句话点评
NVFP4 4-bit 量化跑 Qwen 3.8-27B,改两个采样参数后指令遵循得分反超 Q5_K_M,甚至摸到 BF16 水平,速度还快近 3 倍。
锐评
这条发现挺反直觉的:4-bit 量化模型在默认采样下看起来比 Q5 差,但问题出在采样太“吵”,导致格式小毛病多,而不是模型笨。作者把温度从 1.0 降到 0.9,min_p 从 0 提到 0.05,NVFP4 的严格指令遵循得分直接从 74% 跳到 80%,而 Q5_K_M 纹丝不动停在 76%。这说明 Q5 的错是真错,NVFP4 的错是能修好的格式漂移。
不过得先打个折。作者只测了 50 个样本,官方 BF16 跑 300 个样本是 79.5%,他本地 80% 的成绩有样本波动,不能直接说 4-bit 超越了全精度。但能逼近到这种程度,同时显存占用大降、速度翻近三倍,对本地跑大模型的用户来说很实用。
正文没披露 Q5_K_M 的具体量化细节和显存占用对比,也没说这套采样参数在其他任务上是否同样有效。如果只测了指令遵循这一个维度,结论的普适性还得再验证。
HKR 分解
hook ✓knowledge ✓resonance ✓