FEATUREDAI HOT 精选· aihot-apiZH00:00 · 09·22
Hugging Face 的 transformers 现在能直接加载 GGUF 量化模型了,本地跑的速度接近 llama.cpp
transformers 开始原生支持 GGUF 文件,你可以直接用 from_pretrained 加载一个 GGUF 模型,在本地跑起来。GGUF 是 llama.cpp 社区常用的模型压缩格式,能把模型体积压到适合笔记本内存的大小,代价是牺牲一点精度。这次更新背后复用了 llama.cpp 的 ggml 底层计算核心,优先在苹果芯片上做了优化,所...
#Hugging Face#llama.cpp#ggml
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Hugging Face 的 transformers 现在能直接加载 GGUF 压缩模型了,Mac 上跑大模型的门槛又低了一截。
锐评
这条更新对想在笔记本上跑大模型的人来说是个实在的好消息。以前你要用 GGUF 这种压缩格式(把模型体积压小,适合本地跑,代价是损失一点精度),基本得靠 llama.cpp 生态。现在 transformers 直接支持 `from_pretrained` 加载 GGUF 文件,底层复用了 llama.cpp 的 ggml 计算核心,优先在苹果芯片上做了优化。官方给的初步测试说推理速度接近原版 llama.cpp,这意味着你不用离开熟悉的 transformers 接口就能享受差不多的性能。
不过现在支持还很早期。正文明确说目前只支持 Qwen3.5 这一种模型架构,其他模型还得等。另外,虽然速度接近,但具体差多少、在非苹果设备上表现如何,文章没给详细数据。这点先别太激动,等更多模型适配和跨平台基准测试出来再看。
HKR 分解
hook ✓knowledge ✓resonance ✓