ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
transformers 原生支持 GGUF:本地跑量化模型不用再装 llama.cpp

transformers 原生支持 GGUF:本地跑量化模型不用再装 llama.cpp

AI资讯 Admin 2 次浏览

2026 年 9 月 22 日,Hugging Face 在官方博客宣布,transformers 现在可以直接加载 GGUF 量化模型。对习惯在笔记本上跑模型的人来说,这意味着一条熟悉的 from_pretrained 调用就能搞定量化模型,不用再在 transformers 和 llama.cpp 两套工具链之间来回切换。

以前为什么麻烦

GGUF 是 llama.cpp 生态的量化模型格式,社区里绝大多数可下载的量化权重都是 GGUF。transformers 用户想用这些权重,要么自己转换格式,要么另起一套 llama.cpp 的推理流程。两种方案都不优雅:转换有精度和兼容性风险,另起流程则意味着两套依赖、两套 API。

这次是怎么解决的

关键在于 Hugging Face 没有重新造轮子。官方明确表示,性能目标是“接近 llama.cpp”,实现方式是直接复用 llama.cpp 底层的 ggml 内核(经由 kernels 库),并降低 generate 环节的开销。博客还提到,transformers serve 现在可以把 GGUF 模型以 OpenAI 兼容的 API 对外提供服务,Jan、Pi 这类桌面推理客户端可以直接对接。官方给出的例子是 Qwen3.5-4B:BF16 精度下 8.42GB 的文件,量化到 Q4_K_M 后只剩 2.74GB——这就是 GGUF 存在的意义:让装不进笔记本内存的模型变得能跑。

谁现在就能用上,谁还要再等等

初期优化重点放在 Apple Silicon 上,官方用 Metal 内核做了吞吐测试,测试机是 32GB 统一内存的 MacBook Pro M2 Max。Mac 用户是第一波受益者。CUDA 和 CPU 上的表现官方还没有给出同等细致的数据,追求极致速度的人可以先观望。另外要提醒一句:量化本身是有代价的,Q4_K_M 这类 4-bit 量化会损失一定精度,2.74GB 的体积和 8.42GB 的原版不是同一回事,选型时别只看体积。

推荐工具

更多