llama.cpp
讲清 llama.cpp 作为本地推理底座的位置,看 GGUF 与量化如何支撑跨平台运行,并说明它与开箱即用型本地工具各自承接什么任务。
llama.cpp 是本地大模型生态里的开源推理底座,让开发者在 Mac、Linux、Windows、服务器乃至边缘设备上运行量化模型。它支持 GGUF 等本地格式,重视低资源推理、量化与跨平台运行,许多一键跑模型的工具都建立在同类能力之上。它更接近发动机而非整车,代价是命令行、模型格式与硬件加速都要自己调。
讲清 llama.cpp 作为本地推理底座的位置,看 GGUF 与量化如何支撑跨平台运行,并说明它与开箱即用型本地工具各自承接什么任务。
2026 年 9 月 22 日,Hugging Face 在官方博客宣布,transformers 现在可以直接加载 GGUF 量化模型。对习惯在笔记本上跑模型的人来说,这意味着一条熟悉的 from_pretrained 调用就能搞定量化模型,不用再在 transformers 和 llama.cp...
2026 年 9 月 22 日,Hugging Face 在官方博客宣布,transformers 正式支持直接加载 GGUF 量化模型。用户只需在 from_pretrained 里传入 gguf_file 参数,就能把 Hub 上的 GGUF checkpoint 装进熟悉的 transform...
llama.cpp 是本地大模型生态里非常关键的开源推理底座。它不是面向普通用户的聊天产品,而是让开发者在 Mac、Linux、Windows、服务器甚至边缘设备上运行量化模型的底层工具。 官方开源地址 GitHub: https://github.com/ggml-org/llama.cpp 为什...