2026年9月22日、Hugging Faceは公式ブログで、transformersがGGUF量子化モデルを直接読み込めるようになったと発表した。ノートPCでモデルを動かす人にとっては、見慣れたfrom_pretrainedの呼び出し一つで済むということだ。transformersとllama.cppの二つのツールチェインを行き来する必要はもうない。
これまで何が面倒だったのか
GGUFはllama.cppエコシステムの量子化モデル形式で、コミュニティで公開されている量子化ウェイトの大多数はGGUFファイルだ。transformersユーザーがそれらを使いたい場合、自分で形式変換するか、llama.cppの推論フローを別途立ち上げるしかなかった。どちらもスマートとは言いがたい。変換には精度と互換性のリスクがつきまとい、別フローは依存関係もAPIも二重になる。
今回どう解決したのか
ポイントは、Hugging Faceが車輪の再発明をしなかったことだ。目標は「llama.cppに迫る性能」と明言され、llama.cppのggmlカーネルそのものを(kernelsライブラリ経由で)再利用し、generate段階のオーバーヘッドを削減することで実現している。ブログではさらに、transformers serveがGGUFモデルをOpenAI互換APIで公開できるようになり、JanやPiのようなデスクトップ推論クライアントが直接接続できるとしている。公式の例はQwen3.5-4B。BF16精度で8.42GBのファイルが、Q4_K_Mでは2.74GBまで縮む。これこそGGUFが存在する理由だ。ノートPCのメモリに入りきらないモデルを、動くサイズに変える。
今すぐ使える人、もう少し待つべき人
初期の最適化はApple Siliconに集中しており、ggmlのMetalカーネルでスループットを測定。テスト機は32GBユニファイドメモリのMacBook Pro M2 Maxだ。Macユーザーが最初の受益者になる。CUDAやCPUについては同等に詳しい数値がまだ公開されておらず、速度を極めたい人は様子見が無難だ。もう一つ注意点。量子化自体にも代償がある。Q4_K_Mのような4ビット量子化では精度が落ちる。2.74GBのファイルと8.42GBのオリジナルは別物であり、選定はファイルサイズだけで判断すべきではない。