llama.cpp
llama.cpp がローカル推論の土台としてどの位置にあるかを示し、GGUF と量子化がクロスプラットフォーム動作をどう支えるか、すぐ使えるツールとの役割の違いを整理する。
llama.cpp はローカル LLM 生態系の土台にあるオープンソースの推論エンジンで、Mac、Linux、Windows、サーバー、エッジ端末で量子化モデルを動かす。GGUF などのローカル形式に対応し、低リソース推論とクロスプラットフォーム動作を重視するため、ワンクリックで動くツールの多くが同種の能力に乗っている。完成した車ではなくエンジンであり、コマンドライン、モデル形式、ハードウェア加速は自分で詰める。