llama.cpp
Explique la place de llama.cpp comme socle d'inférence locale, comment GGUF et la quantification portent l'exécution multiplateforme, et ce qui sépare son usage de celui d'un outil local prêt à l'emploi.
llama.cpp est le moteur d'inférence open source à la base de l'écosystème LLM local : il exécute des modèles quantifiés sur Mac, Linux, Windows, serveurs et appareils en périphérie. Il prend en charge des formats locaux comme GGUF et privilégie l'inférence à faibles ressources et le multiplateforme, si bien que beaucoup d'outils en un clic s'appuient dessus. C'est un moteur plutôt qu'une voiture finie : ligne de commande, format de modèle et accélération matérielle restent à régler.