ToolNavs Outils IA à découvrir
Proposer Connexion

llama.cpp

Explique la place de llama.cpp comme socle d'inférence locale, comment GGUF et la quantification portent l'exécution multiplateforme, et ce qui sépare son usage de celui d'un outil local prêt à l'emploi.

llama.cpp est le moteur d'inférence open source à la base de l'écosystème LLM local : il exécute des modèles quantifiés sur Mac, Linux, Windows, serveurs et appareils en périphérie. Il prend en charge des formats locaux comme GGUF et privilégie l'inférence à faibles ressources et le multiplateforme, si bien que beaucoup d'outils en un clic s'appuient dessus. C'est un moteur plutôt qu'une voiture finie : ligne de commande, format de modèle et accélération matérielle restent à régler.