Le 22 septembre 2026, Hugging Face a annoncé sur son blog officiel que transformers peut désormais charger directement les modèles quantifiés GGUF. Pour qui fait tourner des modèles sur un portable, cela signifie qu'un simple appel familier à from_pretrained suffit – fini les allers-retours entre les chaînes d'outils transformers et llama.cpp.
Pourquoi c'était pénible jusqu'ici
GGUF est le format de modèle quantifié de l'écosystème llama.cpp, et l'écrasante majorité des poids quantifiés téléchargeables dans la communauté sont des fichiers GGUF. Les utilisateurs de transformers qui voulaient les exploiter devaient soit convertir eux-mêmes, soit monter un flux d'inférence llama.cpp séparé. Aucune option n'était élégante : la conversion comporte des risques de précision et de compatibilité, et un second flux signifie dépendances et API en double.
Comment cette version règle le problème
Le point clé : Hugging Face n'a pas réinventé la roue. L'objectif affiché est une performance « proche de llama.cpp », obtenue en réutilisant les noyaux ggml de llama.cpp eux-mêmes (via la bibliothèque kernels) et en réduisant la surcharge de l'étape generate. Le blog précise aussi que transformers serve peut désormais exposer un modèle GGUF via une API compatible OpenAI, si bien que des clients d'inférence de bureau comme Jan ou Pi peuvent s'y connecter directement. L'exemple officiel est Qwen3.5-4B : un fichier de 8,42 Go en précision BF16 tombe à 2,74 Go en Q4_K_M – c'est toute la raison d'être de GGUF : faire tenir dans la mémoire d'un portable un modèle qui n'y rentrait pas.
Qui peut l'utiliser dès maintenant – et qui devrait attendre
La première vague d'optimisation se concentre sur Apple Silicon, avec des tests de débit sur les noyaux Metal de ggml ; la machine de test était un MacBook Pro M2 Max avec 32 Go de mémoire unifiée. Les utilisateurs Mac sont les premiers servis. Aucun chiffre aussi détaillé n'a été publié pour CUDA ou CPU – mieux vaut patienter si l'on vise la vitesse maximale. Un dernier avertissement : la quantification a un coût. Une quantification 4 bits comme Q4_K_M perd en précision – un fichier de 2,74 Go n'est pas la même chose que l'original de 8,42 Go. Choisir un modèle sur sa seule taille de fichier serait une erreur.