ToolNavs Outils IA à découvrir
Proposer Connexion

Compression et quantification de modèles

Les voies vers des modèles plus petits et plus rapides : comment la distillation transfère les capacités, ce qu'apporte réellement la quantification, et où les petits modèles de langage atteignent leurs limites.

Faire tenir un modèle sur un téléphone ou un GPU d'entrée de gamme repose sur trois leviers : la distillation, où un petit réseau imite un grand ; la quantification, qui fait passer les poids à quatre ou huit bits ; et l'élagage, qui supprime les connexions peu utiles. On échange mémoire, latence et énergie contre précision, et la perte est inégale : la génération longue et les mathématiques se dégradent d'abord. Ce tag décrit quand chaque méthode vaut la peine et comment valider le résultat.