Le 13 novembre 2025, OpenAI a publié une recherche et un article intitulés « Comprendre les réseaux neuronaux à travers des circuits clairsemés », proposant d’améliorer l’interprétabilité mécanique des réseaux neuronaux grâce à des « transformateurs à poids clair ». Contrairement à la « désintrication » dans les réseaux denses a posteriori, ce travail contraint directement la grande majorité des poids à zéro pendant la phase d’entraînement, de sorte que chaque neurone n’est connecté qu’à un petit nombre de canaux, encourageant ainsi le modèle à former des circuits clairsemés avec des structures claires. L’équipe de recherche a vérifié sur un ensemble de tâches simples conçues à la main et a constaté que dans ces modèles clairsemés, des circuits de petite taille, de structures complètes et suffisantes pour accomplir des tâches peuvent être élagués, et les nœuds de ces circuits correspondent souvent à des concepts intuitifs, tels que « détecter le type de guillemets au début de la chaîne ».
L’article montre que sous la même perte de pré-entraînement, l’échelle du plus petit circuit nécessaire pour accomplir la même tâche dans le modèle à faible poids peut être réduite de plus d’un ordre de grandeur par rapport au modèle dense, ce qui indique que son calcul interne est plus « désassemblé ». Dans le même temps, le long de la courbe « rareté-capacité », l’augmentation de la parcimonie sacrifiera une certaine capacité mais améliorera l’interprétabilité, tandis que l’augmentation du nombre total de paramètres tout en maintenant la parcimonie peut favoriser le mouvement global de la limite « capacité-explicabilité » dans une direction favorable. L’étude montre également quelques exemples de circuits aux comportements plus complexes, tels que la liaison de variables, qui sont difficiles à expliquer complètement, mais qui peuvent tout de même donner une description structurelle prédictive du comportement du modèle.
OpenAI positionne ce travail comme un premier pas vers des modèles de grande taille plus explicables, admettant que le modèle actuel à faible poids est beaucoup plus petit que celui des systèmes de pointe, et que l’efficacité de la formation et du déploiement est nettement inférieure, de sorte qu’il est peu probable qu’il devienne directement le modèle de production le plus solide. L’équipe a proposé deux voies de suivi : premièrement, continuer à étendre l’échelle des modèles clairsemés, enrichir la bibliothèque de modèles de circuits et jeter les bases de la compréhension de comportements de raisonnement plus complexes ; La seconde consiste à essayer d’extraire le circuit épars du modèle dense existant, et à aligner le modèle épars avec la représentation du modèle original grâce à la méthode du « pontage », devenant ainsi un substitut approximatif interprétable. OpenAI fournit également des poids de modèles clairsemés, des circuits d’élagage et du code de visualisation, fournissant une base pour la reproduction ultérieure et la recherche d’expansion.
Q
: Que signifie exactement un « circuit épars » ?
R : Dans ce travail, un « circuit épars » fait référence au plus petit sous-réseau élagué à partir d’un transformateur épars pondéré, qui contient un petit nombre de nœuds et de connexions nécessaires et suffisants pour accomplir une tâche spécifique. Les nœuds peuvent être des neurones individuels, des canaux d’en-tête d’attention ou des canaux résiduels, avec des bords correspondant à des poids non nuls.
Q : En quoi cela diffère-t-il de ce que l’on appelle communément « l’IA explicable » ?
R : Les méthodes interprétables courantes sont principalement des post-analyses d’entrées, de sorties ou d’activations intermédiaires, mais ici elles relèvent de l’interprétabilité mécanique, et l’objectif est d’inverser autant que possible l'« algorithme » mis en œuvre par le modèle au niveau inférieur. En forçant la parcimonie et l’élagage, cette étude donne des circuits spécifiques qui peuvent être dessinés dans un schéma complet et retracer le flux d’informations étape par étape.
Q : Ces résultats peuvent-ils être directement généralisés aux grands modèles de niveau GPT ?
R : L’article souligne clairement que le modèle clairsemé actuel ne comporte que des dizaines de millions de paramètres non nuls, ce qui est encore loin de l’échelle et de la capacité des grands modèles de pointe, et que l’entraînement clairsemé n’est pas rentable en termes de puissance de calcul et d’efficacité, de sorte qu’on ne peut pas affirmer que la même méthode est tout aussi efficace sur des modèles plus grands et plus forts. Les auteurs la positionnent comme une exploration « prometteuse mais précoce ».
Q : Pourquoi sacrifier la capacité à l’explicabilité ?
R : Dans les scénarios de déploiement sécurisés et fiables, il existe un risque que le modèle à haute capacité totalement opaque soit difficile à avertir et à corriger. En augmentant la parcimonie, il est possible d’échanger des circuits plus petits et plus clairs pour une analyse plus facile des mécanismes de comportement potentiellement nuisible, ce qui fournit à son tour des indices pour l’examen, le débogage et l’alignement de modèles plus forts, ce qui est une idée qui « réserve de l’espace » de manière proactive pour l’interprétabilité pendant l’entraînement.
Q : Les chercheurs ordinaires peuvent-ils reproduire ou continuer à faire des expériences basées sur ce travail ?
R : OpenAI fournit les poids de tous les modèles épars, des circuits élagués et des liens vers le référentiel de code de visualisation de circuits dans la pièce jointe du document, ce qui aide les équipes externes à reproduire des expériences, à tester plus de tâches ou à explorer des modèles de comportement de niveau supérieur, fournissant ainsi une plate-forme expérimentale plus systématique pour la communauté de l’interprétabilité mécaniste.