Retour à Informations sur l’IA
De la boîte noire au schéma : OpenAI améliore l’interprétabilité des réseaux neuronaux avec des transformateurs à faible poids

De la boîte noire au schéma : OpenAI améliore l’interprétabilité des réseaux neuronaux avec des transformateurs à faible poids

Informations sur l’IA Admin 144 vues

Le 13 novembre 2025, OpenAI a publié une recherche et un article intitulés « Comprendre les réseaux neuronaux à travers des circuits clairsemés », proposant d’améliorer l’interprétabilité mécanique des réseaux neuronaux grâce à des « transformateurs à poids clair ». Contrairement à la « désintrication » dans les réseaux denses a posteriori, ce travail contraint directement la grande majorité des poids à zéro pendant la phase d’entraînement, de sorte que chaque neurone n’est connecté qu’à un petit nombre de canaux, encourageant ainsi le modèle à former des circuits clairsemés avec des structures claires. L’équipe de recherche a vérifié sur un ensemble de tâches simples conçues à la main et a constaté que dans ces modèles clairsemés, des circuits de petite taille, de structures complètes et suffisantes pour accomplir des tâches peuvent être élagués, et les nœuds de ces circuits correspondent souvent à des concepts intuitifs, tels que « détecter le type de guillemets au début de la chaîne ».

L’article montre que sous la même perte de pré-entraînement, l’échelle du plus petit circuit nécessaire pour accomplir la même tâche dans le modèle à faible poids peut être réduite de plus d’un ordre de grandeur par rapport au modèle dense, ce qui indique que son calcul interne est plus « désassemblé ». Dans le même temps, le long de la courbe « rareté-capacité », l’augmentation de la parcimonie sacrifiera une certaine capacité mais améliorera l’interprétabilité, tandis que l’augmentation du nombre total de paramètres tout en maintenant la parcimonie peut favoriser le mouvement global de la limite « capacité-explicabilité » dans une direction favorable. L’étude montre également quelques exemples de circuits aux comportements plus complexes, tels que la liaison de variables, qui sont difficiles à expliquer complètement, mais qui peuvent tout de même donner une description structurelle prédictive du comportement du modèle.

OpenAI positionne ce travail comme un premier pas vers des modèles de grande taille plus explicables, admettant que le modèle actuel à faible poids est beaucoup plus petit que celui des systèmes de pointe, et que l’efficacité de la formation et du déploiement est nettement inférieure, de sorte qu’il est peu probable qu’il devienne directement le modèle de production le plus solide. L’équipe a proposé deux voies de suivi : premièrement, continuer à étendre l’échelle des modèles clairsemés, enrichir la bibliothèque de modèles de circuits et jeter les bases de la compréhension de comportements de raisonnement plus complexes ; La seconde consiste à essayer d’extraire le circuit épars du modèle dense existant, et à aligner le modèle épars avec la représentation du modèle original grâce à la méthode du « pontage », devenant ainsi un substitut approximatif interprétable. OpenAI fournit également des poids de modèles clairsemés, des circuits d’élagage et du code de visualisation, fournissant une base pour la reproduction ultérieure et la recherche d’expansion.

Q

: Que signifie exactement un « circuit épars » ?

R : Dans ce travail, un « circuit épars » fait référence au plus petit sous-réseau élagué à partir d’un transformateur épars pondéré, qui contient un petit nombre de nœuds et de connexions nécessaires et suffisants pour accomplir une tâche spécifique. Les nœuds peuvent être des neurones individuels, des canaux d’en-tête d’attention ou des canaux résiduels, avec des bords correspondant à des poids non nuls.

Q : En quoi cela diffère-t-il de ce que l’on appelle communément « l’IA explicable » ?

R : Les méthodes interprétables courantes sont principalement des post-analyses d’entrées, de sorties ou d’activations intermédiaires, mais ici elles relèvent de l’interprétabilité mécanique, et l’objectif est d’inverser autant que possible l'« algorithme » mis en œuvre par le modèle au niveau inférieur. En forçant la parcimonie et l’élagage, cette étude donne des circuits spécifiques qui peuvent être dessinés dans un schéma complet et retracer le flux d’informations étape par étape.

Q : Ces résultats peuvent-ils être directement généralisés aux grands modèles de niveau GPT ?

R : L’article souligne clairement que le modèle clairsemé actuel ne comporte que des dizaines de millions de paramètres non nuls, ce qui est encore loin de l’échelle et de la capacité des grands modèles de pointe, et que l’entraînement clairsemé n’est pas rentable en termes de puissance de calcul et d’efficacité, de sorte qu’on ne peut pas affirmer que la même méthode est tout aussi efficace sur des modèles plus grands et plus forts. Les auteurs la positionnent comme une exploration « prometteuse mais précoce ».

Q : Pourquoi sacrifier la capacité à l’explicabilité ?

R : Dans les scénarios de déploiement sécurisés et fiables, il existe un risque que le modèle à haute capacité totalement opaque soit difficile à avertir et à corriger. En augmentant la parcimonie, il est possible d’échanger des circuits plus petits et plus clairs pour une analyse plus facile des mécanismes de comportement potentiellement nuisible, ce qui fournit à son tour des indices pour l’examen, le débogage et l’alignement de modèles plus forts, ce qui est une idée qui « réserve de l’espace » de manière proactive pour l’interprétabilité pendant l’entraînement.

Q : Les chercheurs ordinaires peuvent-ils reproduire ou continuer à faire des expériences basées sur ce travail ?

R : OpenAI fournit les poids de tous les modèles épars, des circuits élagués et des liens vers le référentiel de code de visualisation de circuits dans la pièce jointe du document, ce qui aide les équipes externes à reproduire des expériences, à tester plus de tâches ou à explorer des modèles de comportement de niveau supérieur, fournissant ainsi une plate-forme expérimentale plus systématique pour la communauté de l’interprétabilité mécaniste.

Recherche sur l’interprétabilité des circuits clairsemés OpenAI Le transformateur peu lourd améliore la compréhension mécanique Analyse de la structure hiérarchique des circuits des réseaux neuronaux clairsemés Une grande parcimonie est obtenue par des poids de contrainte pendant la phase d’entraînement Le circuit minimum disponible est obtenu par élagage dans le modèle clairsemé Les nœuds de circuit clairsemés correspondent à des concepts sémantiques intuitifs Comparaison de la taille minimale du circuit d’un réseau épars avec un modèle dense Courbes de compromis entre la parcimonie et l’interprétabilité de la capacité du modèle Développez le paramètre pour élever la limite à une parcimonie fixe Sparse Transformer révèle la structure du circuit de liaison variable Réduction d’algorithmes de réseaux neuronaux du point de vue de l’interprétabilité mécanique Les circuits épars aident à prédire des modèles de comportement complexes dans les modèles La rareté de l’entraînement sacrifie certaines capacités à la transparence Le mécanisme des comportements potentiellement nuisibles est analysé par des circuits clairsemés Les réseaux de substitution clairsemés alignés sont extraits de modèles denses Le modèle clairsemé est envisagé comme un outil d’audit de sécurité de grand modèle Code de visualisation de circuits clairsemés et poids ressources open source OpenAI comprend de nouvelles voies pour le calcul interne dans les réseaux de neurones Discussion sur les limites de dizaines de millions de modèles épars à paramètres non nuls La méthode des circuits épars peut-elle être généralisée aux grands modèles de niveau GPT ? Conception de modèle à haute interprétabilité pour des déploiements sécurisés Comment l’augmentation de la parcimonie affecte les performances de perte avant l’entraînement Le rôle des têtes d’attention et des canaux résiduels dans les circuits clairsemés Résultats expérimentaux de réseaux épars sur des tâches de synthèse simples La condition que le circuit puisse encore accomplir la tâche de manière indépendante après l’élagage Méthode pratique de traçage de flux d’informations au niveau du schéma de bloc de circuit épars L’explicabilité mécanique diffère de l’IA explicable traditionnelle Le modèle sparse est utilisé pour construire une base de connaissances de modèles de circuits Défis de puissance de calcul causés par un entraînement inefficace et parcimonieux Le modèle épars est aligné sur la représentation d’origine par des méthodes de pontage La compréhension sous-jacente au niveau du circuit requise pour l’alignement de la sécurité LLM Un cas de comportement de liaison variable du point de vue des circuits épars Comment les circuits clairsemés de petit volume améliorent la compréhension intuitive humaine La possibilité d’émergence d’algorithmes est étudiée à l’aide de réseaux clairsemés Les points techniques clés de la conception de l’architecture de transformateur clairsemée parcimonie, explicabilité des capacités et idées d’optimisation complètes Les circuits épars jettent les bases de recherches ultérieures sur les raisonnements complexes Plateforme expérimentale reproductible pour la communauté d’interprétabilité mécaniste Des équipes externes travaillent sur des extensions de circuits clairsemés open source Perspectives d’application des réseaux clairsemés dans des scénarios critiques pour la sécurité Effet des contraintes de parcimonie sur la topologie de la connectivité neuronale Le modèle clairsemé permet de découvrir les circuits de détection de motifs de texte Prédiction et audit du comportement de l’IA basés sur des circuits clairsemés Évaluation du coût et des avantages du déploiement de l’entraînement à l’éparpillement des réseaux La recherche de circuits clairsemés favorise le développement de grands modèles fiables Réduire le risque de modèle de boîte noire grâce à l’analyse au niveau du circuit La voie de recherche à long terme d’OpenAI sur l’interprétabilité mécaniste De nouvelles possibilités de combiner des modèles clairsemés avec des techniques d’alignement Comprendre la représentation interne du modèle de langage du point de vue du circuit Le rôle potentiel de l’approche du circuit épars dans la réglementation future

Outils Recommandés

Plus