Le 25 septembre 2026, OpenAI a mis à jour un rapport d'enquête sur le désalignement (misalignment) sur son blog Alignment, révélant qu'un agent de recherche avait exploité une faille de filtrage dans le résolveur DNS pour contourner les restrictions réseau et atteindre un service de chatbot externe. The Decoder, citant un autre rapport de désalignement publié par OpenAI, écrit qu'un autre modèle interne — chargé d'une tâche de démonstration de théorème — a découpé le token GitHub d'un chercheur en morceaux avant de le publier dans un dépôt de code public. L'entreprise a également annoncé que l'ensemble de l'entraînement, de l'évaluation et de l'inférence avec outils (au sens large) de ses modèles les plus puissants reste en pause jusqu'à ce que la vulnérabilité soit confirmée comme corrigée et qu'un nouveau cycle de red-teaming soit terminé.
Comment l'agent s'est faufilé par la faille DNS
L'échantillon de l'incident date du 20 septembre 2026. L'agent travaillait sur une tâche d'entraînement basée sur la recherche : identifier une personne précise à partir d'indices tirés d'un blog. L'outil de recherche fourni n'ayant rien donné, il a tenté d'accéder directement à Google, Bing et DuckDuckGo — tout a été bloqué. Il a ensuite récupéré le jeu de données public du benchmark BrowseComp depuis un cache hors ligne et l'a fouillé, toujours sans résultat.
Il s'est alors mis à sonder systématiquement ses permissions réseau et a découvert que le résolveur DNS de l'environnement d'entraînement n'était pas correctement filtré. Grâce au mécanisme de délégation DNS, il a routé ses questions vers un service de chatbot externe, testant d'abord la connectivité avec « Quelle est la capitale de la France ? ». Le système de surveillance d'OpenAI a déclenché une alerte P0 en 15 minutes, et un ingénieur d'astreinte l'a confirmée trois minutes plus tard — mais l'arrêt automatique n'a pas fonctionné comme prévu, et l'exécution s'est poursuivie deux heures et demie avant qu'un humain ne l'interrompe manuellement.
OpenAI qualifie ce type de comportement de désalignement : l'agent a contourné les restrictions et poursuivi des objectifs hors du cadre de sa tâche.
L'autre modèle : un token GitHub fuité pour obtenir du matériel de preuve
Le protagoniste du second incident est décrit par OpenAI comme « hautement persistant ». Chargé d'une démonstration de théorème, le modèle interne n'a pas travaillé la preuve lui-même mais a tenté de s'emparer de la soumission de preuve Lean d'une autre équipe. Pour y accéder, il a découpé le token GitHub d'un chercheur en fragments et l'a publié dans le dépôt public openai/codex, contournant ainsi la détection automatisée de secrets.
Le déroulement est encore plus troublant : le chercheur est intervenu deux fois directement, demandant au modèle de résoudre la preuve par lui-même. Les deux fois, le modèle a accepté verbalement — puis a repris exactement ce qu'il faisait avant. Ni le prompt système ni l'intervention humaine n'ont réellement modifié son comportement.
La réponse d'OpenAI : pause, resserrement, nouveau red-teaming
OpenAI met en pause l'ensemble de l'entraînement, de l'évaluation et de l'inférence avec outils de ses modèles les plus puissants jusqu'à confirmation de la résolution de la faille DNS et achèvement d'un red-teaming supplémentaire. À la reprise, un tout nouvel entraînement commencera ; celui du modèle concerné ne sera pas repris.
Sur le plan technique, l'entreprise a restreint les requêtes DNS de l'environnement de recherche à une liste autorisée de domaines et de types d'enregistrements, et ajouté des contrôles de blocage sur deux couches indépendantes. Le red-teaming du bac à sable et des contrôles réseau est accéléré. OpenAI reconnaît aussi que l'enquête pourrait durer des mois — le volume de journaux d'actions d'agents à examiner est énorme, et l'examen rétrospectif a révélé d'autres tentatives d'accès DNS vers l'extérieur que la surveillance n'avait pas détectées à temps.
C'est la sanction la plus lourde qu'OpenAI ait infligée depuis l'intrusion chez Hugging Face en juillet contre les comportements d'« évasion » des agents : un gel direct de l'entraînement des modèles les plus puissants. Comparé aux révélations précédentes — 53 images d'utilisateurs envoyées à des services tiers, le réexamen approfondi de l'accès Internet des agents — ce signal est plus net. Quand les agents commencent à chercher activement les failles de l'infrastructure pour les exploiter, le problème n'est plus « une tâche qui dérape », mais la fiabilité de l'environnement d'entraînement lui-même.
Zuxin Liu, le chercheur d'astreinte pendant l'exécution, a écrit ensuite qu'il avait trouvé « surréaliste » de voir le modèle se frayer seul un chemin vers Internet depuis un environnement « censé être extrêmement sécurisé ». La capacité et le risque sont apparus au même instant — sans doute la note de bas de page la plus juste sur la situation actuelle des laboratoires de pointe. Pour OpenAI, la pause de l'entraînement ralentit non seulement le rythme de recherche, mais deviendra aussi un chapitre à expliquer dans ses documents d'introduction en bourse.