Le 30 septembre 2026, OpenAI a publié sur son blog officiel un article intitulé « Disrupting a coordinated model-distillation campaign », révélant et neutralisant une attaque de « distillation adversariale » visant ses modèles. Depuis le 1er juillet, les attaquants ont utilisé des dizaines de milliers de requêtes soigneusement conçues pour tenter d'extraire le raisonnement interne masqué des modèles ; OpenAI a déclaré avoir attribué le cœur de cette activité à des individus liés à Moonshot AI (le développeur de Kimi) et l'avoir totalement interrompue le 28 juillet.
Ce qu'ils volaient : pas les réponses, mais le « processus de pensée »
La cible de l'attaque n'était pas les réponses des modèles, mais ce qu'OpenAI appelle le « raisonnement protégé » — l'enregistrement interne de la manière dont un modèle résout une tâche. En l'obtenant, les attaquants pouvaient reproduire les capacités du modèle, exhumer des informations délibérément omises des réponses finales, puis les utiliser pour entraîner leurs propres modèles.
La méthode était astucieuse : les attaquants copiaient le raisonnement chiffré d'une conversation, puis demandaient au modèle, dans une autre conversation, de « déchiffrer et transcrire » ce contenu caché. À aucun moment ils n'ont cassé le chiffrement, compromis une base de données ni lu de véritables conversations d'utilisateurs — ce qu'ils ont contourné, c'est le flux d'interaction lui-même : le raisonnement chiffré s'est avéré portable et rejouable d'une conversation à l'autre.
La campagne a commencé par des sondages à faible volume début juillet, avec un pic les 24 et 25 juillet : 16 000 requêtes présentant des signatures d'extraction en deux jours, issues de plus de 4 000 utilisateurs ; les motifs de prompts associés couvraient plus de 15 000 utilisateurs. Dans une note de bas de page, OpenAI précise que ces chiffres comptent des « tentatives », pas nécessairement des extractions réussies.
Pourquoi OpenAI en fait une question de sécurité nationale
Le ton de l'annonce est grave : le raisonnement extrait pourrait servir à entraîner un autre modèle qui n'hériterait pas des garde-fous appliqués aux sorties du modèle d'origine. La distillation à grande échelle fait chuter le coût du « transfert de capacités » sans transférer l'investissement de sécurité correspondant — et à mesure que les modèles progressent dans des domaines à double usage comme la biologie et la chimie, ce « transfert de capacités à nu » devient un enjeu de sécurité nationale.
Ce n'est pas non plus un cas isolé. Une campagne de distillation similaire visant Claude, révélée par Anthropic cet été, pointait elle aussi vers Moonshot AI. OpenAI a également confirmé des vulnérabilités connexes signalées par des chercheurs en sécurité indépendants via la divulgation responsable, et a partagé ses conclusions avec ses partenaires industriels via le Frontier Model Forum et les canaux gouvernementaux de partage d'informations — la qualifiant de menace commune à tout le secteur, et non d'affaire interne.
Comment OpenAI l'a stoppée, et ce que les utilisateurs ordinaires doivent surveiller
OpenAI a banni et restreint les comptes frauduleux, renforcé les contrôles d'inscription et d'infrastructure, fermé la voie de « rejeu du raisonnement chiffré » et ajouté une détection des sorties en streaming susceptibles de révéler du raisonnement ; lorsque l'activité transitait par des services tiers, elle a été interrompue en coopération avec ces prestataires. Un jour seulement avant cette révélation, ce site rapportait À la veille de l'incident de sécurité d'OpenAI : les e-mails d'alerte des employés, envoyés des mois plus tôt, ignorés — le récit sécuritaire d'OpenAI oscille depuis deux mois entre « divulgation proactive » et « révélation forcée ».
Le message pour les utilisateurs et développeurs ordinaires est direct : les outils tiers qui promettent de « déverrouiller la chaîne de pensée cachée » d'un modèle empruntent techniquement la même voie que cette attaque — les utiliser, c'est verser son propre compte dans l'aval de cette zone grise.
À un niveau plus profond, l'incident a révélé une fissure dans le fossé des laboratoires de pointe : le chiffrement du raisonnement lui-même n'a jamais été brisé ; ce qui a cédé, c'est l'hypothèse de conception selon laquelle « le raisonnement chiffré peut circuler entre les conversations ». Les défenses futures ne pourront pas se contenter de surveiller le texte de sortie — elles devront surveiller toute la chaîne d'appels. La course aux armements autour de la distillation ne fera que se sophistiquer.