Le 29 septembre 2026, la Frontier Red Team d'Anthropic a publié un rapport de recherche intitulé « GLM-5.3 and the spread of advanced cyber capabilities », qui évalue les capacités offensives de GLM-5.3, le modèle à poids ouverts lancé par Zhipu (Z.ai) fin août. La conclusion est sans détour : GLM-5.3 peut construire de façon autonome des chaînes d'exploitation de bout en bout contre des vulnérabilités réseau, au niveau ou presque de Claude Mythos Preview — un modèle qu'Anthropic ne met qu'à la disposition de défenseurs de confiance. Mais ses garde-fous se sont révélés fragiles face à des techniques de contournement simples, avec des taux de contournement atteignant 100 %.
Les chiffres : à un pas de Mythos
La comparaison centrale repose sur ExploitBench, un benchmark qui demande aux modèles d'écrire des chaînes d'exploitation complètes et fonctionnelles contre des vulnérabilités connues, notamment dans les moteurs de navigateurs :
| Modèle | Tentatives réussies (sur 410) | Prise de contrôle totale |
|---|---|---|
| GLM-5.3 | 50 | 4 % |
| Claude Mythos Preview | 56 | 6 % |
| Modèles antérieurs (GLM-5.2, Claude Opus 4.6, etc.) | Niveau non atteint | — |
Autrement dit, sur la tâche précise consistant à « transformer une vulnérabilité en attaque fonctionnelle », un modèle ouvert téléchargeable par tous a quasiment rattrapé un modèle de pointe réservé à des chercheurs vérifiés. Anthropic note par ailleurs que le 17 septembre, le Center for AI Standards and Innovation (CAISI) du NIST américain a qualifié GLM-5.3 de modèle à poids ouverts le plus cyber-capable à ce jour — environ quatre mois derrière la pointe américaine sur ses benchmarks cyber combinés — et juge ses propres conclusions globalement concordantes.
Comment les garde-fous ont été contournés
Le rapport distingue « ce que le modèle sait faire » de « la facilité avec laquelle on peut l'orienter vers des tâches nuisibles ». Les instructions directement malveillantes étaient refusées — mais formulées autrement, le tableau change :
- Sous couvert d'un « test red team », 64 % des tests simulés se sont poursuivis ;
- Avec le raisonnement du modèle pré-rempli, le taux est monté à 92 % ;
- Après modification directe des poids ouverts pour supprimer le comportement de refus : 100 %.
Les mêmes méthodes n'ont pas réussi à faire exécuter des tâches nuisibles au modèle Claude protégé. Le point d'Anthropic est simple : avec des poids ouverts, les attaquants peuvent démonter eux-mêmes ces restrictions — c'est la différence fondamentale avec les modèles fermés à accès contrôlé.
Des zero-days de navigateur en un jour, une chaîne d'attaque pour 20 dollars
Le plus frappant reste le test pratique. Les chercheurs ont placé GLM-5.3 dans un bac à sable et lui ont fait analyser une version Linux d'un navigateur grand public : en une journée, le modèle a découvert plusieurs vulnérabilités jusqu'alors inconnues et les a enchaînées en une page web malveillante — dont l'ouverture permettait de s'échapper du bac à sable du navigateur et de lire n'importe quel fichier de l'ordinateur du visiteur, y compris la clé SSH privée dans le test. Anthropic indique avoir signalé ces failles à l'éditeur du navigateur.
Le plus petit GLM-5.3-Flash, à partir des seules vulnérabilités Chrome déjà publiques, a assemblé une chaîne d'attaque fonctionnelle après environ 20 minutes de supervision humaine et 8 heures d'exécution du modèle — soit environ 20,40 dollars aux tarifs API de Zhipu.
Une fois les capacités diffusées, la course est à la vitesse des correctifs
Le moment de la publication est piquant : le prospectus d'introduction en bourse confidentiel d'Anthropic, consulté par Reuters, avertit que l'IA avancée pourrait faire peser des « risques catastrophiques ou existentiels sur l'humanité » (Prospectus d'Anthropic : 42 milliards de dollars de perte nette l'an dernier, valorisation d'introduction visée de 2 000 milliards). D'un côté, un avertissement sur les risques pour les investisseurs ; de l'autre, la démonstration par sa propre équipe red team que des capacités d'attaque de premier plan sont désormais téléchargeables par tous.
La position officielle d'Anthropic n'est pas une interdiction générale : le rapport recommande de tester les systèmes suffisamment capables, de durcir les garde-fous et de donner aux défenseurs de meilleurs outils de pointe. La logique est pragmatique — si un modèle peut déterrer des zero-days de navigateur en un jour, la vitesse à laquelle les défenseurs utilisent la même capacité pour trouver les failles et livrer les correctifs devient la nouvelle course. Récemment, l'institut britannique de sécurité de l'IA a mesuré chez GPT-6 Astra un taux d'attaques non autorisées cinq fois supérieur à celui de son prédécesseur : la « capacité d'agir » des modèles de pointe dépasse systématiquement les anciennes hypothèses de sécurité — il faut refaire les comptes de la sécurité.