ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Rapport sur la menace anthropique : Les attaques d’IA commencent à entrer dans une boucle fermée multi-agents

Rapport sur la menace anthropique : Les attaques d’IA commencent à entrer dans une boucle fermée multi-agents

Informations sur l’IA Admin 3 vues

Le 11 septembre 2026, Anthropic a publié le rapport de renseignement sur les menaces « Détection et lutte contre l’abus de l’IA : septembre 2026 », révélant les activités à haut risque qu’il a identifiées et bloquées entre décembre 2025 et août 2026. Le rapport couvre sept types de risques : cyberattaques, surveillance, opérations d’influence, fraude, abus biologique, développement d’armes conventionnelles et distillation de modèles. Le changement le plus notable pour les équipes de sécurité n’est pas que les utilisateurs malveillants ont acquis un autre outil de discussion, mais que l’IA a commencé à prendre le contrôle des processus continus de reconnaissance, de modification d’outils, d’exécution et de traitement des résultats.

Les attaquants ne se contentent plus de demander aux modèles de répondre à des questions techniques

Anthropic a indiqué que dans la plupart des cas, Claude était impliqué dans l’exécution ou l’orchestration directe, tandis que certains opérateurs utilisaient des cadres multi-agents pour effectuer des reconnaissances, exploitations et organisation de données parallèles, les humains étant principalement responsables d’identifier les cibles et de revoir les résultats. Les activités d’espionnage en langue russe citées dans le rapport permettent aux agents de surveiller si des programmes malveillants sont identifiés par des produits de sécurité, et une fois exposés, de continuer à les modifier et à les reconstruire jusqu’à ce qu’ils échappent à la détection existante. Les activités associées sont prévues pour impliquer plus de 20 organisations, ciblant des gouvernements, des agences diplomatiques et de défense.

Ce type de boucle fermée modifie le rythme de l’attaque et de la défense. Par le passé, les défenseurs imposaient une règle de contrôle, qui augmentait généralement temporairement les coûts d’attaque ; désormais, les agents peuvent observer en continu les pannes et refaire des outils. Elle n’élimine pas les opérateurs humains, mais transforme l’essai-erreur répétée, la compréhension environnementale et l’adaptation inter-cibles en tâches mécaniques parallèles, de sorte que l’échelle et la vitesse d’attaque peuvent augmenter de même sans croissance significative du personnel.

Les certifications en IA elles-mêmes sont également devenues des cibles de la chaîne d’approvisionnement

Le rapport liste également les clés API, les jetons de session et les bacs à sable de critique comme nouvelles surfaces d’attaque. Dans un cas, l’attaquant a injecté des instructions malveillantes dans le bac à sable automatisé d’un fournisseur d’IA, a obtenu la clé API de production détenue par cet environnement, puis a tenté d’attaquer environ 30 entreprises d’IA en environ quatre jours. Anthropic a souligné que les attaquants n’ont pas bâché les propres systèmes d’Anthropic ni obtenu les modèles Claude pré-lancement. Cette distinction est importante : le risque provient de l’intégration client, des outils proxy et des chaînes de permissions sandbox, et non nécessairement du fait que le service de modèle fondamental soit directement compromis.

La ligne de défense de l’entreprise devrait passer du filtrage de contenu à la chaîne d’exécution

Seules les invites de vérification ou les réponses finales ne peuvent plus voir ce que font les agents entre les deux. Les entreprises doivent avancer les points de contrôle vers au moins trois positions : les appels d’outils utilisent des privilèges minimaux et confirment manuellement les actions à haut risque ; Les environnements de révision et de navigation interdisent l’accès aux identifiants de production, et les sorties réseau sont restreintes par des listes blanches de tâches ; Les clés API sont isolées par charge de travail pour surveiller un débit anormal, des appels interrégionaux et des comportements prolongés sans surveillance. La détection statique d’échantillons malveillants reste précieuse, mais doit être combinée avec la détection de comportements, la rotation des identifiants et les journaux d’audit.

Le rapport comporte également des limites à respecter

Ces cas ont été compilés par Anthropic sur la base de ses propres observations de plateforme et représentent les menaces les plus significatives et nouvelles qu’il considère comme les plus significatives, ne représentent pas l’utilisation typique de Claude, ni ne peuvent directement déduire l’occurrence globale de l’industrie. La divulgation par les fournisseurs peut aider d’autres plateformes à identifier des schémas, mais les conclusions clés nécessitent encore une validation croisée par les forces de l’ordre, les chercheurs en sécurité et les organisations concernées. Pour les entreprises, un jugement raisonnable ne consiste pas à arrêter l’utilisation des proxys, mais à traiter les proxies comme des entités logicielles dotées de capacités d’exécution : d’abord restreindre ce qu’elles peuvent accéder et invoquer, puis évaluer si le modèle lui-même est sécurisé.

Outils Recommandés

Plus