Retour à Informations sur l’IA
Anthropic révèle Claude attaque de distillation : DeepSeek, Moonshot, MiniMax nommés

Anthropic révèle Claude attaque de distillation : DeepSeek, Moonshot, MiniMax nommés

Informations sur l’IA Admin 131 vues

nthropic a annoncé avoir identifié trois laboratoires d’IA : DeepSeek, Moonshot AI et MiniMax, pour lancer une opération d’extraction de capacités distillées « à l’échelle industrielle » contre Claude : plus de 16 millions d’interactions avec Claude ont été générées via environ 24 000 comptes frauduleux pour entraîner et améliorer ses propres modèles, et ont été soupçonnés de violer les conditions d’utilisation et les restrictions d’accès régionales.

L’annonce soulignait que la « distillation » elle-même est une méthode d’entraînement courante, mais que lorsque les concurrents utilisent des comptes frauduleux, des services de proxy et des rapides rapides pour extraire de manière centralisée des capacités différenciées telles que le raisonnement, l’utilisation des outils et le codage en peu de temps, cela affaiblit les garde-fous de sécurité et comporte des risques pour la sécurité. Parmi les trois opérations, Moonshot a eu environ 3,4 millions d’interactions, MiniMax environ 13 millions d’interactions, et DeepSeek était petit mais incluait des stratégies telles que l’induction de « trajectoires d’inférence étape par étape ».

Anthropic a déclaré avoir renforcé la vérification des canaux sujets aux abus tels que la détection et l’empreinte comportementale, amélioré l’éducation et la recherche, et partagé des indicateurs techniques avec d’autres institutions. Des contre-mesures au niveau du produit, de l’API et du modèle sont également développées pour réduire l’efficacité des produits utilisés pour la distillation illégale. L’annonce mentionnait également que de telles attaques pourraient affecter les discussions politiques sur les exportations de modèles et les restrictions de puissance de calcul, mais l’impact externe pertinent dépend encore des actions de suivi de toutes les parties.

FAQ

Q : Qui est la cible de cet incident ?

R : L’annonce a été faite par Anthropic et impliquait son modèle Claude ainsi que les modèles nommés DeepSeek, Moonshot AI et MiniMax.

Q : En quoi Distillation Attack diffère-t-il de la distillation normale ?

R : La distillation normale consiste principalement à une compression interne et à une réduction des coûts dans la même institution ; Les attaques par distillation désignent l’extraction des capacités concurrentes via des comptes frauduleux et des demandes à grande échelle.

Q : Quelles sont les données d’échelle divulguées ?

R : Environ 24 000 comptes frauduleux et plus de 16 millions d’interactions avec Claude ; Parmi eux, Moonshot a été utilisé environ 3,4 millions de fois et MiniMax environ 13 millions de fois.

Q : Quelles capacités sont principalement extraites de ce type d’attaque ?

R : L’annonce mentionne que l’accent est mis sur la capacité de raisonnement, l’utilisation des outils, le codage et les tâches d’agents, etc.

Q : Quels risques les utilisateurs ordinaires doivent-ils connaître ?

R : Si la prolifération des modèles sans garde-fous peut amplifier le risque d’abus ; Les utilisateurs doivent également se méfier des services tels que la revente par agent et l'« accès par procuration » anormalement bas.

Divulgation de l’attaque Claude Distillation Un groupe anthropique nommé DeepSeek 24 compte 000 tire Claude 1 6 millions de détails de conversation Claude est distillé industriellement DeepSeek a distillé la méthode Claude Moonshot Échelle de distillation IA Interaction de distillation MiniMax Qu’est-ce qu’une attaque de distillation ? La différence entre la distillation du modèle et l’abus La capacité de raisonnement de Claude a été extraite L’utilisation de l’outil Claude est ciblée La capacité de codage de Claude est extraite Service d’agence pour revendre Claude Les comptes frauduleux sont générés par lots Protection anti-distillation anthropique Technologie d’identification des flux par distillation Distillation par détection d’empreintes digitales comportementale L’inférence en chaîne induit des données Extraire les risques en se basant sur des trajectoires d’inférence Renforcer la vérification des comptes éducatifs Mises à niveau du contrôle d’accès API Partage des indicateurs techniques de distillation Les couches modèles luttent contre la distillation Mesures d’anti-distillation à la couche produit Restrictions d’accès à la région de Claude Attaque par distillation et garde-corps de sécurité Manque de risque de garde-corps de sécurité sur les modèles Discussion sur les risques pour la sécurité nationale Les capacités des modèles d’IA se dépassent Schéma de prompts à l’échelle industrielle Répétition élevée de la fonction Invite Comment fonctionnent les attaques par distillation Architecture du cluster Hydra Interdiction par lots et mécanisme de remplacement Plateforme cloud et canaux tiers Capacité des concurrents à reproduire Les données de conversation IA sont mal utilisées Cas de violations de la clause IA Stratégie de prévention des abus de Claude L’industrie de l’IA répond de manière collaborative Protection collaborative des fournisseurs de services cloud Discussions sur la politique et la réglementation Contrôle des exportations et distillation Puces avancées et échelle d’extraction Conformité des données d’entraînement des modèles Recommandations de sécurité des API d’entreprise Identifier le comportement anormal des appels Prévenir le vol de compte Mises à jour de sécurité Claude

Outils Recommandés

Plus