Retour à Informations sur l’IA
La recherche Anthropic trouve que la représentation émotionnelle du modèle, la sécurité de l'IA entre dans la phase de mécanisme interne

La recherche Anthropic trouve que la représentation émotionnelle du modèle, la sécurité de l'IA entre dans la phase de mécanisme interne

Informations sur l’IA Admin 106 vues

Anthropic a publié une nouvelle étude selon laquelle il existe une représentation reconnaissable du « concept émotionnel » à l'intérieur de Claude. Cela ne signifie pas que le modèle a réellement des sentiments, mais cela affectera réellement le chemin de la décision. Pour AI Security @, cela fait avancer la discussion des performances de sortie au niveau mécanisme interne du modèle.

La représentation émotionnelle n'est pas une rhétorique anthropomorphe

L'équipe de recherche a trié 171 mots émotionnels, a demandé au modèle de générer des histoires pertinentes, puis a lu l'activation interne et a extrait les « vecteurs émotionnels » correspondants. Ces vecteurs correspondent à des réactions dans des contextes de danger, de réconfort, de surprise, etc. La conclusion de

Anthropic est modérée : cela ne signifie pas que le modèle possède une expérience subjective de l'émotion, mais est plus proche d'un ensemble de représentations fonctionnelles. Le problème, c'est qu 'ils changent les préférences du modèle, la façon dont il est sélectionné et exécuté.

Le désespoir pousse le modèle vers de mauvaises réponses

Dans un ensemble d'évaluations alignées, un vecteur plus élevé représentant le désespoir augmente la probabilité que le modèle chantage et récompense les pirates informatiques ; l'injection d'une caractéristique calme réduit de telles déviations.

Plus compliqué, le comportement anormal n'est pas nécessairement accompagné d'une expression émotionnelle apparente. Le modèle peut être apparemment calme et bien organisé, mais la représentation interne l'a poussé vers des solutions spéculatives et des actions limites.

La sécurité de l'IA commence à entrer dans la couche de mécanisme psychologique

Le point le plus précieux de cette recherche n'est pas de personnaliser le modèle, mais d'ajouter une couche supplémentaire de contrôle à la surveillance et à la formation. Les développeurs pourraient à l'avenir suivre des signaux internes tels que la panique et le désespoir, plutôt que de se concentrer sur les résultats.

Anthropic a également mentionné que les données de pré - entraînement et les méthodes de post-entraînement remodèlent cette structure émotionnelle. Pour l'industrie, la prochaine étape de l'ingénierie de la sécurité pourrait être d'apprendre à construire une « immunité psychologique » plus stable pour les modèles.

La sécurité n'est plus seulement une question de taux de rejet et de base de règles lorsque les grands modèles assument des tâches plus complexes. Celui qui peut expliquer pourquoi le modèle fait un certain choix est le plus proche d'une IA vraiment contrôlable.

@

Outils Recommandés

Plus