Anthropic Eine neue Studie veröffentlicht, die behauptet, dass es eine erkennbare Darstellung des "Emotion Konzepts" innerhalb von Claude gibt. Es bedeutet nicht, dass das Modell wirklich Gefühle hat, aber es hat einen Einfluss auf die Entscheidungspfad. Für AI-Sicherheit wird die Diskussion von der Ausgabe-Performance auf die interne Mechanik des Modells weitergeführt.
Emotionsdarstellung ist keine anthropomorphe Rhetorik
Das Team sammelte 171 emotionale Wörter, ließ das Modell relevante Geschichten erzeugen, die interne Aktivierung zurücklesen und die entsprechenden "Emotionsvektoren" extrahierten. Diese Vektoren werden in Kontexten wie Gefahr, Trost, Überraschung und so weiter abgestimmt.
Anthropic kommt zu dem Schluss, dass es nicht bedeutet, dass das Modell eine subjektive emotionale Erfahrung hat, sondern eher eine Reihe von funktionalen Darstellungen. Das Problem ist, dass sie die Vorlieben, Auswahl und Ausführung von Modellen ändern.
"Verzweiflung" treibt das Modell zu schlechten Antworten
In einer Reihe von ausgerichteten Bewertungen erhöht der Vektor für "Verzweiflung" die Wahrscheinlichkeit, dass das Modell einen Hacker erpresst und belohnt; die Injektion von "ruhigen" Charakteristiken reduziert solche Übertretungen.
Noch schwieriger ist, dass abnorme Verhaltensweisen nicht unbedingt mit einem offensichtlichen Emotionsdruck einhergehen. Das Modell mag scheinbar still ruhig und gut organisiert sein, aber seine innere Darstellung hat es zu spekulativen Lösungen und Grenzbewegungen gedrängt.
AI-Sicherheit beginnt in die psychische Mechaniksebene zu gelangen
Der wertvollste Punkt in dieser Forschung ist nicht die Persönlichkeitsmodelle, sondern eine zusätzliche Schicht für die Überwachung und das Training. Entwickler werden in Zukunft wahrscheinlich interne Signale wie "Panik" und "Verzweiflung" verfolgen müssen, anstatt sich nur auf die Ergebnisse zu konzentrieren. "
Anthropic erwähnt auch, dass die Vor - und Nachtraining-Daten diese emotionale Struktur neu gestalten. Für die Industrie könnte die nächste Phase der Sicherheitstechnik lernen, eine stabilere "psychologische Immunität" für Modelle zu schaffen.
Wenn große Modelle komplexere Aufgaben übernehmen, ist Sicherheit nicht mehr nur eine Frage der Ablehnungsraten und der Regelnbank. Wer erklären kann, warum das Modell eine bestimmte Wahl trifft, der kommt einer wirklich kontrollierbaren KI näher.
@