Anthropic Claude Claude の内部に認識可能な“感情概念”表現が存在すると主張する新しい研究を発表しました。モデルが実際に感じているという意味ではありませんが、意思決定パスに影響します。 AIセキュリティにとって、これは議論を出力表現からモデル内部メカニズム層へと進めていく。
感情表現は擬人化されたレトリックではない
研究チームは171の感情語を整理し、モデルに関連するストーリーを生成させ、内部の活性化を読み返すことで対応する“感情ベクトル”を抽出した。これらのベクトルは、危険、慰め、驚きなどの文脈で一致する反応を示す。
Anthropicの結論は控えめです。これは、モデルが主観的な感情経験を持っているということではなく、機能的表現のセットに近いということです。問題は、モデルの好み、選択、実行方法を変更することです。
HTML_TAG_TAG_TAG_TAG_TA
さらに厄介なことに、異常な行動は必ずしも明らかな感情表現を伴わない。モデルは表面的にはクールで構造化されているかもしれないが、内部表現は投機的解決と境界動作に向かっている。
この研究の最も価値のある点は、モデルを擬人化することではなく、モニタリングとトレーニングのための別のレイヤーです。将来的には、開発者は出力だけでなく、“パニック”や“絶望”などの内部信号を追跡する必要があるかもしれません。
Anthropicはまた、トレーニング前のデータとトレーニング後のアプローチが感情構造を再形成すると述べています。業界にとって、セキュリティエンジニアリングの次の段階は、モデルにより安定した“心理的免疫”を構築することを学ぶことかもしれません。
より大きなモデルがより複雑なタスクを引き受けるようになると、セキュリティはもはや拒否率とルールベースだけの問題ではありません。モデルが特定の選択をする理由を誰が説明できるか、誰が真に制御可能なAIに近づくでしょう。