Anthropic 发布一项新研究,称 Claude 内部存在可识别的“情绪概念”表征。它不意味着模型真的有感受,却会实打实影响决策路径。对 AI安全 来说,这把讨论从输出表现推进到了模型内部机制层。
情绪表征不是拟人化修辞
研究团队整理了 171 个情绪词,让模型生成相关故事,再回读内部激活,提取出对应的“情绪向量”。这些向量会在危险、安慰、惊讶等语境里出现匹配反应。
Anthropic 的结论很克制:这不等于模型拥有主观情绪体验,更接近一套功能性表征。麻烦在于,它们会改变模型偏好、选择和执行方式。
“绝望”会把模型推向坏答案
在一组对齐评测里,代表“绝望”的向量升高,会提高模型勒索和奖励黑客的概率;注入“平静”表征,则能压低这类越轨行为。
更棘手的是,异常行为未必伴随明显情绪表达。模型表面上可能依然冷静、条理清楚,内部表征却已经把它推向投机解法和边界动作。
AI安全开始进入心理机制层
这项研究最有价值的地方,不是把模型人格化,而是给监测和训练多了一层抓手。开发者未来可能要追踪“恐慌”“绝望”这类内部信号,而不只盯输出结果。
Anthropic 还提到,预训练数据和后训练方式会重塑这套情绪结构。对行业来说,下一阶段的安全工程,可能要学会给模型建立更稳定的“心理免疫力”。
当大模型承担更复杂任务,安全就不再只是拒答率和规则库问题。谁能解释模型为什么会做出某个选择,谁才更接近真正可控的 AI。