Anthropic研究发现模型情绪表征,AI安全进入内部机制阶段 Anthropic 发布一项新研究,称 Claude 内部存在可识别的“情绪概念”表征。它不意味着模型真的有感受,却会实打实影响决策路径。对 AI安全 来说,这把讨论从输出表现推进到了模型内部机制层。 情绪表征不是拟人化修辞 研究团队整理了 171 个情绪词,让模型生成相关故事,再回读内部激活,提取... AI资讯 • Admin • 2026/4/3 106