返回文章列表

AI安全

找到 7 篇相关文章

Anthropic研究发现模型情绪表征,AI安全进入内部机制阶段

Anthropic研究发现模型情绪表征,AI安全进入内部机制阶段

Anthropic 发布一项新研究,称 Claude 内部存在可识别的“情绪概念”表征。它不意味着模型真的有感受,却会实打实影响决策路径。对 AI安全 来说,这把讨论从输出表现推进到了模型内部机制层。 情绪表征不是拟人化修辞 研究团队整理了 171 个情绪词,让模型生成相关故事,再回读内部激活,提取...

AI资讯 Admin
106

推荐工具

更多