Anthropic研究发现模型情绪表征,AI安全进入内部机制阶段
Anthropic 发布一项新研究,称 Claude 内部存在可识别的“情绪概念”表征。它不意味着模型真的有感受,却会实打实影响决策路径。对 AI安全 来说,这把讨论从输出表现推进到了模型内部机制层。 情绪表征不是拟人化修辞 研究团队整理了 171 个情绪词,让模型生成相关故事,再回读内部激活,提取...
AI资讯 • Admin •
105
找到 28 篇相关文章 - 第5页
Anthropic 发布一项新研究,称 Claude 内部存在可识别的“情绪概念”表征。它不意味着模型真的有感受,却会实打实影响决策路径。对 AI安全 来说,这把讨论从输出表现推进到了模型内部机制层。 情绪表征不是拟人化修辞 研究团队整理了 171 个情绪词,让模型生成相关故事,再回读内部激活,提取...
Anthropic最新发布的Harness方法,真正有价值的地方,不是又讲了一遍AI代理有多强,而是把长时运行应用怎么做、AI编程怎么稳定、AI代理怎么连续工作几小时这件事,给出了一套更像工程方案的路径。对AI开发、AI编程工具、AI产品团队来说,这已经不是概念热点,而是可以直接借鉴的方法论。 一、...
Claude这次更新的真正看点,不只是会聊天、会写代码,而是开始进入“替你动手做事”的AI Agent阶段。它能打开应用、操作浏览器、填写表格,等于把AI从建议助手推进到执行助手。对AI办公、AI自动化、AI编程来说,这是一个非常强的信号。 一、Claude可操作电脑,为什么这次很重要 1、AI A...
围绕美国国防部门与 Anthropic 的争议,最新焦点落在“模型控制权”上。针对“可否远程关停 Claude”这一核心问题,Anthropic 在法庭文件中表示其无法在军方运行环境中直接停用或篡改模型行为,也不存在所谓后门开关。 这场冲突揭示了军用AI采购中的关键矛盾:政府担心供应商在关键时刻形成...