2026年9月18日,Anthropic与Accenture分别通过官方新闻稿宣布建立“嵌入式评估”合作:由Accenture旗下专业AI业务Faculty牵头,在Anthropic内部评测和红队测试模型、开展对齐评估并检查安全护栏。双方预计未来五年各投入至少10亿美元建设相关能力。这不是一次普通咨询采购,而是在探索让外部评估者更早进入前沿模型研发流程。
“嵌入式”比发布前测一次多了什么
传统外部评测通常在模型接近完成时拿到有限版本,观察结果容易成为一次性成绩。Anthropic描述的新模式则给予评估者接近员工的访问条件,使其能跟随训练过程、了解开发与部署决策,并直接接触相关团队。这样做的目标,是在模型形成期间发现盲点,而不是上线前才检查几套基准。
10亿美元投入买的不是一张安全证书
Faculty将把政府、国防、医疗和基础设施等行业经验带入测试,企业客户的真实使用方式也会成为评估背景。资金主要用于建立人员、工具和长期评估能力,公告并未承诺某个模型因此“绝对安全”。Anthropic还明确表示,外部评估不会转移模型开发者的责任,合作也不是独家安排;双方都可以与其他机构开展类似项目。
独立性仍是这套机制的难题
| 关键问题 | 目前公开信息 |
|---|---|
| 谁出资 | Anthropic直接为Accenture的工作提供资金 |
| 能看什么 | 计划提供接近员工的访问,但具体权限尚未标准化 |
| 如何报告 | 行业仍没有统一的披露范围和报告规则 |
| 如何避免单一判断 | 合作非独家,Anthropic还在与METR等机构讨论试点 |
被评估方直接付费,天然会让市场追问利益冲突。真正可信的安排需要提前写清访问边界、发现问题后的升级路径、公开报告权、重大分歧如何呈现,以及评估团队能否在不受商业压力干预的情况下发布结论。
对企业采购方意味着什么
今后判断前沿模型安全性,不能只看厂商给出的基准分数。采购团队更应要求说明:评估者何时介入、是否接触真实训练与部署过程、发现了哪些问题、整改如何复测、哪些内容因安全或商业原因未公开。Anthropic与Accenture把“持续进入研发现场”变成了可执行实验,但它能否成为行业标准,取决于后续是否形成可比较、可审计且不只由模型公司控制的报告机制。