ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
ThinkingBox 评测上线:智能体说做完了,数据库却不认账

ThinkingBox 评测上线:智能体说做完了,数据库却不认账

AI资讯 • Admin • • 9 次浏览

ThinkingBox 是微软与 Hugging Face 在 2026 年 10 月 3 日联合发布的一套智能体评测:它不看智能体最后说了什么,只看数据库里最后留下了什么。507 个有状态的业务流程,每个都从干净的后端重复跑 20 次,零售、汽车保险、旅行、新银行与咨询支持各占约一百个;智能体把工单状态写错一个字段,整次尝试就算失败。

数据库终态才是成绩单

发布博文举了一个客服例子:智能体查了订单、物流、客户档案和退款政策,九次工具调用全都格式正确,最后把工单关成“已解决”并回复客户问题已经处理完。但承运商的异常还开着,要求的终态应该是“挂起”,客户真正问的事也没有得到答复。按工具调用打分它接近满分,按数据库终态打分它是不及格。

这种差距不是个例。在覆盖 12 个模型的 121,680 次有效试验里,79,853 次没有通过可执行检查;这些失败里有 67.24% 是“干净收尾、调用了会改状态的工具、也没有报最终错误”的,检查却发现 77.61% 写错了字段值,43.30% 多做了不该做的改动,25.36% 漏掉了必须做的改动。换句话说,智能体最常见的翻车方式不是不会说话,而是自信地把账记错,还不自知。

能做一次,和每次都能做对,是两回事

单次成功率的榜单看起来并不陌生:Claude Opus 5.5 以 67.16% 排第一,Claude Opus 5 是 66.50%,GPT-5.4 是 65.36%。但 ThinkingBox 真正想问的是第二个问题:同一道题连跑 20 次,还能剩多少。

Kimi-K3 是覆盖面最广的模型,507 个任务里有 476 个至少成功过一次,占 93.89%;可只有 68 个任务能 20 次全过,占 13.41%。Claude Opus 5 恰好相反:至少成功一次的任务少一些,却有 241 个任务 20 次全过,占 47.53%;更新一代的 Opus 5.5 单次分更高,20 次全过的任务数却同为 241 个,一道没多。GPT-6 Astra 保住了单次成绩的 78%,是保持率最高的一档。新模型把平均分抬高,不等于把可靠性抬高,这条曲线值得每个准备上线智能体的团队贴在墙上。

可靠是另外一笔账

博文还给可靠性标了价:把 20 轮完整评测的成本除以 20 次全过的任务数,得到每个“靠谱任务”的成本。GPT-5.4 最便宜,每个 6.80 美元,但全过的任务只有 128 个;GPT-6 Astra 是每个 7.45 美元、全过 231 个;Claude Opus 5.5 是每个 7.80 美元、全过 241 个。单次成功最便宜的选法,和稳定成功最便宜的选法,不是同一个答案。

失败的构成同样说明问题:约 79.9% 的失败被归到工具使用环节,状态更新错误占 10.3%,答复不完整占 7.0%,完全没有做出改状态动作的只占 2.9%。多数智能体不是想不明白,而是走到了最后一步却处理不了工具报错、前置条件不满足或查询为空。对部署方的直接启发有三条:提交前先核对终态而不是听模型自述,把工具错误分类、让重试只打可恢复的那部分,以及不可逆的改动必须留人工批准。ThinkingBox 现已通过 Hugging Face 的 OpenEnv 提供,团队可以拿自己的业务流程照这个标准复测一遍,再谈上线。

推荐工具

更多