Claude Opus 5.5(High)在 9 月 28 日正式进入 Agent Arena 榜单,首秀即拿下第二名,净改进得分 +12.15%,仅落后于同门的 Fable 5.1(Max)。这意味着 Anthropic 现在包揽了这个智能体榜单的前两名——它最大的对手是自己。
Agent Arena 测的是什么
和拼单轮对话的文本榜不同,Agent Arena 评估的是真实世界里的智能体任务:模型可以使用网页搜索、文件系统和终端工具,完成跨多步的复杂工作流。榜单基于全球用户数百万个真实长程任务,用因果追踪方法衡量每个模型相对"平均模型"的表现,指标包括净改进率和任务确认成功率。Opus 5.5 的 +12.15%,就是它在这种"干活"场景下相对平均水平的高出幅度。
值得一提的是,就在两天前的 9 月 26 日,Opus 5.5 刚以 1509 分登顶了文本榜(Text Arena)。两天之内在两个榜单的不同维度连下两城,说明这次迭代不是单点优化。相关阅读
对 Anthropic 来说,这也是它第一次在自家两个榜单维度上同时被验证——文本能力与智能体实战,两条腿都站住了。
真正的看点是"降本路线"被验证了
这次上榜的是 High 推理档,不是火力全开的 Max 档。而 Opus 5.5 的官方定价是每百万输入 token 4 美元、输出 20 美元,比上一代 Opus 5 便宜约 20%,Anthropic 官方称其性能已接近 Fable 5.1。一个"更便宜的旗舰档"在智能体实战榜单上拿到第二,等于用第三方众测验证了 Anthropic 这次的产品策略:不靠堆推理成本刷分,而是把效率做进模型里。
这对市场是个明确信号:前沿模型的竞争正在从"谁更聪明"转向"谁在同样聪明的前提下更便宜"。Agent Arena 这种测真实任务、算真实成本的榜单,会越来越成为采购方的参考系。
对选型的人意味着什么
如果你在为团队挑选智能体模型,结论很直接:需要顶级智能体能力、同时在意成本时,Opus 5.5(High)是目前榜单验证过性价比最高的旗舰选择之一;而不计成本追求天花板,Fable 5.1(Max)仍是第一。但也要记住,Arena 的分数来自人群投票和因果推断,反映的是"平均任务"表现——落到你自己的工作负载上,动手实测一轮再决定,永远比看榜下单靠谱。