ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
GPT-6 Sol(Max)登陆 Agent Arena:+7.7% 排第 6,每任务成本 0.76 美元

GPT-6 Sol(Max)登陆 Agent Arena:+7.7% 排第 6,每任务成本 0.76 美元

AI资讯 • Admin • • 12 次浏览

9 月 25 日,Arena(前 LMArena)官方更新了排行榜:GPT-6 Sol(Max)正式加入 Agent Arena,首份成绩单是 +7.7% 的净改进,在 44 个模型中排名第 6,数据来自 4000 多场真实的智能体会话。这是 GPT-6 Sol 发布两天后,第一次在第三方众包评测里交出完整答卷。

成绩单:比上一代强,也比上一代便宜

Arena 的官方解读给出了几个关键数字。GPT-6 Sol(Max)的净改进为 +7.7%,相比 GPT-5.6 Sol(xHigh)的 +6.2% 提升了 1.5 个百分点,排名从第 8 升到第 6,而每 token 价格只有前代的一半。

在"确认成功"(Confirmed Success)这一细分信号上,Sol(Max)拿到 +11.4%,排第 4;作为对比,5.6 Sol 在同一项上只有 +2.9%,排第 20。也就是说,新模型不仅整体更强,在"把任务真正做成"这个智能体最核心的指标上进步尤其明显。

真正的看点:性价比重塑了前沿

Agent Arena 的 Pareto 前沿现在长这样:Claude Fable 5.1(Max)+13.8%,每任务 4.06 美元;GPT-6 Astra(Max)+10.85%,2.90 美元;Claude Opus 5(High)+9.8%,2.16 美元;Claude Fable 5(High)+8.3%,1.71 美元;GPT-6 Sol(Max)+7.68%,每任务 0.76 美元。

Sol(Max)距离 Fable 5(High)只差 0.6 个百分点,每任务成本却低了 56%。对每天跑成千上万个智能体任务的团队来说,这个组合比"单项第一"更有吸引力——Arena 官方也特意指出,这次更新"重塑了 Agent Arena 的 Pareto 前沿",中位成本拉到了 0.76 美元一档。

背景:发布才两天

9 月 23 日,OpenAI 刚发布 GPT-6 Sol 和 Luna:把旗舰 Astra 的训练方法下放到更快、更便宜的档位,API 价格比 GPT-5.6 促销价再降 50%。Sol 是 GPT-6 家族里的旗舰档,定位就是编程、长任务和最难的活。这次 Arena 首秀,基本验证了官方"每个 token 更聪明"的说法——至少在智能体任务上,性能和成本同时往对的方向走了。

给开发者的判断

如果你在选跑 Agent 的模型,结论很直接:追求绝对最强,Fable 5.1(Max)和 Astra(Max)仍在前面;但要算"每块钱能买多少成功任务",Sol(Max)是目前前沿上最划算的旗舰级选择。一个提醒:Arena 是社区盲测的众包信号,反映的是真实用户任务里的胜负,不是实验室基准;等更多投票进来,排名还可能波动。

Claude Opus 5.5 发布:降价 40%,专为超长编码会话优化 是 Anthropic 同一周的回应,智能体赛道的榜单争夺才刚刚开始。

推荐工具

更多