ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Claude Opus 5.5 空降 Text Arena 榜首:1509 分创下文本模型新纪录

Claude Opus 5.5 空降 Text Arena 榜首:1509 分创下文本模型新纪录

AI资讯 • Admin • • 5 次浏览

Claude Opus 5.5 空降 Text Arena 榜首:1509 分创下文本模型新纪录 Claude Opus 5.5 发布才四天,就拿下了文本模型竞技场的头把交椅。9 月 26 日,LMArena 官方账号在 X 上公布最新榜单:Claude Opus 5.5(High)以 1509 分登顶 Text Arena,成为该榜单上有记录以来得分最高的文本模型。

Text Arena 是 LMArena 的文本模型分榜,排名来自全球用户的匿名对战投票,覆盖数学、代码、创意写作等多个领域。和一次性的静态评测不同,它更接近"真实用户用起来觉得谁更强"。1509 分(误差约 ±12 分)让 Opus 5.5 一举超过了此前的榜首,而距离它 9 月 22 日正式发布,仅仅过去了四天。

降价的模型,反而坐上了头把交椅

这次登顶有意思的地方在于价格。Opus 5.5 的 API 定价是每百万 token 输入 4 美元、输出 20 美元,性能接近旗舰 Fable 5.1,还带着 100 万 token 的上下文窗口和最高 12.8 万 token 的单次输出。相比之下,OpenAI 的旗舰 GPT-6 Astra 定价是 10 美元 / 50 美元。也就是说,榜单第一名同时也是头部模型里更便宜的那一个——"性能最强"和"价格更低"很少同时出现,这次是个例外。(发布时的完整定价与规格,可参考本站此前的Claude Opus 5.5 发布解析。)

榜单能说明什么,不能说明什么

也要冷静看待这个第一。Text Arena 本质上是人类偏好投票,反映的是综合使用体感,而不是某个垂直能力的硬指标;分数会随着投票样本继续波动,榜首位置也可能易主。对普通用户的实际意义在于选型参考:如果你正在为长代码会话、智能体任务挑选模型,Opus 5.5 现在同时拿到了"人类投票第一"和"头部最低价之一"两个标签,试错成本比以往任何时候都低。但它不等于"所有任务都最强"——终端智能体、数学推理等专项评测里,竞争对手依然紧咬。榜单会变,价格战大概率不会停。

推荐工具

更多