Claude Opus 5.5(High)は 9 月 28 日に Agent Arena に正式にランクインし、初登場で 2 位を獲得した。ネット改善スコアは +12.15% で、同門の Fable 5.1(Max)に次ぐ順位だ。Anthropic はこのエージェントランキングの 1 位と 2 位を独占したことになる——最大のライバルは自分自身だ。
Agent Arena が測るもの
単発の会話を競うテキストランキングとは異なり、Agent Arena が評価するのは実世界のエージェントタスクだ。モデルはウェブ検索、ファイルシステム、ターミナルツールを使って複数ステップの複雑なワークフローをこなす。ランキングは世界中のユーザーの数百万件の実タスクに基づき、因果追跡の手法で「平均的なモデル」に対する各モデルの性能を測る。指標にはネット改善率やタスク確認成功率が含まれる。Opus 5.5 の +12.15% とは、「仕事をこなす」場面での平均を上回る幅のことだ。
注目すべきは、わずか 2 日前の 9 月 26 日に Opus 5.5 が 1509 点でテキストランキング(Text Arena)の首位に立ったばかりだということだ。2 日間で異なる 2 つの次元を制したことは、今回のイテレーションが一点突破の最適化ではないことを示している。関連記事
Anthropic にとっても、自社の 2 つのランキング次元——テキスト能力と実戦エージェント性能——で同時に検証されたのは初めてのことだ。両足で立った形である。
本当の見どころは「低コスト路線」の検証
ランクインしたのは High 推論ティアであり、全開の Max ティアではない。Opus 5.5 の公式価格は入力 100 万トークンあたり 4 ドル、出力 20 ドルで、前世代の Opus 5 より約 20% 安い。それでいて Anthropic によれば性能は Fable 5.1 に迫る。「より安いフラグシップティア」が実戦エージェントランキングで 2 位を取ったことは、Anthropic の今回の製品戦略——推論コストを積んでスコアを稼ぐのではなく、効率をモデル自体に組み込む——が第三者のクラウドテストで検証されたことを意味する。
これは市場への明確なシグナルだ。最前線モデルの競争は「誰が賢いか」から「同じ賢さで誰が安いか」へ移りつつある。実タスクと実コストを測る Agent Arena のようなランキングは、調達側の参照基準になっていくだろう。
モデル選定への意味
チームのためにエージェントモデルを選ぶなら、結論はシンプルだ。トップ級のエージェント能力が必要で、かつコストを気にするなら、Opus 5.5(High)はランキングが検証した中で最もコストパフォーマンスの高いフラグシップ選択肢の一つだ。コストを度外視して天井を狙うなら、Fable 5.1(Max)が依然として 1 位である。ただし忘れてはならないのは、Arena のスコアは群衆投票と因果推論に基づき、「平均的なタスク」の性能を映すということだ。自社のワークロードについては、ランキングを見て発注するより、実際に評価を回してから決める方が確実だ。