9月25日、Arena(旧LMArena)がリーダーボードを更新し、GPT-6 Sol(Max)がAgent Arenaに正式参戦した。初成績はネット改善率+7.7%、44モデル中6位。4000件超の実際のエージェントセッションに基づく評価で、GPT-6 Solのリリースから2日後、第三者のクラウドソーシング評価による初の本格的な成績公表となる。
成績表:前世代より強く、前世代より安い
Arenaの公式解説は幾つかの重要な数字を示した。GPT-6 Sol(Max)のネット改善率は+7.7%。GPT-5.6 Sol(xHigh)の+6.2%から1.5ポイント上昇し、順位は8位から6位に上がった。トークン単価は前世代の半分だ。
「Confirmed Success(成功確定)」のサブシグナルではSol(Max)が+11.4%で4位。対照的に5.6 Solは+2.9%の20位にとどまった。つまり新モデルは全体的に強いだけでなく、エージェントにとって最も重要な指標である「タスクを実際にやり遂げる」点で特に大きく伸びた。
本当の見どころ:コストのフロンティアが塗り替えられた
Agent Arenaのパレートフロンティアは現在こうなっている。Claude Fable 5.1(Max)が+13.8%、1タスク4.06ドル。GPT-6 Astra(Max)が+10.85%、2.90ドル。Claude Opus 5(High)が+9.8%、2.16ドル。Claude Fable 5(High)が+8.3%、1.71ドル。そしてGPT-6 Sol(Max)が+7.68%、1タスク0.76ドル。
Sol(Max)はFable 5(High)にわずか0.6ポイント差まで迫りながら、タスク単価は56%安い。1日に何千ものエージェントタスクを回すチームにとって、この組み合わせは「単独1位」のトロフィーより魅力的だ。Arena自身も、今回の更新が「Agent Arenaのパレートフロンティアを塗り替えた」とし、中央値コストが0.76ドル台に引き下げられたと指摘している。
背景:リリースからわずか2日
9月23日、OpenAIはGPT-6 SolとLunaを発表した。フラッグシップAstraの学習レシピを、より高速で安価なティアに落とし込んだもので、API価格はGPT-5.6のプロモーション価格からさらに50%引き下げられた。SolはGPT-6ファミリーのフラッグシップティアで、コーディング、長時間タスク、最も難しい仕事を狙う。今回のArenaデビューは、公式の「トークンあたり賢く」という主張をほぼ裏付けた。少なくともエージェントタスクでは、性能とコストがともに正しい方向に動いた。
開発者への判断材料
エージェントを回すモデルを選ぶなら、結論はシンプルだ。絶対的な最強を求めるならFable 5.1(Max)とAstra(Max)が依然として先頭。だが「1ドルあたり何件のタスクを成功させられるか」で測れば、Sol(Max)は現時点でフロンティア上最もお得なフラッグシップ級の選択肢だ。一つ注意点として、Arenaはコミュニティのブラインドテストによるクラウドソーシングのシグナルであり、実ユーザーのタスクでの勝敗を反映するもので、研究室ベンチマークではない。投票が増えれば順位はまだ変動しうる。
Claude Opus 5.5登場:40%値下げ、超長時間コーディングに最適化は同週のAnthropicの回答だ。エージェント競争のランキング争いは始まったばかりである。