2026年10月1日、ArenaはXiaomiのMiMo-V2.6-ProおよびMiMo-V2.6-FlashがAgent Arenaリーダーボードに正式参入したことを発表した。9月21日のリリースとMITライセンスでのオープンソース化を経て、MiMo-V2.6シリーズが大規模な実エージェントセッションで試されるのは今回が初めてだ。
まずProの成績を見よう。8,100件以上の実エージェントセッションで、Proは+3.17%のネット改善を記録し、オープンソースモデル中5位につけた。比較対象が雄弁だ。前世代のMiMo-V2.5-Proは同じボードで13位、ネット改善は-7.23%だった。一世代で順位を9つ上げ、改善幅は10.4ポイント伸びた。さらに注目すべきはConfirmed Successシグナルで、Proは+7.35%を記録しオープンソース中2位。Flashはコスパ路線だ。オープンソース中9位、ネット改善は-0.57%だが、タスクあたりの中央コストはわずか0.04ドルでProより56%安く、Arenaのコストパフォーマンスフロンティアにも載っている。
Confirmed Successは単独で説明する価値がある。Agent Arenaの評価は選択問題ではなく、モデルが実際のタスクで手を動かす。「動いた」より厳しい、タスクが完了したと確認された品質シグナルを測るのがConfirmed Successだ。Proがこの指標でオープンソース2位ということは、セッション数を稼いでいるだけではなく、多段階の判断が求められるタスクで実際に信頼性が高いことを意味する。以前報じたMiMo-V2.6のオープンソース化では46ポイントでオープンソース首位に立ったが、今回のAgent Arenaの結果は「実タスク遂行」というピースを埋めるものだ。
ボードの限界にも触れておきたい。Arenaのスコアは実ユーザーのセッション投票に基づくため、サンプル数やタスク分布で変動する。+3.17%はベースラインに対する相対的なネット改善であり、絶対勝率ではない。「世代ごとに強くなっている」証拠として読むのは妥当だが、「もう無敵」と結論づけるのは行き過ぎだ。
オープンソースモデルの勢力図にとって、シグナルは明確だ。エージェント領域の競争は「パラメータとボードの点数」から「実タスクでの確実なデリバリー」へ移っている。MiMo-V2.6-Proは一世代でネット改善をマイナスからプラスに転じ、Confirmed Successをオープンソース2位に押し上げた。Xiaomiのスケールした強化学習路線がエージェントワークフローで実を結びつつあることの表れだ。利用者側の選択もクリアになった。上限を狙うならPro、コストを抑えるならFlash。同一シリーズの中で性能と価格の住み分けがはっきりした。