ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
マルチエージェントチームを実測:コストは最大5.1倍、品質はほぼ横ばい

マルチエージェントチームを実測:コストは最大5.1倍、品質はほぼ横ばい

AI情報 • Admin • • 10 回閲覧

マルチエージェントチームは、コストに見合う品質向上をもたらしませんでした。2026年10月11日、評価機関Vals AIはプログラミングベンチマークVibe Code Benchにおける単独モードとチームモードの比較結果を公表しました。GPT-6 SolとClaude Opus 5.5が同じタスクを単独で、次にチームでこなしたところ、チームのコストは単独の1.8倍から5.1倍に膨らみ、4つの比較のうち統計的に有意な品質向上が見られたのは1つだけでした。

何を比較したのか

Vibe Code Benchは、モデルに要件から動作するアプリケーションを作らせ、完成度で採点します。Vals AIは両モデルを中と最大の2段階の推論強度で実行し、各段階で単独とチームを比べました。有意な差が出たのは中程度の推論強度におけるGPT-6 Solだけで、チームが7.3ポイント上回りました。最大の推論強度では、どちらのモデルでもチームモードに測定可能な優位性はありませんでした。つまり最高設定では、1つのモデルに長く考えさせることと、助っ人を増やすことの効果はほぼ重なり、請求額だけが何倍にも違います。

エージェントを1から100に増やすと曲線はすぐ平らになる

AnthropicはClaude Opus 5.5のシステムレポートで同様のスケーリング実験を行い、タスクに参加するエージェント数を1から100まで増やしました。曲線は急に伸びた後、平らになりました。

タスク1体10体30体100体
ナレッジベース0.530.700.710.74
Lean定理証明0.390.660.660.68

1体から10体では目に見える改善がありましたが、10体から100体ではどちらのスコアも数百分の一程度しか動きませんでした。Claude Fable 5.1は定理証明タスクで規模の恩恵をより受けたものの、総合ではOpus 5.5に及ばず、ナレッジベースでは30体から100体の間でスコアがわずかに下がりました。大規模チームのより確実な利点は、より高い水準に届くことではなく、同じ水準により速く届くことであり、AnthropicのProgramBenchテストでも、その速度はトークン消費の増加を伴いました。

チームが買っているのは主に時間

OpenAIの研究者Noam Brownはポッドキャストで、両方のデータと一致する説明を述べています。マルチエージェントが主に買うのは速度であり、回答の質ではありません。エージェント4体でタスクは約2倍速く終わり、コストも約2倍でした。ウェブ検索や数学のように並列化できるタスクが最も恩恵を受け、小説を書くような並列化できないタスクでは人数を増やしても何も得られません。OpenAIのCodex開発者Eric Provencherは、この余分な支出を調整税と表現します。エージェント同士は互いの成果を完全には信頼せず、再確認やツールの再呼び出しを繰り返し、その確認自体がトークンを消費するからです。

エージェントに費用を払うチームは、まず自分で計算を

エージェントを導入するチームにとっての示唆は3つあります。タスクが独立した並列ブロックに分割でき、納期そのものに価値がある場合、チーム化は合理的です。タスクが一本道の推論である場合や、モデルがすでに最大の推論強度で動いている場合は、人数を増やす前に推論予算を増やす方が割に合うことが多いでしょう。そして導入前に、自社の実際のタスクで単独とチームの比較を行い、トークン総量ではなく成果物1件あたりのコストを見るべきです。業界は大規模なオーケストレーションを売りにし始めており、Claude Managed Agentsは1回の実行で最大1000体のエージェントを編成できますが、編成できるかどうかと、編成する価値があるかどうかは別の問題です。価値はタスクがどれだけ並列化できるかにかかっています。

おすすめツール

もっと見る