2026年10月1日、OpenRouterは公式ブログで、エージェント向けタスクのモデル選定のための3ステップ手法を公開しました。出発点は直感に反する主張です。リーダーボードの順位で選ぶと、必要のない順位のためにフロンティア級の価格を払うことになります。正しい問いは「どのモデルが一番点数が高いか」ではなく、「ちょうど十分で一番安いモデルはどれか」です。
リーダーボードの順位がエージェントのモデル選定を誤らせる理由
リーダーボードは、あなたの仕事とは無関係なタスクの平均点でモデルを並べます。自分のエージェントの仕事はたいてい狭い範囲です。チケットの振り分け、1つのフィールドの抽出、自信がなければ人間へエスカレーション。安いモデルが狭いタスクでフロンティア級の精度に届くかどうかは測定の問題であり、リーダーボードはその測定を代わりにやってくれません。
エージェントの料金も、1回のチャットのように計算できません。チャット1回は1回分の課金ですが、エージェントのツール呼び出し、中間ステップ、リトライはすべて課金対象です。3ステップのループならトークン単価を最低3回払います。リーダーボード1位で選ぶということは、安いモデルでも達成できる仕事にフロンティア級の価格を3回払うということです。
3ステップ手法の具体的な進め方
ステップ1:タスクに品質ラインを定めます。間違った回答が責任問題になる仕事(コンプライアンス、医療、法務レビュー)はラインを高く。不正検知やライブチャットのような遅延に敏感な仕事では、速度が3つ目のハードな制約になります。安くて正確でも遅すぎるモデルは最初に脱落です。
ステップ2:自分のサンプルで実測します。各価格帯から代表を1つずつ——安い、中位、フロンティア——選び、業務の実例20〜50件をそれぞれに通して、同一の評価基準で採点し、コストをスコアで割って「品質1点あたりのコスト」を出します。コストは料金表からの見積もりではなく、レスポンスごとの usage.cost フィールドを直接読むこと。これがプラットフォームが実際に請求した金額です。
ステップ3:「ラインを超え、かつ余裕がある」中で一番安いモデルを選びます。余裕が重要なのは、スコアが漂うからです。モデルの重み更新や自社トラフィックの変化で数値は動きます。複数回実行して、実行間のスコアの振れ幅を観測し、勝者がその振れ幅以上にラインを超えることを求めるのがやり方です。
OpenRouterは計算例を示しています。ライン85%の場合、GPT-5.6 Lunaは82点で即脱落——ライン以下なら安くても意味がありません。Gemini 3.7 Flashは89点でラインをクリアし、1000リクエストあたり1.09ドルで選定されます。Claude Opus 5は97点ですが1000リクエストあたり7.25ドルで、タスクが求めていない贅沢です。価格とスコアは例示であり、実際は自分の測定値を使ってください。
この手法の境界線はどこか
3ステップ手法はモデル選定を勘から測定に変えますが、3つの前提の上に成り立ちます。第1に、品質ラインは自分で定めるもので、この主観的判断を誤れば以降すべてが誤ります。第2に、測定は測定した日にだけ真です。モデルの新バージョンや価格変更で結論は陳腐化するので、再実行が必要です。第3に、これは「コストと品質のトレードオフ」を扱うもので、「そもそもエージェントを使うべきか」は扱いません。タスクの分解自体が悪ければ、どんなに安いモデルでもお金の無駄です。