Microsoft-Decision-1 は 2026 年 10 月 9 日に Microsoft が公式ブログで発表し、Microsoft Foundry で提供を開始した。今後 OpenRouter でも使えるようになる。長文を生成せず、オープンな推論もしない。固定された選択肢の集合に対して、各選択肢へ校正済みの確率スコアを付けることだけに徹し、ソフトウェアがそのスコアを受けて即座に次の動作へ移れるようにするモデルである。
汎用大規模モデルとは役割が違う
Microsoft-Decision-1 は Qwen3.5-9B を後訓練し、高速な単回判定スコアリングに特化させたもので、Microsoft は今後、自社の MAI モデルや OpenAI モデルへの移行も計画している。是か非か、多肢選択、評価尺度に対応し、ルーブリックに基づいて AI の回答やエージェントの行動を採点することもでき、すべて単純な構造化 API で呼べる。なぜ「判断」専用のモデルを作るのか。理由は実務的だ。ワークフローの各ステップの判断は遅延を積み上げ、20 回の逐次判断に各 100 ミリ秒が加われば合計 2 秒になる。汎用モデルに一つずつ考えさせる方式は、規模が大きくなると速度もコストも持たない。
先に見るべき二つの数字:遅延と安定性
訓練から秘匿された 36 件のベンチマーク、約 15 万問(ルーティング、ランキング、長文脈、多言語、安全性など)で、Microsoft-Decision-1 は Microsoft 自社測定の最高精度を記録した。P50 遅延は GPT-6 Sol の約 35 倍高速で、2 位の Quyet-1.0-Large よりも 4.5 倍速い。安定性も別途測られている。同じリクエストに言い換え、順序変更、キー変更、書式ノイズなど 8 通りの摂動を加えたところ、判断が反転したのは平均 1.3% で、選択肢の説明文の言い換えや選択肢の逆順では反転ゼロだった。確率そのものが API 出力の一部であり、「9 割の自信」は代表的なサンプルでおよそ 9 割当たることを意味する。だからこそアプリケーションは自動実行、保留、人手レビューの判断に使える。安全性については、有害コンテンツ、脱獄、プロンプトインジェクションを含む 11 件のベンチマーク、5250 件のリクエストで検証し、有害な振る舞いを拒否しながら有用性を高く保てたとしている。
Microsoft 社内での利用例
Xbox の研究チームは 1 万件を超えるプレイヤーのフィードバックを固定テーマへ分類する作業に使い、GPT-6 Sol と同等の品質を 14 倍超の速度、約 200 分の 1 のコストで得た。Copilot チームはチャットとエージェント応答の品質評価に使い、GPT-5.6 Luna と競合する品質を 100 倍の速度で得たと報告している。オンコールエンジニアは障害対応の知識検索に、Microsoft Discovery は実験計画の採点と適応的再計画に使い、大規模モデルによる採点より一貫性が 46 倍高く、ループ全体が約 4 倍速くなったという。この路線は Microsoft だけのものではない。OpenAI はすでに同種の判断をインターフェース化しており、当サイトでも Decisions API のパブリックベータ として取り上げた。違いは、Microsoft が判断を大規模モデルの一モードではなく独立したモデルにした点にある。
価格は入力 100 万トークンあたり 0.042 ドルで、出力は無料。選択肢があらかじめ決まっている判断——モデルルーティング、分類、優先順位付け、検証、ワークフロー制御、エージェントの次の行動のチェック——に向く。選択肢のない自由な質問には向かない。構造化された判断を大量に処理するチームは、導入前に自前の実データで二点を確認したい。言い回しを変えても判断がぶれないか、そして提示される確率が実際の正答率と一致するかだ。ランキングの順位はその後でよい。