Databricks は「新モデルのリリース」を3日で結論を出すパイプラインに仕立て上げた。リリース当日に1万2000人の全従業員が利用でき、3日後に実測データで採用か廃止かを決める。この社内プロセスを Databricks は 2026 年 9 月 28 日の公式ブログで公開した。狙いは、AI にお金を投じるあらゆる企業が抱える二つの悩みだ。
一つ目は、「フロンティア」が必ずしも真のフロンティアではないこと。Databricks の例では、Opus 5.0 は社内エンジニアの品質評価でより安い Opus 4.8 を下回り、価格は高いという。「後退した」新モデルに検証なしで大規模移行すれば、損をするのは自社だ。二つ目はコストの暴走だ。コスト対策なしの対照群に GPT Astra を開放したところ、開発者1人あたりの AI 支出が一夜で 60% 跳ね上がり、1万人規模では予算がまったく組めなくなった。
3ステップ:当日開放、予算の歯止め、3日で判断
第一に、リリース当日に全員へ開放するが、一律で「実験的」タグを付ける。新モデルは自社開発の Unity Gateway 経由で配布される。これはガバナンス、コスト管理、可観測性の中核ハブであり、従業員の PC 上の Claude Code、Codex、自社開発の Omnigent は、プリインストールされた UG CLI が起動時に最新設定を取得する。第二に、4 段階の「ユーザー別予算」で歯止めをかける。月間上限、1 日の暴走上限、トップティア専用の「クオリティフロンティア予算」、新モデル専用の「実験予算」で、未検証モデルの大規模な乱用を防ぐ。第三に、3 日後に3つのシグナルで判断する。社内プライベートベンチマーク(オフラインタスク+新旧モデルの並走比較)、ヘビーユーザーの口コミ、OpenTelemetry トレースのコスト追跡だ。
実測データ:Opus 5.5 は 29% 低下、GPT-6 Sol は 48% 低下
9 月 21 日の週が実戦テストとなった。Opus 5、GPT-6 Sol、GPT-Luna が数日のうちに相次いで登場し、Databricks は当日に全従業員へ開放。3 日後、3 モデルともコスト/品質のフロンティア上にあることを確認して正式採用した。同一コホートの前週とのセッション単価比較は次の通りだ。
| 比較 | 旧モデル(セッション単価) | 新モデル(セッション単価) | 変化 |
|---|---|---|---|
| Opus 4.8 vs Opus 5.5 | $5.94 | $4.23 | -29% |
| GPT-5.6 Sol vs GPT-6 Sol | $4.52 | $2.34 | -48% |
最終判断は、Opus 5.5 を来週から Claude Code のデフォルトにすること。GPT-6 Sol は安いものの品質が GPT-5.6 Sol を下回ることがあり、Codex のデフォルトにはせず、スマートルーターの選択肢に加えるにとどめた。
このプレイブックの価値は「どのモデルが勝ったか」ではなく、再現可能なエンタープライズの答えにある。ベンチマークの点数は自社ワークロードの実性能とイコールではなく、選定は実測に基づくべきだ。コスト管理は善意に頼れず、予算の仕組みが要る。Opus 5.5 が Databricks の実測でデフォルトに抜擢されたことは、同モデルのコストと性能の両面でのリードを裏付けてもいる。