ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
Databricks、新モデルのリリース当日に1万2000人の全従業員が試用、3日後にデータで採否を判断

Databricks、新モデルのリリース当日に1万2000人の全従業員が試用、3日後にデータで採否を判断

AI情報 • Admin • • 8 回閲覧

Databricks は「新モデルのリリース」を3日で結論を出すパイプラインに仕立て上げた。リリース当日に1万2000人の全従業員が利用でき、3日後に実測データで採用か廃止かを決める。この社内プロセスを Databricks は 2026 年 9 月 28 日の公式ブログで公開した。狙いは、AI にお金を投じるあらゆる企業が抱える二つの悩みだ。

一つ目は、「フロンティア」が必ずしも真のフロンティアではないこと。Databricks の例では、Opus 5.0 は社内エンジニアの品質評価でより安い Opus 4.8 を下回り、価格は高いという。「後退した」新モデルに検証なしで大規模移行すれば、損をするのは自社だ。二つ目はコストの暴走だ。コスト対策なしの対照群に GPT Astra を開放したところ、開発者1人あたりの AI 支出が一夜で 60% 跳ね上がり、1万人規模では予算がまったく組めなくなった。

3ステップ:当日開放、予算の歯止め、3日で判断

第一に、リリース当日に全員へ開放するが、一律で「実験的」タグを付ける。新モデルは自社開発の Unity Gateway 経由で配布される。これはガバナンス、コスト管理、可観測性の中核ハブであり、従業員の PC 上の Claude Code、Codex、自社開発の Omnigent は、プリインストールされた UG CLI が起動時に最新設定を取得する。第二に、4 段階の「ユーザー別予算」で歯止めをかける。月間上限、1 日の暴走上限、トップティア専用の「クオリティフロンティア予算」、新モデル専用の「実験予算」で、未検証モデルの大規模な乱用を防ぐ。第三に、3 日後に3つのシグナルで判断する。社内プライベートベンチマーク(オフラインタスク+新旧モデルの並走比較)、ヘビーユーザーの口コミ、OpenTelemetry トレースのコスト追跡だ。

実測データ:Opus 5.5 は 29% 低下、GPT-6 Sol は 48% 低下

9 月 21 日の週が実戦テストとなった。Opus 5、GPT-6 Sol、GPT-Luna が数日のうちに相次いで登場し、Databricks は当日に全従業員へ開放。3 日後、3 モデルともコスト/品質のフロンティア上にあることを確認して正式採用した。同一コホートの前週とのセッション単価比較は次の通りだ。

比較旧モデル(セッション単価)新モデル(セッション単価)変化
Opus 4.8 vs Opus 5.5$5.94$4.23-29%
GPT-5.6 Sol vs GPT-6 Sol$4.52$2.34-48%

最終判断は、Opus 5.5 を来週から Claude Code のデフォルトにすること。GPT-6 Sol は安いものの品質が GPT-5.6 Sol を下回ることがあり、Codex のデフォルトにはせず、スマートルーターの選択肢に加えるにとどめた。

このプレイブックの価値は「どのモデルが勝ったか」ではなく、再現可能なエンタープライズの答えにある。ベンチマークの点数は自社ワークロードの実性能とイコールではなく、選定は実測に基づくべきだ。コスト管理は善意に頼れず、予算の仕組みが要る。Opus 5.5 が Databricks の実測でデフォルトに抜擢されたことは、同モデルのコストと性能の両面でのリードを裏付けてもいる。

おすすめツール

もっと見る