ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
新模型发布当天 Databricks 就让 12000 名员工开测,三天后见分晓

新模型发布当天 Databricks 就让 12000 名员工开测,三天后见分晓

AI资讯 • Admin • • 8 次浏览

Databricks 把「新模型发布」做成了一条三天见分晓的流水线:模型发布的当天,12000 名员工就能用上;三天后,靠实测数据决定它是转正还是下架。这套内部流程写在 Databricks 2026 年 9 月 28 日的官方博客里,核心目标是解决两个让所有烧钱用 AI 的公司都头疼的问题。

第一个问题是,「前沿」不一定是真前沿。Databricks 举例说,Opus 5.0 在他们内部工程师的质量评分里反而低于更便宜的 Opus 4.8,价格却更高——如果公司不加验证就大规模迁移到一个「倒退」的新模型,受损的是自己。第二个问题是成本失控:他们曾把 GPT Astra 开放给一个没有成本控制的对照组,结果人均开发者的 AI 花费一夜涨了 60%,上万人的规模根本没法做预算。

三步走:当天开测、预算兜底、三天拍板

第一步,发布当天全员可开测,但统一打上「实验」标签。新模型经由自研的 Unity Gateway 下发——这是管治理、管成本、管可观测性的中央网关;员工电脑上的 Claude Code、Codex 和自研的 Omnigent 则靠预装的 UG CLI 在启动时拉取最新配置。第二步,用四级「按人预算」兜底:月度总上限、每日熔断上限、专供顶级模型的「质量前沿预算」、专供新模型的「实验预算」,防止未经验证的模型被大规模滥用。第三步,三天后看三组信号拍板:内部私有基准(离线任务加新旧模型并跑)、重度用户的口碑反馈、OpenTelemetry 链路里的成本追踪。

实测数据:Opus 5.5 降 29%,GPT-6 Sol 降 48%

9 月 21 日那周是这套流程的实战检验:Opus 5、GPT-6 Sol 和 GPT-Luna 在几天内接连发布,Databricks 当天全员开放,三天后确认三者都站在成本/质量前沿,随即转正。按会话口径对比同组用户前一周的使用:

对比旧模型(单会话均价)新模型(单会话均价)变化
Opus 4.8 vs Opus 5.5$5.94$4.23-29%
GPT-5.6 Sol vs GPT-6 Sol$4.52$2.34-48%

最终安排是:Opus 5.5 下周成为 Claude Code 的默认模型;GPT-6 Sol 虽然便宜,但质量偶尔不如 GPT-5.6 Sol,不做 Codex 默认,只进入智能路由器的备选池。

这套打法的价值不在于「哪家模型赢了」,而在于给出了可复制的企业级答案:基准分不等于自家工作负载的真实表现,选型必须看实测;成本控制不能靠自觉,必须靠预算机制。Opus 5.5 能在他家实测中扶正,也侧面印证了这款模型在成本与性能上的双重领先。

推荐工具

更多