Databricks는 '신모델 출시'를 사흘 만에 결론 내는 파이프라인으로 만들었다. 출시 당일 1만2000명 전 직원이 사용할 수 있고, 사흘 뒤 실측 데이터로 정식 채택 여부를 결정한다. Databricks는 2026년 9월 28일 공식 블로그에 이 내부 프로세스를 공개했다. 겨냥하는 것은 AI에 돈을 쏟아붓는 모든 기업이 겪는 두 가지 고민이다.
첫째, '프론티어'가 항상 진짜 프론티어는 아니라는 점이다. Databricks의 예에 따르면 Opus 5.0은 내부 엔지니어 품질 평가에서 더 저렴한 Opus 4.8보다 낮았고 가격은 더 비쌌다. 검증 없이 '퇴보한' 신모델로 대규모 이전하면 손해는 자사 몫이다. 둘째는 비용 폭주다. 비용 통제 없는 대조군에 GPT Astra를 개방했더니 개발자 1인당 AI 지출이 하룻밤에 60% 뛰었고, 1만 명 규모에서는 예산을 세울 수 없었다.
3단계:당일 개방, 예산 방어, 사흘 뒤 판단
첫째, 출시 당일 전원에게 개방하되 일괄 '실험용' 태그를 붙인다. 신모델은 자체 개발 Unity Gateway로 배포된다. 거버넌스·비용 관리·관측 가능성의 중앙 허브로, 직원 PC의 Claude Code, Codex, 자체 개발 Omnigent는 사전 설치된 UG CLI가 실행 시 최신 설정을 가져온다. 둘째, 4단계 '사용자별 예산'으로 방어한다. 월간 총상한, 일간 폭주 상한, 최상위 모델 전용 '품질 프론티어 예산', 신모델 전용 '실험 예산'으로 검증되지 않은 모델의 대규모 남용을 막는다. 셋째, 사흘 뒤 3가지 신호로 판단한다. 내부 비공개 벤치마크(오프라인 과제+신구 모델 병행 비교), 헤비 유저의 입소문, OpenTelemetry 트레이스의 비용 추적이다.
실측 데이터:Opus 5.5는 29% 하락, GPT-6 Sol은 48% 하락
9월 21일 주가 실전 테스트였다. Opus 5, GPT-6 Sol, GPT-Luna가 며칠 사이 잇따라 출시됐고, Databricks는 당일 전 직원에게 개방했다. 사흘 뒤 세 모델 모두 비용/품질 프론티어에 있음을 확인하고 정식 채택했다. 동일 코호트의 전주 대비 세션 단가 비교는 다음과 같다.
| 비교 | 구모델(세션 평균 단가) | 신모델(세션 평균 단가) | 변화 |
|---|---|---|---|
| Opus 4.8 vs Opus 5.5 | $5.94 | $4.23 | -29% |
| GPT-5.6 Sol vs GPT-6 Sol | $4.52 | $2.34 | -48% |
최종 결정은 Opus 5.5를 다음 주부터 Claude Code 기본 모델로 삼는 것이다. GPT-6 Sol은 저렴하지만 품질이 GPT-5.6 Sol에 못 미칠 때가 있어 Codex 기본값으로 삼지 않고 스마트 라우터 선택지에만 포함했다.
이 플레이북의 가치는 '어느 모델이 이겼나'가 아니라 재현 가능한 엔터프라이즈 해답에 있다. 벤치마크 점수는 자사 워크로드의 실제 성능과 같지 않으며, 선정은 실측에 기반해야 한다. 비용 통제는 선의에 맡길 수 없고 예산 메커니즘이 필요하다. Opus 5.5가 Databricks 실측에서 기본 모델로 발탁된 것은 해당 모델의 비용·성능 양면 우위를 뒷받침하기도 한다.