Cloudflare Clef는 2026년 10월 1일 Cloudflare가 공식 블로그를 통해 정식 발표한 모델로, Workers AI 팀이 자체 훈련한 첫 모델입니다. 이 시리즈에는 Clef와 더 가벼운 Clef-flash가 있으며, 이미 Workers AI 호스팅 서비스에 출시됐고 가중치는 Hugging Face에 Apache 2.0 라이선스로 오픈소스로 공개돼 개발자가 호스팅 API를 직접 호출하거나 가중치를 내려받아 직접 배포할 수 있습니다.
글은 쓰지 않고 확률이 붙은 판단만 내놓는다
Clef는 최근 2주 사이 빠르게 주목받은 '의사결정 모델'에 속합니다. 이 개념을 널리 알린 것은 TypeSafe AI의 Jev로, 이 회사가 9월 중순에 내놓은 System One 모델은 자유로운 텍스트를 생성하지 않고 미리 정의된 질문에 예/아니요, 여러 선택지 중 하나, 점수처럼 확률이 붙은 유형화된 답을 내놓습니다. 배경은 TypeSafe AI와 Jev의 의사결정 모델 개념 을 참고하면 됩니다. 프로그램은 이런 구조화된 결과를 받으면 이를 근거로 바로 분류, 라우팅, 상향 처리, 허용을 수행할 수 있습니다. Clef는 Jev와 API가 완전히 호환돼, 이미 Jev를 쓰는 팀은 엔드포인트와 모델 이름만 바꾸면 전환할 수 있습니다.
사양 면에서 Clef는 Qwen3.8-27B를 후훈련한 모델로, 백본을 동결하고 rank-256 LoRA를 적용했으며 이미지 입력을 처리할 수 있는 비전 인코더를 갖췄습니다. 컨텍스트 길이는 64k로 Jev의 32k보다 깁니다. Clef-flash는 Qwen3.5-9B를 기반으로 하며 더 낮은 지연 시간을 노린 모델입니다.
공식 평가는 빠르지만 모든 항목에서 앞서는 것은 아니다
Cloudflare가 공개한 자체 테스트 데이터에 따르면 의도 분류 과제 BANKING77에서 Clef의 macro-F1은 94.20, Jev는 79.74였습니다. 중앙값 지연 시간은 Clef가 209.3밀리초, Clef-flash가 38.8밀리초에 불과했고 Jev는 524.1밀리초였습니다. Cloudflare는 Clef가 현재 Jev Decision Index에서 1위를 차지하고 있다고 밝혔지만, 그 한계도 분명히 해야 합니다. When2Call, BRIGHT 같은 개별 항목에서는 여전히 Jev가 앞서고 있어 Clef가 모든 항목에서 이기는 것은 아닙니다.
Cloudflare 내부에서도 이미 사용 중입니다. 위협 인텔리전스 팀은 Clef로 웹사이트 도메인을 분류하는데, 페이지 가져오기부터 렌더링, 분류까지 전 과정에 2.2초가 걸립니다. 같은 과정을 가장 빠른 범용 대형 모델인 gpt-oss-120b로 수행하면 4.7초가 걸리고 반환되는 분류도 두 개뿐이라, 전용 의사결정 모델에 비해 세분화 수준이 뚜렷하게 떨어집니다.
빠른 이유와 함께 나온 미세조정 서비스
Clef가 빠른 이유는 추론 방식이 다르기 때문입니다. 프리필을 한 번만 수행하고 자기회귀 방식으로 단어 단위로 생성하지 않으며, 비자기회귀 방식으로 각 유효한 선택지를 병렬로 점수 매기기 때문에 한 번의 순전파로 모든 선택지의 확률을 얻을 수 있습니다. 훈련 단계에서는 레이블 스무딩이 적용된 교차 엔트로피와 Brier 손실을 사용했고, RLCD(Reinforcement Learning for Calibrated Decisions)로 확률을 보정해 출력되는 신뢰도가 실제 정확도에 더 가깝도록 했습니다.
모델과 함께 출시된 것이 강화학습 미세조정 서비스입니다. 초기에는 Cloudflare의 포워드 디플로이드 엔지니어가 동행 지원하고, 이후 셀프서비스 플랫폼으로 만들 예정입니다. 구성 요소로는 요청 데이터를 쌓는 AI Gateway, rollouts를 생성하는 Workers AI, RL 샌드박스를 제공하는 Containers, 가중치를 업데이트하는 Trainer, 그리고 Replicate 인수에서 나온 기술을 바탕으로 한 재배포 단계인 BYO Model이 포함됩니다.
불과 2주 만에 의사결정 모델은 하나의 제품에서 하나의 카테고리가 됐습니다. 경쟁의 핵심은 범용 대형 모델보다 더 똑똑한지가 아니라, 에이전트 흐름에서 자주 등장하는 저위험 판단을 비싼 대형 모델 호출에서 분리해 따로 처리하는 데 있습니다. 한계도 마찬가지로 분명합니다. 의사결정 모델은 판단만 맡고 추론과 생성은 맡지 않으므로, 실제 도입 시에는 대형 모델과 반드시 함께 써야 합니다.