Cloudflare Clef wurde am 1. Oktober 2026 von Cloudflare über seinen offiziellen Blog vorgestellt – es sind die ersten Modelle, die das Workers AI Team selbst trainiert hat. Die Reihe umfasst Clef und das leichtere Clef-flash. Beide sind inzwischen auf dem Hostingdienst Workers AI verfügbar, und die Gewichte wurden auf Hugging Face unter der Apache 2.0 Lizenz als Open Source veröffentlicht, sodass Entwickler entweder die gehostete Schnittstelle direkt aufrufen oder die Gewichte herunterladen und selbst betreiben können.
Es schreibt keinen Text, sondern liefert Urteile mit Wahrscheinlichkeiten
Clef gehört zu den „Entscheidungsmodellen“, die in den vergangenen zwei Wochen rasch an Aufmerksamkeit gewonnen haben. Populär gemacht hat das Konzept Jev von TypeSafe AI: Das Mitte September eingeführte Modell System One erzeugt keinen freien Text, sondern gibt auf vorab definierte Fragen typisierte Antworten mit Wahrscheinlichkeiten, etwa Ja oder Nein, eine Option aus mehreren oder eine Bewertung. Zum Hintergrund siehe Das Konzept der Entscheidungsmodelle von TypeSafe AI und Jev. Erhält ein Programm ein solches strukturiertes Ergebnis, kann es damit direkt klassifizieren, weiterleiten, eskalieren oder freigeben. Clef ist vollständig API-kompatibel zu Jev, Teams, die Jev bereits nutzen, müssen zum Wechsel nur Endpunkt und Modellname ändern.
Bei den technischen Daten basiert Clef auf einem Nachtraining von Qwen3.8-27B, mit eingefrorenem Backbone und rank-256 LoRA, und besitzt einen Vision-Encoder, der Bildeingaben verarbeiten kann. Die Kontextlänge beträgt 64k und liegt damit über den 32k von Jev. Clef-flash basiert auf Qwen3.5-9B und zielt auf noch geringere Latenz.
Offizielle Messwerte sind schnell, aber nicht überall führend
Nach den von Cloudflare veröffentlichten eigenen Testdaten erreichte Clef bei der Intent-Klassifikation BANKING77 einen macro-F1 von 94.20, Jev kam auf 79.74. Bei der Median-Latenz lag Clef bei 209.3 Millisekunden, Clef-flash bei nur 38.8 Millisekunden und Jev bei 524.1 Millisekunden. Cloudflare zufolge liegt Clef derzeit im Jev Decision Index vorn, doch die Grenze gehört dazu: Bei einzelnen Disziplinen wie When2Call und BRIGHT führt weiterhin Jev, Clef gewinnt nicht jeden einzelnen Test.
Cloudflare setzt das Modell intern bereits ein. Das Threat-Intelligence-Team klassifiziert damit Website-Domains, und vom Abrufen und Rendern der Seite bis zur Klassifikation dauert der gesamte Ablauf 2.2 Sekunden. Derselbe Ablauf mit dem schnellsten allgemeinen großen Modell, gpt-oss-120b, brauchte 4.7 Sekunden und lieferte nur zwei Kategorien zurück, also deutlich weniger fein als ein spezialisiertes Entscheidungsmodell.
Warum es so schnell ist, und der Feintuning-Dienst dazu
Clef ist schnell, weil es anders schlussfolgert: Es führt nur ein einziges Prefill aus, erzeugt nicht autoregressiv Wort für Wort, sondern bewertet jede zulässige Option nicht-autoregressiv parallel, sodass ein einziger Forward-Durchlauf die Wahrscheinlichkeiten aller Optionen liefert. Beim Training kamen Kreuzentropie mit Label Smoothing und ein Brier-Verlust zum Einsatz, und die Wahrscheinlichkeiten wurden per RLCD (Reinforcement Learning for Calibrated Decisions) kalibriert, damit die ausgegebene Zuversicht näher an der tatsächlichen Trefferquote liegt.
Zusammen mit den Modellen erscheint ein Feintuning-Dienst auf Basis von Reinforcement Learning. Anfangs begleiten die Forward Deployed Engineers von Cloudflare die Kunden, später soll daraus eine Self-Service-Plattform werden. Zu den Komponenten zählen die AI Gateway, die Anfragedaten sammelt, Workers AI zur Erzeugung von Rollouts, Containers als RL-Sandbox, der Trainer zur Aktualisierung der Gewichte und BYO Model für die erneute Bereitstellung, das auf Technik aus der Übernahme von Replicate zurückgeht.
Innerhalb von zwei Wochen sind Entscheidungsmodelle von einem einzelnen Produkt zu einer Kategorie geworden. Es geht nicht darum, klüger zu sein als allgemeine große Modelle, sondern darum, die häufigen, risikoarmen Urteile in Agentenabläufen aus teuren Aufrufen großer Modelle herauszulösen und getrennt zu bearbeiten. Die Grenze ist ebenso klar: Ein Entscheidungsmodell urteilt nur, es schlussfolgert und erzeugt nicht, und muss im praktischen Einsatz mit einem großen Modell kombiniert werden.