ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Le modèle de décision Cloudflare Clef publié en open source : n'écrit pas un mot et rend un jugement en 38 millisecondes

Le modèle de décision Cloudflare Clef publié en open source : n'écrit pas un mot et rend un jugement en 38 millisecondes

Informations sur l’IA • Admin • • 5 vues

Cloudflare Clef a été officiellement publié par Cloudflare le 1er octobre 2026, par l'intermédiaire de son blog officiel : ce sont les premiers modèles entraînés en interne par l'équipe Workers AI. La série comprend Clef et Clef-flash, plus léger. Les deux sont désormais disponibles sur le service d'hébergement Workers AI, et les poids ont été publiés en open source sur Hugging Face sous licence Apache 2.0, si bien que les développeurs peuvent soit appeler directement l'interface hébergée, soit télécharger les poids et les déployer eux-mêmes.

Il n'écrit aucun texte, seulement des jugements assortis de probabilités

Clef appartient aux « modèles de décision » qui ont rapidement gagné en visibilité ces deux dernières semaines. Le concept a été popularisé par Jev, de TypeSafe AI : son modèle System One, lancé à la mi-septembre, ne génère pas de texte libre, mais donne, à des questions définies à l'avance, des réponses typées assorties de probabilités, par exemple oui ou non, un choix parmi plusieurs ou une note. Pour le contexte, voir Le concept de modèle de décision de TypeSafe AI et Jev. Quand un programme reçoit un résultat structuré de ce type, il peut directement classer, router, escalader ou autoriser. Clef est entièrement compatible avec l'API de Jev : les équipes qui utilisent déjà Jev n'ont qu'à changer le point de terminaison et le nom du modèle pour basculer.

Côté caractéristiques, Clef repose sur un post-entraînement de Qwen3.8-27B, avec un squelette gelé et un LoRA de rang 256, et il dispose d'un encodeur de vision capable de traiter des images en entrée. Sa longueur de contexte est de 64k, au-dessus des 32k de Jev. Clef-flash repose sur Qwen3.5-9B et vise une latence encore plus faible.

Des mesures officielles rapides, mais pas en tête partout

Selon les données de test publiées par Cloudflare, sur la tâche de classification d'intentions BANKING77, Clef a obtenu un macro-F1 de 94.20, contre 79.74 pour Jev. Pour la latence médiane, Clef est à 209.3 millisecondes, Clef-flash à seulement 38.8 millisecondes et Jev à 524.1 millisecondes. Cloudflare indique que Clef occupe actuellement la première place du Jev Decision Index, mais la limite doit être énoncée clairement : sur certains items comme When2Call et BRIGHT, Jev reste en tête, et Clef ne remporte pas chaque test.

Cloudflare l'utilise déjà en interne. Son équipe de renseignement sur les menaces s'en sert pour classer les domaines de sites web, et l'ensemble du processus, de la récupération de la page à son rendu puis à la classification, prend 2.2 secondes. Le même processus avec le plus rapide des grands modèles généralistes, gpt-oss-120b, prenait 4.7 secondes et ne renvoyait que deux catégories, un niveau de finesse nettement inférieur à celui d'un modèle de décision dédié.

Pourquoi il est rapide, et le service d'ajustement qui l'accompagne

Clef est rapide parce que son inférence fonctionne autrement : il n'effectue qu'un seul pré-remplissage, ne génère pas mot à mot de façon autorégressive, mais note en parallèle, de manière non autorégressive, chaque option valide, de sorte qu'un seul passage vers l'avant donne les probabilités de toutes les options. À l'entraînement, il a utilisé une entropie croisée avec lissage des étiquettes ainsi qu'une perte de Brier, et ses probabilités ont été calibrées par RLCD (Reinforcement Learning for Calibrated Decisions), afin que la confiance affichée soit plus proche de la justesse réelle.

Lancé en même temps que les modèles, un service d'ajustement par apprentissage par renforcement voit aussi le jour. Au départ, les ingénieurs déployés chez les clients de Cloudflare accompagneront la mise en route, puis le service deviendra une plateforme en libre-service. Ses composants comprennent AI Gateway, qui accumule les données de requêtes, Workers AI, qui génère les rollouts, Containers, qui fournissent le bac à sable d'apprentissage par renforcement, Trainer, qui met à jour les poids, et BYO Model, l'étape de redéploiement issue de la technologie provenant de l'acquisition de Replicate.

En deux semaines, les modèles de décision sont passés d'un produit unique à une catégorie. L'enjeu n'est pas d'être plus intelligent que les grands modèles généralistes, mais de sortir les jugements fréquents et à faible risque des flux d'agents des appels coûteux aux grands modèles, pour les traiter séparément. La limite est tout aussi claire : un modèle de décision ne fait que juger, il ne raisonne pas et ne génère pas, et doit donc, en usage réel, être associé à un grand modèle.

Outils Recommandés

Plus