Source primaireIAArticle··6 min de lecture

Clef : Cloudflare lance ses propres modèles de décision, open source

Avec Clef et Clef-flash, Cloudflare entre sur le marché naissant des « decision models » et y ajoute une plateforme de fine-tuning par reinforcement learning.

Clef : Cloudflare lance ses propres modèles de décision, open source
Source : Cloudflare · Cloudflare Blog · 1 octobre 2026Voir l'original ↗

Qui en parle

Repris par 3 médias · 1 tech · 2 forums · 4 posts réseaux

En bref

Cloudflare publie Clef et Clef-flash, deux modèles de décision open source sous licence Apache 2.0, hébergés sur Workers AI et compatibles avec l'API de Jev, le modèle de Typesafe AI qui a lancé la catégorie. Plus rapides que Jev selon les benchmarks maison, ils acceptent les images et un contexte de 64k tokens. Cloudflare lance aussi un service de fine-tuning par RL, d'abord accompagné, puis en self-serve.

🍺 Version comptoir

Un LLM, c'est le collègue brillant à qui tu demandes « urgent ou pas ? » et qui te rend trois paragraphes nuancés. Un modèle de décision, c'est celui qui répond « oui, à 92 % », point, en un cinquième de seconde. Cloudflare sort le sien, gratuit, compatible avec celui du concurrent, et te propose ensuite de le dresser avec tes propres données, sur ses serveurs, évidemment. Le jour où les agents prennent des décisions tout seuls, le vrai pouvoir revient à celui qui fournit le modèle qui tranche.

À retenir

  1. 1

    Clef (basé sur Qwen3.8-27B) et Clef-flash (Qwen3.5-9B) sont publiés sur Hugging Face sous licence Apache 2.0 et hébergés sur Workers AI.

  2. 2

    Les deux modèles sont entièrement compatibles avec l'API de Jev System One, le modèle de décision de Typesafe AI, ce qui permet de passer de l'un à l'autre sans réécrire le code.

  3. 3

    Clef ajoute un encodeur visuel pour classer des images, là où Jev ne traite que du texte, et double la fenêtre de contexte (64k contre 32k).

  4. 4

    En latence médiane, Clef répond en 209,3 ms et Clef-flash en 38,8 ms, contre 524,1 ms pour Jev, sur 43 benchmarks exécutés par Cloudflare.

  5. 5

    Sur l'eval suite de Typesafe, Clef bat Jev dans 3 domaines sur 4 (factures, service client, incidents de sécurité) mais perd sur l'observabilité des traces d'agents.

  6. 6

    La décision est non autorégressive : une seule passe de prefill sur Qwen, puis un scoring en parallèle des choix valides du schéma, sans générer de texte intermédiaire.

  7. 7

    Cloudflare lance un service de fine-tuning par reinforcement learning, d'abord avec son équipe de forward-deployed engineers, puis sous forme de plateforme self-serve.

Une nouvelle catégorie : le modèle de décision

Cloudflare part d'un constat : depuis quelques semaines, Jev System One, le modèle de Typesafe AI, popularise l'idée de « decision model ». Il ne s'agit pas d'un LLM qui raisonne et génère du texte, mais d'un modèle qui produit des sorties structurées et bornées, vite, pour pas cher et de façon cohérente.

Le principe : on fournit un état (un ticket de support, par exemple) et des questions typées. Le modèle renvoie des réponses avec des probabilités : est-ce urgent, quelle équipe doit s'en charger, quelle gravité. Le code peut alors router, escalader ou renvoyer vers un humain.

Contrairement aux classifieurs classiques, ces modèles n'ont pas besoin d'être réentraînés à chaque nouvelle catégorie : les options sont définies dans la requête. Cloudflare y voit une brique pour des agents qui décident et agissent sans humain dans la boucle, sauf quand ils le jugent nécessaire.

Le cas d'usage interne : classer des domaines

L'équipe Threat Intelligence de Cloudflare a testé Clef, couplé à Browser Run, pour catégoriser des noms de domaine. Exemple donné : 95 % mode, 85 % e-commerce, moins de 1 % phishing.

L'ensemble (récupération, rendu et classification de la page) prend 2,2 secondes avec Clef. Avec gpt-oss-120b, le LLM généraliste le plus rapide de Cloudflare, le même workflow prend 4,7 secondes et ne renvoie que deux catégories.

Le nom, lui, vient de la musique : la clef placée en début de portée fixe le nom des notes qui suivent, comme le modèle fixe le cadre des actions à venir. Et « CF » renvoie à Cloudflare.

Ce que Clef apporte face à Jev

Trois arguments sont mis en avant. D'abord la vision : Clef peut classer du contenu visuel. Ensuite le contexte : 64k tokens contre 32k pour Jev. Enfin la qualité, mesurée sur des benchmarks retenus à partir du Jev Decision Index.

Les écarts sont parfois nets. Sur BANKING77, Clef obtient 94,20 de macro-F1 contre 79,74 pour Jev ; sur CLINC150+OOS, 97,43 contre 89,27 ; sur la tâche « home appliances », Clef-flash atteint 97,73 contre 52,27 pour Jev.

Mais Jev reste devant sur When2Call (80,97 contre 72,37) et BRIGHT (47,52 contre 45,91). Clef-flash s'effondre aussi sur CLINC150+OOS (66,77). Sur PhishNChips, un autre modèle du tableau dépasse Clef (85,35 contre 79,60).

Côté latence, Clef-flash affiche 38,8 ms en médiane et 122,4 ms au p95. Seul Laya est plus rapide (5,8 ms en médiane), mais ses scores de qualité sont très bas. L'hébergement sur des GPU en edge réduit en plus la latence réseau, ce qui permet de placer Clef dans le hot path d'un agent.

Sous le capot : pas de génération, du scoring

Clef prolonge une expérience publiée par Cloudflare la semaine de la sortie de Jev : adapter DiffusionGemma pour en tirer des probabilités déterministes via les logprobs, en s'appuyant sur les travaux de Matt Mastracci, contributeur à vLLM.

Le backbone est désormais Qwen, gelé : Qwen3.8-27B pour Clef, Qwen3.5-9B pour Clef-flash. Cloudflare entraîne une tête de routage et des adaptateurs LoRA de rang 256. À l'inférence, une seule passe de prefill suffit, puis les choix valides du schéma sont scorés en parallèle, sans générer de texte token par token.

L'architecture repose sur un routage d'attention en deux étapes : chaque option va chercher les éléments pertinents du prompt, puis les champs s'observent entre eux et relisent la charge utile avant le scoring. L'entraînement combine une cross-entropy avec label smoothing et une Brier loss pour calibrer les probabilités, sur des données synthétiques qui permutent ordres de champs, prompts et schémas.

S'y ajoute RLCD (Reinforcement Learning for Calibrated Decisions) : crédit partiel pour les choix ordinaux voisins, récompense des enregistrements entièrement justes, pénalité de référence pour éviter la dérive de distribution.

Le vrai pari : le fine-tuning par RL

Les équipes internes de Cloudflare veulent des versions spécialisées de Clef : trier les signalements Trust & Safety, trier les demandes de support, distinguer bons et mauvais crawlers dans les produits Bot. Cloudflare dit disposer de plus de 15 ans de données réseau et de décisions étiquetées pour cela.

Le service démarre avec l'équipe FDE (forward-deployed engineers), en accompagnement. L'objectif est ensuite une plateforme self-serve pour capturer les données, fine-tuner et redéployer, entièrement chez Cloudflare.

La chaîne s'appuie sur des briques existantes : AI Gateway pour constituer automatiquement des datasets à partir du trafic, Workers AI pour générer des rollouts, Containers comme sandbox de RL, un nouveau composant Trainer pour mettre à jour les poids, et Bring Your Own Model (Cog, hérité du rachat de Replicate) pour redéployer.

“A decision model makes classifications to help agents decide how to act, based on certain probabilities.”
“The decision step is non-autoregressive, so there's no intermediate text to generate token by token.”
“We believe that Clef has the ability to disrupt the way we use agents, which fits naturally into Cloudflare's mission of being the agent cloud.”

Pourquoi ça compte

Cette annonce montre à quelle vitesse une catégorie se banalise : quelques semaines après l'apparition de Jev, Cloudflare publie un équivalent open source, compatible API, et plus rapide. Pour Typesafe AI, c'est une menace directe : quand un concurrent reprend votre interface et offre les poids, il ne vous reste que la qualité et la confiance. L'enjeu de fond est ailleurs : les modèles de décision sont le maillon qui rend les agents autonomes, et Cloudflare veut être « l'agent cloud » qui les héberge, les entraîne et les redéploie. L'open source sert ici de produit d'appel ; la valeur captée viendra du fine-tuning et de l'hébergement en edge, qui créent une forte dépendance à la plateforme. Il faut aussi lire les chiffres avec prudence : les benchmarks sont sélectionnés et exécutés par Cloudflare, Jev garde l'avantage sur plusieurs tâches, et Clef-flash montre des chutes brutales. Enfin, l'idée qu'un humain n'est plus forcément nécessaire dans la boucle suppose des probabilités bien calibrées ; c'est précisément ce que Cloudflare dit optimiser, mais c'est en production que cela se vérifiera.

Compte gratuit

Vous venez de lire un article d'AI Sources

Créez un compte gratuit : un mois d'archives en entier, vos propres sources résumées comme celle-ci, vos notes et surlignages.

#cloudflare#open source#agents#fine-tuning#reinforcement learning#llm
Source originale
Introducing Clef: our open-source decision models, and new RL fine-tuning platform
Cloudflare
Source primaireBillet officiel de Cloudflare annonçant ses propres modèles et son propre service de fine-tuning.
Ouvrir l'article ↗

Pour vous

Faites-la travailler sur vos sources.

Gratuit : un mois d'articles et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.

Pour votre équipe

La même machine, sur vos sujets.

Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.

À lire aussi