Source primaireIAArticle··6 min de lecture

Cloudflare lance Clef-omni : un modèle de décision qui voit, entend et tranche

Une semaine après ses premiers modèles open-weight, Cloudflare ajoute l'audio et la vidéo, divise par plus de deux le prix de Clef-flash et accélère Clef.

Cloudflare lance Clef-omni : un modèle de décision qui voit, entend et tranche
Source : Cloudflare · Cloudflare Blog · 9 octobre 2026Voir l'original ↗

En bref

Cloudflare étend sa famille de modèles de décision Clef avec Clef-omni, capable de traiter texte, images, audio et vidéo en un seul appel. Clef-flash passe à 0,038 $ par million de tokens d'entrée, moins cher que le concurrent Jev, au prix d'une fenêtre de contexte réduite, et Clef gagne jusqu'à 2× en vitesse. L'enjeu : faire de la classification et de la détection une simple brique d'API pour les workflows agentiques.

🍺 Version comptoir

Cloudflare fabrique des modèles qui ne bavardent pas : on leur pose une question fermée, ils répondent oui ou non avec un taux de confiance, point. Là, ils leur ont ajouté des oreilles et des yeux, donc tu peux envoyer la photo, le son et la vidéo d'un climatiseur et demander s'il fait un bruit suspect, sans passer par trois modèles qui se refilent le dossier. Ils racontent aussi avoir décidé le projet un vendredi soir et l'avoir entraîné pendant le week-end, ce qui en dit long sur leurs week-ends. Ce qui compte vraiment : trier, détecter et modérer devient aussi banal qu'appeler une API, et à ce prix-là, plus personne n'aura d'excuse pour laisser passer le spam.

À retenir

  1. 1

    Clef-omni accepte audio (wav, mp3), vidéo (mp4, webm), images et texte dans un seul appel API, sans pipeline de transcription ni de découpage des pistes.

  2. 2

    Le modèle repose sur Qwen3-Omni-30B-A3B-Instruct (mixture-of-experts), dont Cloudflare garde le backbone de compréhension et retire la synthèse vocale.

  3. 3

    Clef n'est pas un LLM : il ne génère pas de tokens, il fait un prefill sur tout le payload et note chaque option valide via un routage d'attention en deux étapes.

  4. 4

    Latences médianes annoncées : environ 130 ms en texte, 150 ms en image, quelques centaines de millisecondes en audio et 1,5 s pour une vidéo sonore de 21 secondes.

  5. 5

    Clef-flash passe de 0,09 $ à 0,038 $ par million de tokens d'entrée, mais sa version hébergée voit son contexte réduit de 64k à 24k tokens ; Clef reste à 0,24 $ et Clef-omni arrive à 0,15 $.

  6. 6

    Clef gagne 1,7× à 2× en latence médiane grâce au passage à SGLang, avec une intégration upstream prévue dans SGLang 0.5.22.

  7. 7

    Les benchmarks montrent que Clef-omni recule face à Clef sur plusieurs tâches, notamment Home appliances (69,3 contre 82,95) et l'ensemble des évaluations TypeSafe.

Un modèle de décision multimodal

Clef-omni est la troisième pièce de la famille Clef, lancée une semaine plus tôt avec Clef et Clef-flash. Là où Clef acceptait déjà images et tableaux de frames vidéo, Clef-omni ingère directement des fichiers audio et vidéo, en plus du texte et des images.

Cloudflare présente cela comme un changement de paradigme pour une catégorie de modèles restée essentiellement textuelle depuis l'arrivée de Jev, de TypeSafe. L'exemple fourni dans la documentation est parlant : une photo, un enregistrement sonore et une vidéo d'un appareil installé, avec trois questions oui/non sur l'étiquette visible, le bruit de fonctionnement et la rotation du ventilateur.

L'intérêt affiché est la simplification. Plus besoin d'enchaîner un modèle speech-to-text, un modèle de vision et un classifieur : un seul appel suffit pour décider à partir de n'importe quelle modalité. Les poids sont publiés sur Hugging Face.

Sous le capot : pas de génération, que du scoring

Clef-omni s'appuie sur Qwen3-Omni-30B-A3B-Instruct, un modèle mixture-of-experts déjà capable de traiter texte, image, audio et vidéo dans un même pipeline. Cloudflare conserve le backbone de compréhension et jette les composants de sortie text-to-speech.

Le modèle ne génère aucun token. Il effectue un prefill rapide sur l'ensemble du payload, avec audio et vidéo synchronisés aux frames, puis extrait les valeurs candidates depuis ses embeddings internes. Chaque option valide va d'abord chercher ses indices dans l'entrée, avant que les vecteurs de champs ne fassent une cross-attention sur tout le contexte pour calculer des scores de confiance.

L'entraînement reprend la recette de Clef : backbone Qwen3 gelé, adaptateurs LoRA, perte cross-entropy avec label smoothing combinée à une calibration par score de Brier. Une grammaire lexicale intégrée préserve la sémantique des options pour garantir des sorties contraintes par le schéma.

Des benchmarks en demi-teinte

Clef-omni se défend bien sur plusieurs tests : 97,7 de macro-F1 sur CLINC150+OOS, 94,8 sur BANKING77, 98,2 sur BFCL, 57,8 sur Amazon ESCI, soit au niveau ou au-dessus de Clef et nettement devant Jev sur certains.

Mais la multimodalité a un coût. Sur Home appliances, Clef-omni tombe à 69,3 contre 82,95 pour Clef et 97,73 pour Clef-flash. Sur When2Call, il obtient 63,3 quand Jev atteint 80,97. Sur PhishNChips, il recule à 73,2 contre 79,6 pour Clef.

Sur les évaluations de workflows de TypeSafe (factures, service client, incidents de sécurité, observabilité de traces d'agents), Clef-omni fait systématiquement moins bien que Clef, et passe sous Jev en service client (71,6 contre 76,0) comme en observabilité (65,8 contre 71,6). Le modèle omni est donc un outil pour les cas multimodaux, pas un remplaçant universel.

Clef-flash moins cher, mais avec moins de contexte

Clef-flash passe de 0,09 $ à 0,038 $ par million de tokens d'entrée, ce qui le rend moins cher que Jev selon Cloudflare. Clef reste à 0,24 $, Clef-omni démarre à 0,15 $. La conversion des images et de l'audio en tokens pour la facturation est détaillée dans la documentation.

La contrepartie : la version hébergée de Clef-flash voit sa fenêtre de contexte passer de 64k à 24k tokens. Cloudflare justifie ce choix par ses données d'usage, seules 0,24 % des requêtes dépassant 24k tokens.

Les poids sur Hugging Face restent inchangés et supportent 256k tokens en auto-hébergement. Pour les besoins plus longs, Cloudflare oriente vers Clef, qui conserve ses 64k.

Clef plus rapide grâce à SGLang

Aucun nouveau poids pour Clef : les gains viennent de la couche de serving sur Workers AI. Pour environ 800 tokens, la latence médiane passe de 262 à 152 ms ; pour environ 3 400 tokens, de 616 à 305 ms (2×) ; pour environ 16 000 tokens, de 2 721 à 1 635 ms.

Une des optimisations clés est le passage à SGLang. Cloudflare a contribué l'intégration de Clef via la PR #42721, attendue dans SGLang 0.5.22, et publie les commandes de lancement pour l'auto-hébergement sur Hugging Face et dans les cookbooks SGLang.

Ce que Cloudflare en fait en interne

Cloudflare met en avant le fait que la détection et la classification remontent dans la couche modèle : plus besoin d'une équipe de machine learning dédiée ni d'un corpus maison pour couvrir un domaine spécifique.

Exemples cités : le dépôt GitHub public de la documentation ferme automatiquement les issues de spam, le CMS EmDash modère les bibliothèques de plugins contre le phishing, l'équipe data loss prevention repère des données personnelles comme des pièces d'identité, et la threat intelligence détecte des domaines malveillants. Clef est compatible avec l'API de Jev et disponible via AI Gateway : changer l'identifiant du modèle suffit pour basculer.

“Instead of setting up cascading pipelines of models that transcribe speech-to-text, or splitting audio and image channels from video, you can just call one model to make decisions across any modality.”
“We decided we wanted to do something in the decision model space on a Friday evening, trained the model over the weekend, and launched it on Thursday.”
“Even a full 21-second video clip with sound is scored in about 1.5 seconds, all in a single API call.”

Pourquoi ça compte

Cloudflare s'installe sur un créneau précis et sous-estimé : les modèles de décision, qui ne rédigent rien mais tranchent vite, avec un score calibré et un format garanti. Pour les workflows agentiques, c'est souvent ce dont on a besoin à chaque étape, bien plus qu'un LLM bavard et coûteux. Ajouter l'audio et la vidéo dans un seul appel, sous la seconde et demie, ouvre des usages concrets en inspection, modération ou support. Il faut toutefois lire les chiffres avec recul : Clef-omni régresse face à Clef sur la plupart des évaluations de workflows, et la baisse de prix de Clef-flash s'accompagne d'une coupe de contexte présentée comme anodine. La rhétorique du modèle entraîné en un week-end impressionne, mais elle tient aussi beaucoup au fait que l'essentiel du travail repose sur un backbone Qwen gelé et des LoRA. La vraie force de Cloudflare est ailleurs : l'intégration native dans son edge, son AI Gateway et ses propres produits, et la compatibilité avec l'API de Jev, qui rend le changement de fournisseur trivial. C'est une stratégie d'infrastructure autant que de modèle.

#ia#cloudflare#multimodal#open weights#agents#inférence
Source originale
Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flash
Cloudflare
Source primaireBillet officiel de Cloudflare annonçant ses propres modèles, leurs performances et leurs nouveaux tarifs.
Ouvrir l'article ↗

Pour vous

Faites-la travailler sur vos sources.

Gratuit : un mois d'articles et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.

Pour votre équipe

La même machine, sur vos sujets.

Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.

À lire aussi