Cloudflare veröffentlicht Clef-omni: ein Entscheidungsmodell, das sieht, hört und urteilt
Eine Woche nach seinen ersten offenen Modellgewichten fügt Cloudflare Audio und Video hinzu, senkt den Preis von Clef-flash um mehr als die Hälfte und beschleunigt Clef.

Kurz gesagt
Cloudflare erweitert seine Clef-Familie von Entscheidungsmodellen um Clef-omni, das Text, Bilder, Audio und Video in einem einzigen Aufruf verarbeiten kann. Clef-flash sinkt auf 0,038 $ pro Million Eingabe-Tokens, günstiger als der Konkurrent Jev, allerdings auf Kosten eines verkleinerten Kontextfensters, und Clef wird bis zu 2× schneller. Der Einsatz: Klassifikation und Erkennung sollen zu einem simplen API-Baustein für agentische Workflows werden.
🍺 Tresen-Version
Cloudflare baut Modelle, die nicht plaudern: Man stellt ihnen eine geschlossene Frage, sie antworten mit Ja oder Nein samt Konfidenzwert, fertig. Jetzt haben sie Ohren und Augen bekommen, du kannst also Foto, Ton und Video einer Klimaanlage schicken und fragen, ob sie verdächtige Geräusche macht, ohne drei Modelle hintereinanderzuschalten, die sich den Fall zuschieben. Sie erzählen auch, das Projekt an einem Freitagabend beschlossen und übers Wochenende trainiert zu haben, was einiges über ihre Wochenenden aussagt. Worauf es wirklich ankommt: Sortieren, Erkennen und Moderieren wird so banal wie ein API-Aufruf, und zu diesem Preis hat niemand mehr eine Ausrede, Spam durchzulassen.
Das Wichtigste
- 1
Clef-omni akzeptiert Audio (wav, mp3), Video (mp4, webm), Bilder und Text in einem einzigen API-Aufruf, ohne Transkriptions-Pipeline oder Spuraufteilung.
- 2
Das Modell basiert auf Qwen3-Omni-30B-A3B-Instruct (mixture-of-experts), dessen Verständnis-Backbone Cloudflare beibehält, während die Sprachsynthese entfernt wird.
- 3
Clef ist kein LLM: Es generiert keine Tokens, sondern führt einen Prefill über die gesamte Payload durch und bewertet jede gültige Option per zweistufigem Attention-Routing.
- 4
Angegebene mediane Latenzen: etwa 130 ms bei Text, 150 ms bei Bild, einige Hundert Millisekunden bei Audio und 1,5 s für ein 21-sekündiges Video mit Ton.
- 5
Clef-flash sinkt von 0,09 $ auf 0,038 $ pro Million Eingabe-Tokens, doch die gehostete Version sieht ihren Kontext von 64k auf 24k Tokens reduziert; Clef bleibt bei 0,24 $, Clef-omni liegt bei 0,15 $.
- 6
Clef gewinnt dank des Wechsels zu SGLang 1,7× bis 2× an medianer Latenz, mit einer geplanten Upstream-Integration in SGLang 0.5.22.
- 7
Die Benchmarks zeigen, dass Clef-omni gegenüber Clef bei mehreren Aufgaben zurückfällt, insbesondere bei Home appliances (69,3 gegenüber 82,95) und bei allen TypeSafe-Evaluationen.
Ein multimodales Entscheidungsmodell
Clef-omni ist das dritte Element der Clef-Familie, die eine Woche zuvor mit Clef und Clef-flash gestartet wurde. Wo Clef bereits Bilder und Video-Frame-Tabellen akzeptierte, nimmt Clef-omni direkt Audio- und Videodateien auf, zusätzlich zu Text und Bildern.
Cloudflare stellt dies als Paradigmenwechsel für eine Modellkategorie dar, die seit dem Erscheinen von Jev und TypeSafe im Wesentlichen textbasiert geblieben ist. Das in der Dokumentation gelieferte Beispiel ist aufschlussreich: ein Foto, eine Tonaufnahme und ein Video eines installierten Geräts, mit drei Ja/Nein-Fragen zum sichtbaren Etikett, zum Betriebsgeräusch und zur Rotation des Ventilators.
Der ausgewiesene Vorteil ist die Vereinfachung. Kein Aneinanderreihen eines Speech-to-Text-Modells, eines Vision-Modells und eines Klassifikators mehr nötig: ein einziger Aufruf genügt, um aus jeder Modalität eine Entscheidung zu treffen. Die Gewichte werden auf Hugging Face veröffentlicht.
Unter der Haube: keine Generierung, nur Scoring
Clef-omni stützt sich auf Qwen3-Omni-30B-A3B-Instruct, ein Mixture-of-Experts-Modell, das bereits Text, Bild, Audio und Video in derselben Pipeline verarbeiten kann. Cloudflare behält den Verständnis-Backbone bei und verwirft die Text-to-Speech-Ausgabekomponenten.
Das Modell generiert keinerlei Tokens. Es führt einen schnellen Prefill über die gesamte Payload durch, wobei Audio und Video mit den Frames synchronisiert sind, und extrahiert dann die Kandidatenwerte aus seinen internen Embeddings. Jede gültige Option sucht zunächst ihre Hinweise in der Eingabe, bevor die Feldvektoren eine Cross-Attention über den gesamten Kontext ausführen, um Konfidenzwerte zu berechnen.
Das Training übernimmt das Rezept von Clef: eingefrorener Qwen3-Backbone, LoRA-Adapter, Cross-Entropy-Verlust mit Label Smoothing kombiniert mit einer Kalibrierung über den Brier-Score. Eine integrierte lexikalische Grammatik bewahrt die Semantik der Optionen, um schemakonforme Ausgaben zu garantieren.
Durchwachsene Benchmarks
Clef-omni schlägt sich in mehreren Tests gut: 97,7 Makro-F1 auf CLINC150+OOS, 94,8 auf BANKING77, 98,2 auf BFCL, 57,8 auf Amazon ESCI, also auf Augenhöhe mit oder über Clef und bei manchen deutlich vor Jev.
Doch die Multimodalität hat ihren Preis. Bei Home appliances fällt Clef-omni auf 69,3 gegenüber 82,95 bei Clef und 97,73 bei Clef-flash. Bei When2Call erreicht es 63,3, während Jev 80,97 schafft. Bei PhishNChips fällt es auf 73,2 gegenüber 79,6 bei Clef.
Bei den Workflow-Evaluationen von TypeSafe (Rechnungen, Kundenservice, Sicherheitsvorfälle, Observability von Agenten-Traces) schneidet Clef-omni durchgängig schlechter ab als Clef und liegt sogar unter Jev beim Kundenservice (71,6 gegenüber 76,0) wie auch bei der Observability (65,8 gegenüber 71,6). Das Omni-Modell ist also ein Werkzeug für multimodale Fälle, kein universeller Ersatz.
Clef-flash günstiger, aber mit weniger Kontext
Clef-flash sinkt von 0,09 $ auf 0,038 $ pro Million Eingabe-Tokens, was es laut Cloudflare günstiger macht als Jev. Clef bleibt bei 0,24 $, Clef-omni startet bei 0,15 $. Die Umrechnung von Bildern und Audio in Tokens für die Abrechnung ist in der Dokumentation detailliert beschrieben.
Der Haken: Die gehostete Version von Clef-flash sieht ihr Kontextfenster von 64k auf 24k Tokens sinken. Cloudflare begründet diese Entscheidung mit seinen Nutzungsdaten, laut denen nur 0,24 % der Anfragen über 24k Tokens hinausgehen.
Die Gewichte auf Hugging Face bleiben unverändert und unterstützen 256k Tokens im Self-Hosting. Für längere Anforderungen verweist Cloudflare auf Clef, das seine 64k beibehält.
Clef dank SGLang schneller
Keine neuen Gewichte für Clef: Die Gewinne stammen aus der Serving-Schicht auf Workers AI. Bei etwa 800 Tokens sinkt die mediane Latenz von 262 auf 152 ms; bei etwa 3.400 Tokens von 616 auf 305 ms (2×); bei etwa 16.000 Tokens von 2.721 auf 1.635 ms.
Eine der Schlüsseloptimierungen ist der Wechsel zu SGLang. Cloudflare hat die Integration von Clef über den PR #42721 beigesteuert, die für SGLang 0.5.22 erwartet wird, und veröffentlicht die Startbefehle für Self-Hosting auf Hugging Face sowie in den SGLang-Cookbooks.
Was Cloudflare intern damit macht
Cloudflare betont, dass Erkennung und Klassifikation in die Modellschicht zurückverlagert werden: kein eigenes Machine-Learning-Team und kein hausgemachter Korpus mehr nötig, um eine spezifische Domäne abzudecken.
Genannte Beispiele: Das öffentliche GitHub-Repository der Dokumentation schließt Spam-Issues automatisch, das CMS EmDash moderiert Plugin-Bibliotheken gegen Phishing, das Data-Loss-Prevention-Team erkennt personenbezogene Daten wie Ausweisdokumente, und die Threat-Intelligence-Abteilung entdeckt bösartige Domains. Clef ist kompatibel mit der API von Jev und über AI Gateway verfügbar: Es reicht, die Modell-ID zu ändern, um zu wechseln.
“Instead of setting up cascading pipelines of models that transcribe speech-to-text, or splitting audio and image channels from video, you can just call one model to make decisions across any modality.”
“We decided we wanted to do something in the decision model space on a Friday evening, trained the model over the weekend, and launched it on Thursday.”
“Even a full 21-second video clip with sound is scored in about 1.5 seconds, all in a single API call.”
Warum es zählt
Cloudflare positioniert sich in einer präzisen und unterschätzten Nische: Entscheidungsmodelle, die nichts verfassen, aber schnell urteilen, mit einem kalibrierten Score und garantiertem Format. Für agentische Workflows ist genau das oft gefragt, bei jedem einzelnen Schritt, viel mehr als ein geschwätziges und teures LLM. Audio und Video in einem einzigen Aufruf unter anderthalb Sekunden zu integrieren, eröffnet konkrete Anwendungen in Inspektion, Moderation oder Support. Man sollte die Zahlen jedoch mit Abstand lesen: Clef-omni fällt bei den meisten Workflow-Evaluationen gegenüber Clef zurück, und die Preissenkung von Clef-flash geht mit einer als harmlos dargestellten Kontextkürzung einher. Die Rhetorik vom übers Wochenende trainierten Modell beeindruckt, beruht aber auch stark darauf, dass der Großteil der Arbeit auf einem eingefrorenen Qwen-Backbone und LoRAs ruht. Die eigentliche Stärke von Cloudflare liegt anderswo: die native Integration in sein Edge-Netzwerk, sein AI Gateway und seine eigenen Produkte, sowie die Kompatibilität mit der API von Jev, die einen Anbieterwechsel trivial macht. Es ist ebenso sehr eine Infrastrukturstrategie wie eine Modellstrategie.
Für dich
Lass sie mit deinen Quellen arbeiten.
Kostenlos: einen Monat Artikel und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.
Für dein Team
Dieselbe Maschine, zu euren Themen.
Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.
Weiterlesen
#geminiHeuteGemini agent: Google Cloud will einen einzigen Agenten für die gesamte Arbeit
Bei Gemini at Work 2026 präsentiert Thomas Kurian einen einzigen, persistenten und multimodellfähigen Agenten, der sogar seine eigene Unternehmens-E-Mail-Adresse erhält.
Quelle · Google Cloud Blog · Gemini at Work 2026: Introducing Gemini agent
#politikHeuteAdam Schiff: Der Kongress und die KI – zwischen Section 230 und Murphys Gesetz
Der demokratische Senator aus Kalifornien zerlegt den im Weißen Haus unterzeichneten freiwilligen Pakt und plädiert für eine „FDA für KI“ – räumt dabei aber ein, dass der Kongress Tech-Regulierung noch nie wirklich beherrscht hat.
Quelle · The Verge – Decoder · Sen. Adam Schiff on making Congress relevant in the AI age
#open sourceHeuteBeam: Reflection bringt ein offenes 501B-MoE-Modell mit massivem RL an den Start
Mit 501 Milliarden Parametern, 23 Milliarden aktiven Parametern und 100 Millionen Reinforcement-Learning-Rollouts will Reflection beweisen, dass der Westen im Open-Weight-Rennen noch mitzählt.
Quelle · Reflection AI · Introducing Beam: Reflection's 501B open-weight model