PrimärquelleKIArtikel··6 Min. Lesezeit

Clef: Cloudflare bringt eigene Decision-Modelle als Open Source

Mit Clef und Clef-flash steigt Cloudflare in den aufstrebenden Markt der „Decision Models“ ein und ergänzt dies um eine Fine-Tuning-Plattform per Reinforcement Learning.

Clef: Cloudflare bringt eigene Decision-Modelle als Open Source
Quelle : Cloudflare · Cloudflare Blog · 1. Oktober 2026Original ansehen ↗

Wer darüber berichtet

Aufgegriffen von 3 Medien · 1 Tech · 2 Foren · 4 Social-Posts

Kurz gesagt

Cloudflare veröffentlicht Clef und Clef-flash, zwei Open-Source-Decision-Modelle unter Apache-2.0-Lizenz, gehostet auf Workers AI und kompatibel mit der API von Jev, dem Modell von Typesafe AI, das die Kategorie begründet hat. Laut hauseigenen Benchmarks sind sie schneller als Jev, akzeptieren Bilder und einen Kontext von 64k Tokens. Cloudflare startet außerdem einen Fine-Tuning-Dienst per RL, zunächst begleitet, später im Self-Service.

🍺 Tresen-Version

Ein LLM ist der brillante Kollege, den du fragst „dringend oder nicht?“ und der dir drei nuancierte Absätze liefert. Ein Decision Model ist derjenige, der „ja, zu 92 %“ antwortet, Punkt, in einem Fünftel einer Sekunde. Cloudflare bringt seines heraus, kostenlos, kompatibel mit dem des Konkurrenten, und bietet dir anschließend an, es mit deinen eigenen Daten zu trainieren – auf seinen Servern, natürlich. Am Tag, an dem Agenten ganz allein Entscheidungen treffen, liegt die wahre Macht bei dem, der das Modell liefert, das den Ausschlag gibt.

Das Wichtigste

  1. 1

    Clef (basierend auf Qwen3.8-27B) und Clef-flash (Qwen3.5-9B) werden auf Hugging Face unter Apache-2.0-Lizenz veröffentlicht und auf Workers AI gehostet.

  2. 2

    Beide Modelle sind vollständig kompatibel mit der API von Jev System One, dem Decision Model von Typesafe AI, wodurch ein Wechsel zwischen beiden ohne Code-Änderungen möglich ist.

  3. 3

    Clef ergänzt einen visuellen Encoder zur Klassifizierung von Bildern, wo Jev nur Text verarbeitet, und verdoppelt das Kontextfenster (64k gegenüber 32k).

  4. 4

    Bei der Median-Latenz antwortet Clef in 209,3 ms und Clef-flash in 38,8 ms, gegenüber 524,1 ms bei Jev, über 43 von Cloudflare durchgeführte Benchmarks.

  5. 5

    In der Eval-Suite von Typesafe schlägt Clef Jev in 3 von 4 Bereichen (Rechnungen, Kundenservice, Sicherheitsvorfälle), verliert aber bei der Beobachtbarkeit von Agenten-Traces.

  6. 6

    Die Entscheidung erfolgt nicht autoregressiv: ein einziger Prefill-Durchlauf auf Qwen, dann paralleles Scoring der gültigen Schema-Optionen, ohne zwischenzeitlichen Text zu generieren.

  7. 7

    Cloudflare startet einen Fine-Tuning-Dienst per Reinforcement Learning, zunächst mit seinem Team von Forward-Deployed Engineers, später als Self-Service-Plattform.

Eine neue Kategorie: das Decision Model

Cloudflare geht von einer Feststellung aus: Seit einigen Wochen popularisiert Jev System One, das Modell von Typesafe AI, die Idee des „Decision Model“. Dabei handelt es sich nicht um ein LLM, das argumentiert und Text generiert, sondern um ein Modell, das strukturierte, begrenzte Ausgaben liefert – schnell, günstig und konsistent.

Das Prinzip: Man liefert einen Zustand (etwa ein Support-Ticket) sowie typisierte Fragen. Das Modell gibt Antworten mit Wahrscheinlichkeiten zurück: Ist es dringend, welches Team sollte sich darum kümmern, welcher Schweregrad liegt vor. Der Code kann dann routen, eskalieren oder an einen Menschen weiterleiten.

Im Gegensatz zu klassischen Klassifizierern müssen diese Modelle bei jeder neuen Kategorie nicht neu trainiert werden: Die Optionen werden in der Anfrage definiert. Cloudflare sieht darin einen Baustein für Agenten, die entscheiden und handeln, ohne dass ein Mensch im Loop ist – außer wenn das Modell es für nötig hält.

Der interne Anwendungsfall: Domains klassifizieren

Das Threat-Intelligence-Team von Cloudflare hat Clef in Kombination mit Browser Run getestet, um Domainnamen zu kategorisieren. Genanntes Beispiel: 95 % Mode, 85 % E-Commerce, unter 1 % Phishing.

Der gesamte Vorgang (Abruf, Rendering und Klassifizierung der Seite) dauert mit Clef 2,2 Sekunden. Mit gpt-oss-120b, dem schnellsten generalistischen LLM von Cloudflare, dauert derselbe Workflow 4,7 Sekunden und liefert nur zwei Kategorien.

Der Name selbst stammt aus der Musik: Der Notenschlüssel am Anfang der Notenzeile legt die Namen der folgenden Noten fest, so wie das Modell den Rahmen für kommende Aktionen festlegt. Und „CF“ verweist auf Cloudflare.

Was Clef gegenüber Jev bietet

Drei Argumente werden hervorgehoben. Zunächst Vision: Clef kann visuelle Inhalte klassifizieren. Dann Kontext: 64k Tokens gegenüber 32k bei Jev. Schließlich Qualität, gemessen anhand von Benchmarks, die aus dem Jev Decision Index ausgewählt wurden.

Die Unterschiede sind teilweise deutlich. Bei BANKING77 erreicht Clef einen Makro-F1 von 94,20 gegenüber 79,74 bei Jev; bei CLINC150+OOS 97,43 gegenüber 89,27; bei der Aufgabe „home appliances“ erreicht Clef-flash 97,73 gegenüber 52,27 bei Jev.

Jev bleibt jedoch bei When2Call (80,97 gegenüber 72,37) und BRIGHT (47,52 gegenüber 45,91) vorn. Clef-flash bricht auch bei CLINC150+OOS ein (66,77). Bei PhishNChips übertrifft ein anderes Modell aus der Tabelle Clef (85,35 gegenüber 79,60).

Bei der Latenz liegt Clef-flash bei 38,8 ms im Median und 122,4 ms im p95. Nur Laya ist schneller (5,8 ms im Median), aber seine Qualitätswerte sind sehr niedrig. Das Hosting auf Edge-GPUs reduziert zudem die Netzwerklatenz, was es ermöglicht, Clef im Hot Path eines Agenten einzusetzen.

Unter der Haube: kein Generieren, sondern Scoring

Clef führt ein Experiment fort, das Cloudflare in der Woche der Jev-Veröffentlichung publizierte: DiffusionGemma anzupassen, um deterministische Wahrscheinlichkeiten über die Logprobs zu gewinnen, gestützt auf die Arbeiten von Matt Mastracci, einem Mitwirkenden bei vLLM.

Das Backbone ist nun Qwen, eingefroren: Qwen3.8-27B für Clef, Qwen3.5-9B für Clef-flash. Cloudflare trainiert einen Routing-Kopf sowie LoRA-Adapter mit Rang 256. Bei der Inferenz genügt ein einziger Prefill-Durchlauf, anschließend werden die gültigen Optionen des Schemas parallel bewertet, ohne Text Token für Token zu generieren.

Die Architektur beruht auf einem zweistufigen Attention-Routing: Jede Option sucht die relevanten Elemente des Prompts heraus, dann beobachten sich die Felder gegenseitig und lesen die Nutzlast vor dem Scoring erneut. Das Training kombiniert Cross-Entropy mit Label Smoothing und einen Brier-Loss zur Kalibrierung der Wahrscheinlichkeiten, auf synthetischen Daten, die Feldreihenfolgen, Prompts und Schemata permutieren.

Hinzu kommt RLCD (Reinforcement Learning for Calibrated Decisions): partielle Belohnung für benachbarte ordinale Entscheidungen, Belohnung für vollständig korrekte Datensätze, Referenz-Strafe, um Distributionsdrift zu vermeiden.

Die eigentliche Wette: Fine-Tuning per RL

Die internen Teams von Cloudflare wollen spezialisierte Versionen von Clef: Trust-&-Safety-Meldungen sortieren, Support-Anfragen sortieren, gute von schlechten Crawlern in den Bot-Produkten unterscheiden. Cloudflare gibt an, dafür über mehr als 15 Jahre an Netzwerkdaten und gelabelten Entscheidungen zu verfügen.

Der Dienst startet mit dem FDE-Team (Forward-Deployed Engineers), begleitend. Ziel ist anschließend eine Self-Service-Plattform, um Daten zu erfassen, zu feintunen und neu zu deployen, vollständig bei Cloudflare.

Die Kette stützt sich auf bestehende Bausteine: AI Gateway, um automatisch Datensätze aus dem Traffic zu erstellen, Workers AI, um Rollouts zu generieren, Containers als RL-Sandbox, eine neue Komponente namens Trainer zur Aktualisierung der Gewichte, und Bring Your Own Model (Cog, geerbt von der Replicate-Übernahme) zum erneuten Deployment.

“A decision model makes classifications to help agents decide how to act, based on certain probabilities.”
“The decision step is non-autoregressive, so there's no intermediate text to generate token by token.”
“We believe that Clef has the ability to disrupt the way we use agents, which fits naturally into Cloudflare's mission of being the agent cloud.”

Warum es zählt

Diese Ankündigung zeigt, wie schnell eine Kategorie zur Massenware wird: wenige Wochen nach dem Erscheinen von Jev veröffentlicht Cloudflare ein äquivalentes Open-Source-Modell, API-kompatibel und schneller. Für Typesafe AI ist das eine direkte Bedrohung: Wenn ein Konkurrent deine Schnittstelle übernimmt und zudem die Gewichte offenlegt, bleibt dir nur noch Qualität und Vertrauen. Der eigentliche Kern liegt anderswo: Decision Models sind das Glied, das autonome Agenten erst möglich macht, und Cloudflare will der „Agent Cloud“ sein, die sie hostet, trainiert und neu ausliefert. Open Source dient hier als Lockmittel; der eingefangene Wert kommt aus Fine-Tuning und Edge-Hosting, die eine starke Plattformbindung schaffen. Man sollte die Zahlen auch mit Vorsicht lesen: Die Benchmarks wurden von Cloudflare ausgewählt und durchgeführt, Jev behält bei mehreren Aufgaben die Oberhand, und Clef-flash zeigt teils drastische Einbrüche. Schließlich setzt die Idee, dass ein Mensch nicht mehr zwingend im Loop sein muss, gut kalibrierte Wahrscheinlichkeiten voraus; genau das will Cloudflare optimiert haben, aber erst im Produktivbetrieb wird sich das zeigen.

Kostenloses Konto

Sie haben gerade einen Artikel von AI Sources gelesen

Erstellen Sie ein kostenloses Konto: ein Monat Archiv in voller Länge, Ihre eigenen Quellen zusammengefasst wie diese, Ihre Notizen und Markierungen.

#cloudflare#open source#agenten#fine-tuning#reinforcement learning#llm
Originalquelle
Introducing Clef: our open-source decision models, and new RL fine-tuning platform
Cloudflare
Artikel öffnen ↗

Für dich

Lass sie mit deinen Quellen arbeiten.

Kostenlos: einen Monat Artikel und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.

Für dein Team

Dieselbe Maschine, zu euren Themen.

Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.

Weiterlesen