Fonte primariaIAArticolo··6 min di lettura

Clef: Cloudflare lancia i propri modelli di decisione, open source

Con Clef e Clef-flash, Cloudflare entra nel mercato nascente dei «decision model» e vi aggiunge una piattaforma di fine-tuning tramite reinforcement learning.

Clef: Cloudflare lancia i propri modelli di decisione, open source
Fonte : Cloudflare · Cloudflare Blog · 1 ottobre 2026Vedi l'originale ↗

Chi ne parla

Ripresa da 3 testate · 1 tech · 2 forum · 4 post social

In breve

Cloudflare pubblica Clef e Clef-flash, due modelli di decisione open source con licenza Apache 2.0, ospitati su Workers AI e compatibili con l'API di Jev, il modello di Typesafe AI che ha lanciato la categoria. Più veloci di Jev secondo i benchmark interni, accettano immagini e un contesto di 64k token. Cloudflare lancia anche un servizio di fine-tuning tramite RL, prima accompagnato, poi in self-serve.

🍺 Versione da bancone

Un LLM è il collega brillante a cui chiedi «urgente o no?» e che ti restituisce tre paragrafi sfumati. Un decision model è quello che risponde «sì, al 92%», punto, in un quinto di secondo. Cloudflare rilascia il suo, gratuito, compatibile con quello del concorrente, e poi ti propone di addestrarlo con i tuoi dati, sui suoi server, ovviamente. Il giorno in cui gli agenti prenderanno decisioni da soli, il vero potere tornerà a chi fornisce il modello che taglia la testa al toro.

Da ricordare

  1. 1

    Clef (basato su Qwen3.8-27B) e Clef-flash (Qwen3.5-9B) sono pubblicati su Hugging Face con licenza Apache 2.0 e ospitati su Workers AI.

  2. 2

    Entrambi i modelli sono pienamente compatibili con l'API di Jev System One, il decision model di Typesafe AI, il che permette di passare dall'uno all'altro senza riscrivere il codice.

  3. 3

    Clef aggiunge un encoder visivo per classificare immagini, cosa che Jev non fa (solo testo), e raddoppia la finestra di contesto (64k contro 32k).

  4. 4

    In latenza mediana, Clef risponde in 209,3 ms e Clef-flash in 38,8 ms, contro 524,1 ms per Jev, su 43 benchmark eseguiti da Cloudflare.

  5. 5

    Sulla eval suite di Typesafe, Clef batte Jev in 3 domini su 4 (fatture, servizio clienti, incidenti di sicurezza) ma perde sull'osservabilità delle tracce degli agenti.

  6. 6

    La decisione è non autoregressiva: un solo passaggio di prefill su Qwen, poi uno scoring in parallelo delle scelte valide dello schema, senza generare testo intermedio.

  7. 7

    Cloudflare lancia un servizio di fine-tuning tramite reinforcement learning, prima con il suo team di forward-deployed engineers, poi come piattaforma self-serve.

Una nuova categoria: il decision model

Cloudflare parte da una constatazione: da qualche settimana, Jev System One, il modello di Typesafe AI, sta popolarizzando l'idea di «decision model». Non si tratta di un LLM che ragiona e genera testo, ma di un modello che produce output strutturati e limitati, veloci, economici e coerenti.

Il principio: si fornisce uno stato (un ticket di supporto, ad esempio) e delle domande tipizzate. Il modello restituisce risposte con probabilità: è urgente, quale team deve occuparsene, quale gravità. Il codice può quindi instradare, far escalare o rimandare a un umano.

A differenza dei classificatori classici, questi modelli non necessitano di essere riaddestrati a ogni nuova categoria: le opzioni sono definite nella richiesta. Cloudflare vi vede un mattone per agenti che decidono e agiscono senza un umano nel ciclo, tranne quando lo ritengono necessario.

Il caso d'uso interno: classificare domini

Il team Threat Intelligence di Cloudflare ha testato Clef, abbinato a Browser Run, per categorizzare nomi di dominio. Esempio fornito: 95% moda, 85% e-commerce, meno dell'1% phishing.

L'intero processo (recupero, rendering e classificazione della pagina) richiede 2,2 secondi con Clef. Con gpt-oss-120b, l'LLM generalista più veloce di Cloudflare, lo stesso workflow richiede 4,7 secondi e restituisce solo due categorie.

Il nome deriva dalla musica: la chiave posta all'inizio del pentagramma fissa il nome delle note successive, così come il modello fissa il quadro delle azioni future. E «CF» rimanda a Cloudflare.

Cosa porta Clef rispetto a Jev

Vengono messi in evidenza tre argomenti. Prima di tutto la visione: Clef può classificare contenuti visivi. Poi il contesto: 64k token contro 32k per Jev. Infine la qualità, misurata su benchmark selezionati a partire dal Jev Decision Index.

Gli scarti sono a volte netti. Su BANKING77, Clef ottiene 94,20 di macro-F1 contro 79,74 per Jev; su CLINC150+OOS, 97,43 contro 89,27; sul task «home appliances», Clef-flash raggiunge 97,73 contro 52,27 per Jev.

Ma Jev resta avanti su When2Call (80,97 contro 72,37) e BRIGHT (47,52 contro 45,91). Clef-flash crolla anche su CLINC150+OOS (66,77). Su PhishNChips, un altro modello della tabella supera Clef (85,35 contro 79,60).

Sul fronte latenza, Clef-flash mostra 38,8 ms in mediana e 122,4 ms al p95. Solo Laya è più veloce (5,8 ms in mediana), ma i suoi punteggi di qualità sono molto bassi. L'hosting su GPU edge riduce inoltre la latenza di rete, il che permette di inserire Clef nell'hot path di un agente.

Sotto il cofano: niente generazione, solo scoring

Clef prolunga un esperimento pubblicato da Cloudflare la settimana del lancio di Jev: adattare DiffusionGemma per ricavarne probabilità deterministiche tramite i logprobs, basandosi sui lavori di Matt Mastracci, contributore di vLLM.

Il backbone è ora Qwen, congelato: Qwen3.8-27B per Clef, Qwen3.5-9B per Clef-flash. Cloudflare addestra una testa di routing e adattatori LoRA di rango 256. Nell'inferenza basta un solo passaggio di prefill, poi le scelte valide dello schema vengono valutate in parallelo, senza generare testo token per token.

L'architettura si basa su un routing dell'attenzione in due fasi: ogni opzione va a cercare gli elementi pertinenti del prompt, poi i campi si osservano reciprocamente e rileggono il payload prima dello scoring. L'addestramento combina una cross-entropy con label smoothing e una Brier loss per calibrare le probabilità, su dati sintetici che permutano ordini di campi, prompt e schemi.

A questo si aggiunge RLCD (Reinforcement Learning for Calibrated Decisions): credito parziale per le scelte ordinali vicine, ricompensa per i record interamente corretti, penalità di riferimento per evitare la deriva di distribuzione.

La vera scommessa: il fine-tuning tramite RL

I team interni di Cloudflare vogliono versioni specializzate di Clef: smistare le segnalazioni Trust & Safety, smistare le richieste di supporto, distinguere buoni e cattivi crawler nei prodotti Bot. Cloudflare afferma di disporre di oltre 15 anni di dati di rete e decisioni etichettate per questo scopo.

Il servizio parte con il team FDE (forward-deployed engineers), in modalità assistita. L'obiettivo è poi una piattaforma self-serve per catturare i dati, fare fine-tuning e ridistribuire, tutto internamente a Cloudflare.

La catena si basa su componenti già esistenti: AI Gateway per costituire automaticamente dataset a partire dal traffico, Workers AI per generare rollout, Containers come sandbox di RL, un nuovo componente Trainer per aggiornare i pesi, e Bring Your Own Model (Cog, ereditato dall'acquisizione di Replicate) per ridistribuire.

“A decision model makes classifications to help agents decide how to act, based on certain probabilities.”
“The decision step is non-autoregressive, so there's no intermediate text to generate token by token.”
“We believe that Clef has the ability to disrupt the way we use agents, which fits naturally into Cloudflare's mission of being the agent cloud.”

Perché conta

Questo annuncio mostra con quale velocità una categoria diventi mainstream: poche settimane dopo la comparsa di Jev, Cloudflare pubblica un equivalente open source, compatibile a livello di API, e più veloce. Per Typesafe AI è una minaccia diretta: quando un concorrente riprende la tua interfaccia e offre i pesi gratuitamente, resta solo la qualità e la fiducia a fare la differenza. La posta in gioco di fondo è altrove: i decision model sono l'anello che rende autonomi gli agenti, e Cloudflare vuole essere «l'agent cloud» che li ospita, li addestra e li ridistribuisce. L'open source funge qui da prodotto civetta; il valore catturato verrà dal fine-tuning e dall'hosting in edge, che creano una forte dipendenza dalla piattaforma. Bisogna anche leggere i numeri con prudenza: i benchmark sono selezionati ed eseguiti da Cloudflare, Jev mantiene il vantaggio su diversi task, e Clef-flash mostra crolli bruschi. Infine, l'idea che un umano non sia più necessariamente richiesto nel ciclo presuppone probabilità ben calibrate; è esattamente ciò che Cloudflare dice di ottimizzare, ma sarà in produzione che lo si verificherà.

Account gratuito

Hai appena letto un articolo di AI Sources

Crea un account gratuito: un mese di archivio completo, le tue fonti riassunte come questa, le tue note ed evidenziazioni.

#cloudflare#open source#agenti#fine-tuning#reinforcement learning#llm
Fonte originale
Introducing Clef: our open-source decision models, and new RL fine-tuning platform
Cloudflare
Apri l'articolo ↗

Per te

Falla lavorare sulle tue fonti.

Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.

Per il tuo team

La stessa macchina, sui vostri temi.

Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.

Da leggere anche