Cloudflare lancia Clef-omni: un modello di decisione che vede, sente e decide
Una settimana dopo i primi modelli open-weight, Cloudflare aggiunge audio e video, dimezza abbondantemente il prezzo di Clef-flash e accelera Clef.

In breve
Cloudflare estende la sua famiglia di modelli di decisione Clef con Clef-omni, capace di elaborare testo, immagini, audio e video in un'unica chiamata. Clef-flash scende a 0,038 $ per milione di token di input, più economico del concorrente Jev, al prezzo di una finestra di contesto ridotta, e Clef guadagna fino a 2× in velocità. La posta in gioco: trasformare la classificazione e il rilevamento in un semplice mattoncino API per i workflow agentici.
🍺 Versione da bancone
Cloudflare costruisce modelli che non chiacchierano: gli poni una domanda chiusa, rispondono sì o no con un tasso di confidenza, punto. Stavolta gli hanno aggiunto orecchie e occhi, quindi puoi inviare la foto, il suono e il video di un climatizzatore e chiedere se fa un rumore sospetto, senza passare per tre modelli che si rimpallano il dossier. Raccontano anche di aver deciso il progetto un venerdì sera e di averlo addestrato durante il weekend, il che la dice lunga sui loro weekend. Quello che conta davvero: ordinare, rilevare e moderare diventa banale come chiamare un'API, e a questo prezzo, nessuno avrà più scuse per lasciar passare lo spam.
Da ricordare
- 1
Clef-omni accetta audio (wav, mp3), video (mp4, webm), immagini e testo in un'unica chiamata API, senza pipeline di trascrizione né suddivisione delle tracce.
- 2
Il modello si basa su Qwen3-Omni-30B-A3B-Instruct (mixture-of-experts), di cui Cloudflare mantiene il backbone di comprensione eliminando la sintesi vocale.
- 3
Clef non è un LLM: non genera token, esegue un prefill sull'intero payload e valuta ogni opzione valida tramite un routing dell'attenzione in due fasi.
- 4
Latenze mediane dichiarate: circa 130 ms in testo, 150 ms in immagine, qualche centinaio di millisecondi in audio e 1,5 s per un video sonoro di 21 secondi.
- 5
Clef-flash passa da 0,09 $ a 0,038 $ per milione di token di input, ma la sua versione hosted vede il contesto ridotto da 64k a 24k token; Clef resta a 0,24 $ e Clef-omni arriva a 0,15 $.
- 6
Clef guadagna da 1,7× a 2× in latenza mediana grazie al passaggio a SGLang, con un'integrazione upstream prevista in SGLang 0.5.22.
- 7
I benchmark mostrano che Clef-omni arretra rispetto a Clef su diversi task, in particolare Home appliances (69,3 contro 82,95) e l'intero set di valutazioni TypeSafe.
Un modello di decisione multimodale
Clef-omni è il terzo tassello della famiglia Clef, lanciata una settimana prima con Clef e Clef-flash. Mentre Clef accettava già immagini e tabelle di frame video, Clef-omni ingerisce direttamente file audio e video, oltre a testo e immagini.
Cloudflare presenta questo come un cambio di paradigma per una categoria di modelli rimasta essenzialmente testuale dall'arrivo di Jev, di TypeSafe. L'esempio fornito nella documentazione è eloquente: una foto, una registrazione sonora e un video di un apparecchio installato, con tre domande sì/no sull'etichetta visibile, il rumore di funzionamento e la rotazione della ventola.
L'interesse dichiarato è la semplificazione. Non serve più concatenare un modello speech-to-text, un modello di visione e un classificatore: basta un'unica chiamata per decidere a partire da qualsiasi modalità. I pesi sono pubblicati su Hugging Face.
Sotto il cofano: niente generazione, solo scoring
Clef-omni si basa su Qwen3-Omni-30B-A3B-Instruct, un modello mixture-of-experts già capace di elaborare testo, immagine, audio e video in un'unica pipeline. Cloudflare conserva il backbone di comprensione e scarta i componenti di output text-to-speech.
Il modello non genera alcun token. Esegue un prefill rapido sull'intero payload, con audio e video sincronizzati ai frame, poi estrae i valori candidati dai suoi embedding interni. Ogni opzione valida va prima a cercare i propri indizi nell'input, prima che i vettori dei campi eseguano una cross-attention sull'intero contesto per calcolare i punteggi di confidenza.
L'addestramento riprende la ricetta di Clef: backbone Qwen3 congelato, adattatori LoRA, perdita cross-entropy con label smoothing combinata a una calibrazione tramite punteggio di Brier. Una grammatica lessicale integrata preserva la semantica delle opzioni per garantire output vincolati dallo schema.
Benchmark in chiaroscuro
Clef-omni si difende bene in diversi test: 97,7 di macro-F1 su CLINC150+OOS, 94,8 su BANKING77, 98,2 su BFCL, 57,8 su Amazon ESCI, allo stesso livello o superiore a Clef e nettamente davanti a Jev in alcuni casi.
Ma la multimodalità ha un costo. Su Home appliances, Clef-omni scende a 69,3 contro 82,95 di Clef e 97,73 di Clef-flash. Su When2Call, ottiene 63,3 mentre Jev raggiunge 80,97. Su PhishNChips, arretra a 73,2 contro 79,6 di Clef.
Sulle valutazioni dei workflow di TypeSafe (fatture, assistenza clienti, incidenti di sicurezza, osservabilità delle tracce degli agenti), Clef-omni fa sistematicamente peggio di Clef, e scende sotto Jev nell'assistenza clienti (71,6 contro 76,0) così come nell'osservabilità (65,8 contro 71,6). Il modello omni è quindi uno strumento per i casi multimodali, non un sostituto universale.
Clef-flash più economico, ma con meno contesto
Clef-flash passa da 0,09 $ a 0,038 $ per milione di token di input, il che lo rende più economico di Jev secondo Cloudflare. Clef resta a 0,24 $, Clef-omni parte da 0,15 $. La conversione delle immagini e dell'audio in token per la fatturazione è dettagliata nella documentazione.
La contropartita: la versione hosted di Clef-flash vede la sua finestra di contesto passare da 64k a 24k token. Cloudflare giustifica questa scelta con i propri dati d'uso, dato che solo lo 0,24% delle richieste supera i 24k token.
I pesi su Hugging Face restano invariati e supportano 256k token in self-hosting. Per esigenze più lunghe, Cloudflare orienta verso Clef, che mantiene i suoi 64k.
Clef più veloce grazie a SGLang
Nessun nuovo peso per Clef: i guadagni derivano dal layer di serving su Workers AI. Per circa 800 token, la latenza mediana passa da 262 a 152 ms; per circa 3.400 token, da 616 a 305 ms (2×); per circa 16.000 token, da 2.721 a 1.635 ms.
Una delle ottimizzazioni chiave è il passaggio a SGLang. Cloudflare ha contribuito all'integrazione di Clef tramite la PR #42721, attesa in SGLang 0.5.22, e pubblica i comandi di avvio per il self-hosting su Hugging Face e nei cookbook SGLang.
Cosa ne fa Cloudflare internamente
Cloudflare evidenzia il fatto che il rilevamento e la classificazione risalgono al livello del modello: non serve più un team di machine learning dedicato né un corpus proprietario per coprire un dominio specifico.
Esempi citati: il repository GitHub pubblico della documentazione chiude automaticamente le issue di spam, il CMS EmDash modera le librerie di plugin contro il phishing, il team data loss prevention individua dati personali come documenti d'identità, e la threat intelligence rileva domini malevoli. Clef è compatibile con l'API di Jev ed è disponibile tramite AI Gateway: basta cambiare l'identificativo del modello per passare da uno all'altro.
“Instead of setting up cascading pipelines of models that transcribe speech-to-text, or splitting audio and image channels from video, you can just call one model to make decisions across any modality.”
“We decided we wanted to do something in the decision model space on a Friday evening, trained the model over the weekend, and launched it on Thursday.”
“Even a full 21-second video clip with sound is scored in about 1.5 seconds, all in a single API call.”
Perché conta
Cloudflare si posiziona su una nicchia precisa e sottostimata: i modelli di decisione, che non redigono nulla ma decidono in fretta, con un punteggio calibrato e un formato garantito. Per i workflow agentici, è spesso proprio ciò di cui si ha bisogno a ogni passaggio, molto più di un LLM chiacchierone e costoso. Aggiungere audio e video in un'unica chiamata, sotto il secondo e mezzo, apre usi concreti in ispezione, moderazione o supporto. Bisogna però leggere i numeri con cautela: Clef-omni regredisce rispetto a Clef sulla maggior parte delle valutazioni di workflow, e il calo di prezzo di Clef-flash si accompagna a un taglio del contesto presentato come innocuo. La retorica del modello addestrato in un weekend impressiona, ma deriva anche molto dal fatto che il grosso del lavoro poggia su un backbone Qwen congelato e LoRA. La vera forza di Cloudflare sta altrove: l'integrazione nativa nel suo edge, nel suo AI Gateway e nei suoi stessi prodotti, e la compatibilità con l'API di Jev, che rende banale il cambio di fornitore. È una strategia infrastrutturale tanto quanto una strategia di modello.
Per te
Falla lavorare sulle tue fonti.
Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.
Per il tuo team
La stessa macchina, sui vostri temi.
Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.
Da leggere anche
#geminiOggiGemini agent: Google Cloud vuole un unico agente per tutto il lavoro
Al Gemini at Work 2026, Thomas Kurian presenta un agente unico, persistente e multi-modello, che riceve persino un proprio indirizzo e-mail aziendale.
Fonte · Google Cloud Blog · Gemini at Work 2026: Introducing Gemini agent
#politicaOggiAdam Schiff: il Congresso di fronte all'IA, tra Sezione 230 e legge di Murphy
Il senatore democratico della California smonta il patto volontario firmato alla Casa Bianca e si batte per una «FDA dell'IA», pur riconoscendo che il Congresso non ha mai saputo regolamentare la tech.
Fonte · The Verge – Decoder · Sen. Adam Schiff on making Congress relevant in the AI age
#open sourceOggiBeam: Reflection lancia un MoE aperto da 501B puntando sull'RL massiccio
Con 501 miliardi di parametri, 23 miliardi attivi e 100 milioni di rollout di reinforcement learning, Reflection vuole dimostrare che l'Occidente può ancora contare nell'open-weight.
Fonte · Reflection AI · Introducing Beam: Reflection's 501B open-weight model