Cloudflare lanza Clef-omni: un modelo de decisión que ve, oye y decide
Una semana después de sus primeros modelos open-weight, Cloudflare añade audio y vídeo, divide por más de dos el precio de Clef-flash y acelera Clef.

En breve
Cloudflare amplía su familia de modelos de decisión Clef con Clef-omni, capaz de procesar texto, imágenes, audio y vídeo en una sola llamada. Clef-flash baja a 0,038 $ por millón de tokens de entrada, más barato que el competidor Jev, a costa de una ventana de contexto reducida, y Clef gana hasta 2× en velocidad. El objetivo: convertir la clasificación y la detección en un simple componente de API para flujos de trabajo agénticos.
🍺 Versión de barra
Cloudflare fabrica modelos que no charlan: les haces una pregunta cerrada y responden sí o no con un grado de confianza, punto. Ahora le han añadido oídos y ojos, así que puedes mandar la foto, el sonido y el vídeo de un aire acondicionado y preguntar si hace un ruido sospechoso, sin pasar por tres modelos que se van pasando el expediente. También cuentan que decidieron el proyecto un viernes por la noche y lo entrenaron durante el fin de semana, lo cual dice mucho de cómo son sus fines de semana. Lo que de verdad importa: clasificar, detectar y moderar se vuelve tan trivial como llamar a una API, y a ese precio ya nadie tendrá excusa para dejar pasar el spam.
Para recordar
- 1
Clef-omni acepta audio (wav, mp3), vídeo (mp4, webm), imágenes y texto en una sola llamada API, sin pipeline de transcripción ni división de pistas.
- 2
El modelo se basa en Qwen3-Omni-30B-A3B-Instruct (mixture-of-experts), del que Cloudflare conserva el backbone de comprensión y elimina la síntesis de voz.
- 3
Clef no es un LLM: no genera tokens, hace un prefill sobre todo el payload y puntúa cada opción válida mediante un enrutamiento de atención en dos etapas.
- 4
Latencias medianas anunciadas: unos 130 ms en texto, 150 ms en imagen, varios cientos de milisegundos en audio y 1,5 s para un vídeo con sonido de 21 segundos.
- 5
Clef-flash pasa de 0,09 $ a 0,038 $ por millón de tokens de entrada, pero su versión alojada ve su contexto reducido de 64k a 24k tokens; Clef se mantiene en 0,24 $ y Clef-omni llega a 0,15 $.
- 6
Clef gana de 1,7× a 2× en latencia mediana gracias al paso a SGLang, con una integración upstream prevista en SGLang 0.5.22.
- 7
Los benchmarks muestran que Clef-omni retrocede frente a Clef en varias tareas, especialmente Home appliances (69,3 frente a 82,95) y el conjunto de evaluaciones TypeSafe.
Un modelo de decisión multimodal
Clef-omni es la tercera pieza de la familia Clef, lanzada una semana antes con Clef y Clef-flash. Mientras que Clef ya aceptaba imágenes y tablas de frames de vídeo, Clef-omni ingiere directamente archivos de audio y vídeo, además de texto e imágenes.
Cloudflare presenta esto como un cambio de paradigma para una categoría de modelos que había seguido siendo esencialmente textual desde la llegada de Jev, de TypeSafe. El ejemplo que figura en la documentación es elocuente: una foto, una grabación de sonido y un vídeo de un aparato instalado, con tres preguntas de sí/no sobre la etiqueta visible, el ruido de funcionamiento y la rotación del ventilador.
El atractivo que se destaca es la simplificación. Ya no hace falta encadenar un modelo speech-to-text, un modelo de visión y un clasificador: una sola llamada basta para decidir a partir de cualquier modalidad. Los pesos se han publicado en Hugging Face.
Bajo el capó: nada de generación, solo scoring
Clef-omni se apoya en Qwen3-Omni-30B-A3B-Instruct, un modelo mixture-of-experts ya capaz de procesar texto, imagen, audio y vídeo en un mismo pipeline. Cloudflare conserva el backbone de comprensión y descarta los componentes de salida text-to-speech.
El modelo no genera ningún token. Realiza un prefill rápido sobre todo el payload, con audio y vídeo sincronizados con los frames, y luego extrae los valores candidatos a partir de sus embeddings internos. Cada opción válida busca primero sus indicios en la entrada, antes de que los vectores de campos hagan una cross-attention sobre todo el contexto para calcular puntuaciones de confianza.
El entrenamiento retoma la receta de Clef: backbone Qwen3 congelado, adaptadores LoRA, pérdida cross-entropy con label smoothing combinada con una calibración mediante score de Brier. Una gramática léxica integrada preserva la semántica de las opciones para garantizar salidas restringidas por el esquema.
Benchmarks con claroscuros
Clef-omni se defiende bien en varias pruebas: 97,7 de macro-F1 en CLINC150+OOS, 94,8 en BANKING77, 98,2 en BFCL, 57,8 en Amazon ESCI, a la par o por encima de Clef y claramente por delante de Jev en algunos casos.
Pero la multimodalidad tiene un coste. En Home appliances, Clef-omni cae a 69,3 frente a 82,95 de Clef y 97,73 de Clef-flash. En When2Call, obtiene 63,3 mientras Jev alcanza 80,97. En PhishNChips, retrocede a 73,2 frente a 79,6 de Clef.
En las evaluaciones de flujos de trabajo de TypeSafe (facturas, atención al cliente, incidentes de seguridad, observabilidad de trazas de agentes), Clef-omni rinde sistemáticamente peor que Clef, y cae por debajo de Jev en atención al cliente (71,6 frente a 76,0) y en observabilidad (65,8 frente a 71,6). El modelo omni es, por tanto, una herramienta para casos multimodales, no un sustituto universal.
Clef-flash más barato, pero con menos contexto
Clef-flash pasa de 0,09 $ a 0,038 $ por millón de tokens de entrada, lo que lo hace más barato que Jev según Cloudflare. Clef se mantiene en 0,24 $, Clef-omni parte de 0,15 $. La conversión de imágenes y audio en tokens para la facturación se detalla en la documentación.
La contrapartida: la versión alojada de Clef-flash ve su ventana de contexto pasar de 64k a 24k tokens. Cloudflare justifica esta decisión con sus datos de uso, ya que solo el 0,24 % de las solicitudes supera los 24k tokens.
Los pesos en Hugging Face permanecen sin cambios y soportan 256k tokens en auto-alojamiento. Para necesidades más largas, Cloudflare recomienda Clef, que conserva sus 64k.
Clef más rápido gracias a SGLang
Ningún peso nuevo para Clef: las ganancias provienen de la capa de serving en Workers AI. Para unos 800 tokens, la latencia mediana pasa de 262 a 152 ms; para unos 3.400 tokens, de 616 a 305 ms (2×); para unos 16.000 tokens, de 2.721 a 1.635 ms.
Una de las optimizaciones clave es el paso a SGLang. Cloudflare ha contribuido con la integración de Clef mediante la PR #42721, prevista para SGLang 0.5.22, y publica los comandos de lanzamiento para el auto-alojamiento en Hugging Face y en los cookbooks de SGLang.
Lo que Cloudflare hace internamente con esto
Cloudflare destaca que la detección y la clasificación suben a la capa del modelo: ya no hace falta un equipo de machine learning dedicado ni un corpus propio para cubrir un dominio específico.
Ejemplos citados: el repositorio público de GitHub de la documentación cierra automáticamente los issues de spam, el CMS EmDash modera las bibliotecas de plugins contra el phishing, el equipo de data loss prevention detecta datos personales como documentos de identidad, y la inteligencia de amenazas detecta dominios maliciosos. Clef es compatible con la API de Jev y está disponible a través de AI Gateway: basta con cambiar el identificador del modelo para migrar.
“Instead of setting up cascading pipelines of models that transcribe speech-to-text, or splitting audio and image channels from video, you can just call one model to make decisions across any modality.”
“We decided we wanted to do something in the decision model space on a Friday evening, trained the model over the weekend, and launched it on Thursday.”
“Even a full 21-second video clip with sound is scored in about 1.5 seconds, all in a single API call.”
Por qué importa
Cloudflare se instala en un nicho preciso e infravalorado: los modelos de decisión, que no redactan nada pero deciden rápido, con una puntuación calibrada y un formato garantizado. Para los flujos de trabajo agénticos, esto es a menudo lo que se necesita en cada etapa, mucho más que un LLM locuaz y caro. Añadir audio y vídeo en una sola llamada, en menos de un segundo y medio, abre usos concretos en inspección, moderación o soporte. Aun así, hay que leer las cifras con cautela: Clef-omni retrocede frente a Clef en la mayoría de las evaluaciones de flujos de trabajo, y la bajada de precio de Clef-flash viene acompañada de un recorte de contexto presentado como algo trivial. La retórica del modelo entrenado en un fin de semana impresiona, pero también se debe en gran parte a que el grueso del trabajo descansa sobre un backbone Qwen congelado y unos LoRA. La verdadera fuerza de Cloudflare está en otro lugar: la integración nativa en su edge, su AI Gateway y sus propios productos, y la compatibilidad con la API de Jev, que hace trivial el cambio de proveedor. Es una estrategia de infraestructura tanto como de modelo.
Para ti
Ponla a trabajar con tus fuentes.
Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.
Para tu equipo
La misma máquina, sobre tus temas.
Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.
Sigue leyendo
#geminiHoyGemini agent: Google Cloud quiere un único agente para todo el trabajo
En el Gemini at Work 2026, Thomas Kurian presenta un agente único, persistente y multi-modelo, que incluso recibe su propia dirección de correo corporativa.
Fuente · Google Cloud Blog · Gemini at Work 2026: Introducing Gemini agent
#políticaHoyAdam Schiff: el Congreso frente a la IA, entre la Sección 230 y la ley de Murphy
El senador demócrata de California desmonta el pacto voluntario firmado en la Casa Blanca y aboga por una «FDA de la IA», reconociendo al mismo tiempo que el Congreso nunca supo regular la tecnología.
Fuente · The Verge – Decoder · Sen. Adam Schiff on making Congress relevant in the AI age
#open sourceHoyBeam: Reflection lanza un MoE abierto de 501B apostando por el RL masivo
Con 501.000 millones de parámetros, 23.000 millones activos y 100 millones de rollouts de reinforcement learning, Reflection quiere demostrar que Occidente todavía puede competir en el open-weight.
Fuente · Reflection AI · Introducing Beam: Reflection's 501B open-weight model