Clef: Cloudflare lanza sus propios modelos de decisión, open source
Con Clef y Clef-flash, Cloudflare entra en el mercado naciente de los «decision models» y añade una plataforma de fine-tuning por reinforcement learning.

Quién habla de ello
Retomada por 3 medios · 1 tech · 2 foros · 4 publicaciones en redes
En breve
Cloudflare publica Clef y Clef-flash, dos modelos de decisión open source bajo licencia Apache 2.0, alojados en Workers AI y compatibles con la API de Jev, el modelo de Typesafe AI que lanzó la categoría. Más rápidos que Jev según los benchmarks propios, aceptan imágenes y un contexto de 64k tokens. Cloudflare también lanza un servicio de fine-tuning por RL, primero acompañado, luego en self-serve.
🍺 Versión de barra
Un LLM es ese colega brillante al que le preguntas «¿urgente o no?» y te suelta tres párrafos matizados. Un modelo de decisión es el que responde «sí, al 92 %», punto, en un quinto de segundo. Cloudflare saca el suyo, gratis, compatible con el de la competencia, y encima te propone entrenarlo con tus propios datos, en sus servidores, cómo no. El día en que los agentes tomen decisiones solos, el verdadero poder será para quien proporcione el modelo que decide.
Para recordar
- 1
Clef (basado en Qwen3.8-27B) y Clef-flash (Qwen3.5-9B) se publican en Hugging Face bajo licencia Apache 2.0 y se alojan en Workers AI.
- 2
Ambos modelos son totalmente compatibles con la API de Jev System One, el modelo de decisión de Typesafe AI, lo que permite pasar de uno a otro sin reescribir el código.
- 3
Clef añade un encoder visual para clasificar imágenes, algo que Jev no hace al tratar solo texto, y duplica la ventana de contexto (64k frente a 32k).
- 4
En latencia mediana, Clef responde en 209,3 ms y Clef-flash en 38,8 ms, frente a 524,1 ms de Jev, en 43 benchmarks ejecutados por Cloudflare.
- 5
En la eval suite de Typesafe, Clef bate a Jev en 3 de 4 dominios (facturas, atención al cliente, incidentes de seguridad) pero pierde en observabilidad de trazas de agentes.
- 6
La decisión es no autorregresiva: un único prefill sobre Qwen, y luego un scoring en paralelo de las opciones válidas del esquema, sin generar texto intermedio.
- 7
Cloudflare lanza un servicio de fine-tuning por reinforcement learning, primero con su equipo de forward-deployed engineers, luego como plataforma self-serve.
Una nueva categoría: el modelo de decisión
Cloudflare parte de una constatación: desde hace unas semanas, Jev System One, el modelo de Typesafe AI, populariza la idea de «decision model». No se trata de un LLM que razona y genera texto, sino de un modelo que produce salidas estructuradas y acotadas, rápido, barato y de forma coherente.
El principio: se aporta un estado (un ticket de soporte, por ejemplo) y preguntas tipadas. El modelo devuelve respuestas con probabilidades: si es urgente, qué equipo debe encargarse, qué gravedad tiene. El código puede entonces enrutar, escalar o derivar a un humano.
A diferencia de los clasificadores clásicos, estos modelos no necesitan reentrenarse con cada nueva categoría: las opciones se definen en la propia solicitud. Cloudflare ve en ello una pieza clave para agentes que deciden y actúan sin humano en el bucle, salvo cuando lo consideren necesario.
El caso de uso interno: clasificar dominios
El equipo de Threat Intelligence de Cloudflare probó Clef, combinado con Browser Run, para categorizar nombres de dominio. Ejemplo dado: 95 % moda, 85 % e-commerce, menos de 1 % phishing.
El conjunto (recuperación, renderizado y clasificación de la página) tarda 2,2 segundos con Clef. Con gpt-oss-120b, el LLM generalista más rápido de Cloudflare, el mismo flujo tarda 4,7 segundos y solo devuelve dos categorías.
El nombre viene de la música: la clave (clef) colocada al inicio del pentagrama fija el nombre de las notas que siguen, igual que el modelo fija el marco de las acciones futuras. Y «CF» remite a Cloudflare.
Lo que Clef aporta frente a Jev
Se destacan tres argumentos. Primero la visión: Clef puede clasificar contenido visual. Luego el contexto: 64k tokens frente a 32k de Jev. Por último la calidad, medida en benchmarks seleccionados a partir del Jev Decision Index.
Las diferencias son a veces notables. En BANKING77, Clef obtiene 94,20 de macro-F1 frente a 79,74 de Jev; en CLINC150+OOS, 97,43 frente a 89,27; en la tarea «home appliances», Clef-flash alcanza 97,73 frente a 52,27 de Jev.
Pero Jev sigue por delante en When2Call (80,97 frente a 72,37) y BRIGHT (47,52 frente a 45,91). Clef-flash también se desploma en CLINC150+OOS (66,77). En PhishNChips, otro modelo de la tabla supera a Clef (85,35 frente a 79,60).
En cuanto a latencia, Clef-flash registra 38,8 ms en mediana y 122,4 ms en p95. Solo Laya es más rápido (5,8 ms en mediana), pero sus puntuaciones de calidad son muy bajas. Alojarlo en GPU edge reduce además la latencia de red, lo que permite colocar Clef en el hot path de un agente.
Bajo el capó: nada de generación, solo scoring
Clef prolonga un experimento publicado por Cloudflare la semana del lanzamiento de Jev: adaptar DiffusionGemma para extraer probabilidades deterministas vía los logprobs, apoyándose en los trabajos de Matt Mastracci, colaborador de vLLM.
El backbone ahora es Qwen, congelado: Qwen3.8-27B para Clef, Qwen3.5-9B para Clef-flash. Cloudflare entrena una cabeza de routing y adaptadores LoRA de rango 256. En la inferencia, basta un único paso de prefill, y luego se puntúan en paralelo las opciones válidas del esquema, sin generar texto token a token.
La arquitectura se apoya en un enrutamiento de atención en dos etapas: cada opción busca los elementos relevantes del prompt, luego los campos se observan entre sí y releen la carga útil antes del scoring. El entrenamiento combina una cross-entropy con label smoothing y una Brier loss para calibrar las probabilidades, sobre datos sintéticos que permutan orden de campos, prompts y esquemas.
A esto se suma RLCD (Reinforcement Learning for Calibrated Decisions): crédito parcial para opciones ordinales vecinas, recompensa de los registros totalmente correctos, penalización de referencia para evitar la deriva de distribución.
La verdadera apuesta: el fine-tuning por RL
Los equipos internos de Cloudflare quieren versiones especializadas de Clef: clasificar reportes de Trust & Safety, triar solicitudes de soporte, distinguir buenos y malos crawlers en los productos Bot. Cloudflare dice disponer de más de 15 años de datos de red y decisiones etiquetadas para ello.
El servicio arranca con el equipo FDE (forward-deployed engineers), de forma acompañada. El objetivo después es una plataforma self-serve para capturar datos, hacer fine-tuning y redesplegar, todo dentro de Cloudflare.
La cadena se apoya en piezas ya existentes: AI Gateway para construir datasets automáticamente a partir del tráfico, Workers AI para generar rollouts, Containers como sandbox de RL, un nuevo componente Trainer para actualizar los pesos, y Bring Your Own Model (Cog, heredado de la adquisición de Replicate) para redesplegar.
“A decision model makes classifications to help agents decide how to act, based on certain probabilities.”
“The decision step is non-autoregressive, so there's no intermediate text to generate token by token.”
“We believe that Clef has the ability to disrupt the way we use agents, which fits naturally into Cloudflare's mission of being the agent cloud.”
Por qué importa
Este anuncio muestra la velocidad a la que se banaliza una categoría: pocas semanas después de la aparición de Jev, Cloudflare publica un equivalente open source, compatible a nivel de API, y más rápido. Para Typesafe AI es una amenaza directa: cuando un competidor retoma tu interfaz y ofrece los pesos, solo te queda la calidad y la confianza. Lo de fondo está en otro sitio: los modelos de decisión son el eslabón que hace posibles los agentes autónomos, y Cloudflare quiere ser «el agent cloud» que los aloja, entrena y redespliega. El open source funciona aquí como producto gancho; el valor capturado vendrá del fine-tuning y del alojamiento en edge, que generan una fuerte dependencia de la plataforma. Conviene también leer las cifras con cautela: los benchmarks son seleccionados y ejecutados por Cloudflare, Jev mantiene ventaja en varias tareas, y Clef-flash muestra caídas bruscas. Por último, la idea de que un humano ya no sea necesariamente imprescindible en el bucle supone probabilidades bien calibradas; es precisamente lo que Cloudflare dice optimizar, pero será en producción donde se verifique.
Cuenta gratis
Acabas de leer un artículo de AI Sources
Crea una cuenta gratuita: un mes de archivo completo, tus propias fuentes resumidas como esta, tus notas y subrayados.
Para ti
Ponla a trabajar con tus fuentes.
Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.
Para tu equipo
La misma máquina, sobre tus temas.
Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.
Sigue leyendo
#geminiAyerGemini 4 Argon: Google lanza su modelo más potente, pero primero para los defensores
Google anuncia un modelo de frontera que reescribe núcleos en Rust y rastrea vulnerabilidades, y luego lo guarda bajo llave mientras blinda las salvaguardas.
Fuente · Le blog de Google (The Keyword) · Gemini 4 Argon: our next era of frontier intelligence
#evaluaciónAyerPilotar un LLM tiene un precio: Apple mide lo que el steering cuesta en fluidez
Un estudio de Apple y la Universitat Pompeu Fabra muestra que los métodos de control más eficaces suelen ser los que más dañan el texto producido.
Fuente · Apple Machine Learning Research · On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study
#californiaAyerCalifornia: Newsom firma 13 leyes de IA, desde RR.HH. hasta laboratorios de síntesis genética
Despidos por algoritmo, vigilancia laboral, deepfakes, ADN sintético: Sacramento sigue acumulando salvaguardas mientras Washington mira hacia otro lado.
Fuente · Governor of California · California's nation-leading AI framework just got stronger, Governor Newsom signs more first-in-the-nation worker protections and more