FLUX 3 Image: Black Forest Labs apuesta por la maquetación al píxel
Con FLUX 3 Image, ya no basta con describir una imagen: se dibuja caja por caja, y luego se retoca sin que el resto se mueva.

Quién habla de ello
En breve
Black Forest Labs presenta FLUX 3 Image, el componente de imagen de su nuevo modelo multimodal FLUX 3, construido alrededor de los bounding boxes: cada elemento se coloca en una cuadrícula y luego puede modificarse de forma aislada. El modelo renderiza en 2K y 4K nativos, acepta hasta 10 referencias y puede ser pilotado tanto por un humano como por un agente. La apuesta: convertir la generación de imágenes en una herramienta de composición controlable, no en una máquina tragaperras.
🍺 Versión de barra
Hasta ahora, generar una imagen con IA era un poco como pedir en un restaurante describiendo el plato a un chef que no habla tu idioma: obtienes algo, pero rara vez lo que querías. Black Forest Labs te da ahora un plano de mesa: dibujas casillas, dices qué hay en cada una, y el modelo lo organiza todo tal cual. Y si quieres cambiar el color de un traje de baño, no te repinta la playa de paso, lo cual ya es más educado que la mayoría de los programas. Para diseñadores, agencias y todos los que producen imágenes en cadena, es la diferencia entre un juguete y una herramienta.
Para recordar
- 1
FLUX 3 es el modelo multimodal de Black Forest Labs (vídeo, audio, imágenes, acciones); FLUX 3 Image es el módulo dedicado a la generación y edición de imágenes.
- 2
La composición se basa en bounding boxes sobre una cuadrícula de 0 a 1000 en ambos ejes, sea cual sea el formato, con cada caja anotada como [y_min, x_min, y_max, x_max].
- 3
Un «layout prompt» combina una leyenda global y una tabla de elementos en JSON (id, bbox, descripción), citando la leyenda cada elemento por su id.
- 4
La edición se hace caja por caja, con varias modificaciones a la vez, con la promesa de que todo lo que no se toca permanece exactamente en su sitio.
- 5
El modelo genera en 2K y 4K nativos, hasta 5456 × 3072 píxeles en el ejemplo de la tienda de soba, y combina hasta 10 imágenes de referencia.
- 6
Pensado para agentes: un LLM puede planificar él solo la maquetación a partir de una línea de texto y un formato, quedando cada caja modificable después.
- 7
Los pesos se ofrecen bajo licencia comercial a las empresas que quieran hacer fine-tuning y desplegar el modelo en su propia infraestructura; el acceso para el público general pasa por el Playground y la API de BFL.
Componer en lugar de describir
El núcleo de FLUX 3 Image es el bounding box. Para cada elemento importante se traza una caja y se describe su contenido, y luego una frase de escena conecta el conjunto. El modelo renderiza la imagen respetando cada ubicación.
La cuadrícula está normalizada de 0 a 1000 en ambos ejes, sea cual sea la proporción elegida. El ejemplo «Le Festival du Soleil» ilustra la lógica: cinco líneas en la tabla, un título en tipografía serif color crema, una ciudad costera, una cúpula parabólica de hormigón, bañistas en silueta y una multitud en la playa.
El formato del prompt es explícito: una leyenda global de un párrafo, seguida de una tabla JSON donde cada línea lleva un id, una caja y una descripción. La leyenda menciona cada elemento por su identificador (animal_1, crowd_1…) allí donde aparece.
Una edición que no rompe nada
Segunda promesa: retocar una imagen terminada sin desnaturalizarla. Cada caja puede redescribirse, reemplazarse o moverse, y pueden aplicarse varias modificaciones en una sola pasada.
Black Forest Labs insiste en la estabilidad: lo que no se ha modificado permanece en su sitio, lo que permite encadenar rondas de edición sin que la imagen se desvíe. Las demostraciones muestran un traje de baño y una tabla de surf recoloreados, o dos buceadores añadidos a una escena existente.
Es precisamente el punto débil histórico de los modelos de difusión, que tendían a regenerarlo todo en cuanto se tocaba un detalle.
El papel discreto del upsampler
Las consultas cortas pasan por un prompt upsampler, que las transforma en leyendas densas, el formato con el que se entrenó FLUX 3. Puede reescribir la leyenda alrededor de las cajas y sugerir otros elementos.
Pero la regla es estricta: cada caja dibujada por el usuario llega al modelo tal cual, con el mismo id y las mismas coordenadas. Lo que el upsampler añade solo sobrevive si la leyenda lo referencia. Una manera de mantener la mano humana como prioridad frente a la reescritura automática.
Un modelo hecho a medida para agentes
Black Forest Labs presenta FLUX 3 Image como «designed for agents». Basta con dar una línea de texto y un formato: un LLM planifica la maquetación, escribe la leyenda y la tabla de elementos con ids semánticos.
El usuario puede luego mover las cajas que no le convenzan, generando el modelo en las demás tal como el agente las colocó. El ejemplo de «El lago de los cisnes visto entre bastidores» ilustra esta cadena.
Sin cajas en absoluto, el modelo sigue siendo un text-to-image clásico, con un seguimiento de prompt presentado como sólido y una comprensión nativa de la composición.
Usos previstos y acceso
Los casos de uso destacados son aquellos en los que muchos elementos obedecen a relaciones estrictas: texto compuesto alrededor de una foto, collages, cuadrículas de miniaturas, dobles páginas editoriales, escenas de multitud donde cada rostro tiene su lugar.
En cuanto al acceso, se pueden dibujar las cajas a mano en el Playground o enviar un layout prompt vía la API de BFL. Las empresas que generan a gran escala pueden obtener los pesos bajo licencia comercial para hacer fine-tuning y alojarlos ellas mismas, previa solicitud.
“Everything you didn't touch stays exactly where it was.”
“Every box you drew reaches the model verbatim, with the same id and the same coordinates.”
“Anything the upsampler adds survives only if the caption refers to it.”
Por qué importa
FLUX 3 Image consagra un desplazamiento en la generación de imágenes: la batalla ya no se juega solo en la belleza del renderizado, sino en el control. Los bounding boxes, la tabla JSON y la edición localizada convierten el prompt en una especificación, legible tanto por un humano como por un agente, lo cual encaja perfectamente con los flujos de producción (publicidad, prensa, e-commerce) donde se quiere una imagen precisa y reproducible. El formato estructurado también es una obviedad para los agentes: un LLM sabe escribir JSON con coordenadas mucho mejor de lo que sabe adivinar la estética de un modelo. Queda por ver que se trata de una página de producto: ningún benchmark, ningún precio, ninguna comparación con la competencia, y la promesa de que «todo lo demás no se mueve» necesita verificarse en casos difíciles. También destaca la elección de una licencia de pesos comercial, previa solicitud, en lugar de una apertura amplia: una señal de que Black Forest Labs asume ahora un posicionamiento de editor para empresas. Por último, FLUX 3 se presenta como multimodal (vídeo, audio, acciones), pero esta página solo muestra la parte de imagen: el resto de la familia será la verdadera prueba de la ambición.
Cuenta gratis
Acabas de leer un artículo de AI Sources
Crea una cuenta gratuita: un mes de archivo completo, tus propias fuentes resumidas como esta, tus notas y subrayados.
Para ti
Ponla a trabajar con tus fuentes.
Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.
Para tu equipo
La misma máquina, sobre tus temas.
Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.
Sigue leyendo
#superinteligenciaAyerHinton, Bengio, OpenAI y Anthropic firman un plan contra la explosión de inteligencia
Veintidós investigadores, incluidos directivos de OpenAI y Anthropic, sostienen que la automatización de la investigación en IA podría comprimir años de progreso en pocos meses, y que los Estados no están preparados para ello.
Fuente · Cambridge Programme on AI Science & Policy (CASP) · What if automating AI R&D triggers an intelligence explosion?
#apiAyerGPT-6: la guía de OpenAI para pasar del prototipo a producción
Tres modelos, cinco niveles de razonamiento, dos velocidades y agentes que trabajan durante horas: OpenAI publica el manual de su nueva familia.
Fuente · OpenAI · A model guide for the GPT-6 family
#open source2 octClef: Cloudflare lanza sus propios modelos de decisión, open source
Con Clef y Clef-flash, Cloudflare entra en el mercado naciente de los «decision models» y añade una plataforma de fine-tuning por reinforcement learning.
Fuente · Cloudflare Blog · Introducing Clef: our open-source decision models, and new RL fine-tuning platform