Fuente primariaIAArtículo··5 min de lectura

FLUX 3 Image: Black Forest Labs apuesta por la maquetación al píxel

Con FLUX 3 Image, ya no basta con describir una imagen: se dibuja caja por caja, y luego se retoca sin que el resto se mueva.

FLUX 3 Image: Black Forest Labs apuesta por la maquetación al píxel
Fuente : Black Forest Labs · Black Forest LabsVer el original ↗

Quién habla de ello

Hacker News 345 pts ↗Citada en The Rundown AI

En breve

Black Forest Labs presenta FLUX 3 Image, el componente de imagen de su nuevo modelo multimodal FLUX 3, construido alrededor de los bounding boxes: cada elemento se coloca en una cuadrícula y luego puede modificarse de forma aislada. El modelo renderiza en 2K y 4K nativos, acepta hasta 10 referencias y puede ser pilotado tanto por un humano como por un agente. La apuesta: convertir la generación de imágenes en una herramienta de composición controlable, no en una máquina tragaperras.

🍺 Versión de barra

Hasta ahora, generar una imagen con IA era un poco como pedir en un restaurante describiendo el plato a un chef que no habla tu idioma: obtienes algo, pero rara vez lo que querías. Black Forest Labs te da ahora un plano de mesa: dibujas casillas, dices qué hay en cada una, y el modelo lo organiza todo tal cual. Y si quieres cambiar el color de un traje de baño, no te repinta la playa de paso, lo cual ya es más educado que la mayoría de los programas. Para diseñadores, agencias y todos los que producen imágenes en cadena, es la diferencia entre un juguete y una herramienta.

Para recordar

  1. 1

    FLUX 3 es el modelo multimodal de Black Forest Labs (vídeo, audio, imágenes, acciones); FLUX 3 Image es el módulo dedicado a la generación y edición de imágenes.

  2. 2

    La composición se basa en bounding boxes sobre una cuadrícula de 0 a 1000 en ambos ejes, sea cual sea el formato, con cada caja anotada como [y_min, x_min, y_max, x_max].

  3. 3

    Un «layout prompt» combina una leyenda global y una tabla de elementos en JSON (id, bbox, descripción), citando la leyenda cada elemento por su id.

  4. 4

    La edición se hace caja por caja, con varias modificaciones a la vez, con la promesa de que todo lo que no se toca permanece exactamente en su sitio.

  5. 5

    El modelo genera en 2K y 4K nativos, hasta 5456 × 3072 píxeles en el ejemplo de la tienda de soba, y combina hasta 10 imágenes de referencia.

  6. 6

    Pensado para agentes: un LLM puede planificar él solo la maquetación a partir de una línea de texto y un formato, quedando cada caja modificable después.

  7. 7

    Los pesos se ofrecen bajo licencia comercial a las empresas que quieran hacer fine-tuning y desplegar el modelo en su propia infraestructura; el acceso para el público general pasa por el Playground y la API de BFL.

Componer en lugar de describir

El núcleo de FLUX 3 Image es el bounding box. Para cada elemento importante se traza una caja y se describe su contenido, y luego una frase de escena conecta el conjunto. El modelo renderiza la imagen respetando cada ubicación.

La cuadrícula está normalizada de 0 a 1000 en ambos ejes, sea cual sea la proporción elegida. El ejemplo «Le Festival du Soleil» ilustra la lógica: cinco líneas en la tabla, un título en tipografía serif color crema, una ciudad costera, una cúpula parabólica de hormigón, bañistas en silueta y una multitud en la playa.

El formato del prompt es explícito: una leyenda global de un párrafo, seguida de una tabla JSON donde cada línea lleva un id, una caja y una descripción. La leyenda menciona cada elemento por su identificador (animal_1, crowd_1…) allí donde aparece.

Una edición que no rompe nada

Segunda promesa: retocar una imagen terminada sin desnaturalizarla. Cada caja puede redescribirse, reemplazarse o moverse, y pueden aplicarse varias modificaciones en una sola pasada.

Black Forest Labs insiste en la estabilidad: lo que no se ha modificado permanece en su sitio, lo que permite encadenar rondas de edición sin que la imagen se desvíe. Las demostraciones muestran un traje de baño y una tabla de surf recoloreados, o dos buceadores añadidos a una escena existente.

Es precisamente el punto débil histórico de los modelos de difusión, que tendían a regenerarlo todo en cuanto se tocaba un detalle.

El papel discreto del upsampler

Las consultas cortas pasan por un prompt upsampler, que las transforma en leyendas densas, el formato con el que se entrenó FLUX 3. Puede reescribir la leyenda alrededor de las cajas y sugerir otros elementos.

Pero la regla es estricta: cada caja dibujada por el usuario llega al modelo tal cual, con el mismo id y las mismas coordenadas. Lo que el upsampler añade solo sobrevive si la leyenda lo referencia. Una manera de mantener la mano humana como prioridad frente a la reescritura automática.

Un modelo hecho a medida para agentes

Black Forest Labs presenta FLUX 3 Image como «designed for agents». Basta con dar una línea de texto y un formato: un LLM planifica la maquetación, escribe la leyenda y la tabla de elementos con ids semánticos.

El usuario puede luego mover las cajas que no le convenzan, generando el modelo en las demás tal como el agente las colocó. El ejemplo de «El lago de los cisnes visto entre bastidores» ilustra esta cadena.

Sin cajas en absoluto, el modelo sigue siendo un text-to-image clásico, con un seguimiento de prompt presentado como sólido y una comprensión nativa de la composición.

Usos previstos y acceso

Los casos de uso destacados son aquellos en los que muchos elementos obedecen a relaciones estrictas: texto compuesto alrededor de una foto, collages, cuadrículas de miniaturas, dobles páginas editoriales, escenas de multitud donde cada rostro tiene su lugar.

En cuanto al acceso, se pueden dibujar las cajas a mano en el Playground o enviar un layout prompt vía la API de BFL. Las empresas que generan a gran escala pueden obtener los pesos bajo licencia comercial para hacer fine-tuning y alojarlos ellas mismas, previa solicitud.

“Everything you didn't touch stays exactly where it was.”
“Every box you drew reaches the model verbatim, with the same id and the same coordinates.”
“Anything the upsampler adds survives only if the caption refers to it.”

Por qué importa

FLUX 3 Image consagra un desplazamiento en la generación de imágenes: la batalla ya no se juega solo en la belleza del renderizado, sino en el control. Los bounding boxes, la tabla JSON y la edición localizada convierten el prompt en una especificación, legible tanto por un humano como por un agente, lo cual encaja perfectamente con los flujos de producción (publicidad, prensa, e-commerce) donde se quiere una imagen precisa y reproducible. El formato estructurado también es una obviedad para los agentes: un LLM sabe escribir JSON con coordenadas mucho mejor de lo que sabe adivinar la estética de un modelo. Queda por ver que se trata de una página de producto: ningún benchmark, ningún precio, ninguna comparación con la competencia, y la promesa de que «todo lo demás no se mueve» necesita verificarse en casos difíciles. También destaca la elección de una licencia de pesos comercial, previa solicitud, en lugar de una apertura amplia: una señal de que Black Forest Labs asume ahora un posicionamiento de editor para empresas. Por último, FLUX 3 se presenta como multimodal (vídeo, audio, acciones), pero esta página solo muestra la parte de imagen: el resto de la familia será la verdadera prueba de la ambición.

Cuenta gratis

Acabas de leer un artículo de AI Sources

Crea una cuenta gratuita: un mes de archivo completo, tus propias fuentes resumidas como esta, tus notas y subrayados.

#generación de imágenes#black forest labs#flux#agentes#multimodal#ia
Fuente original
FLUX 3 Image: Maximum control over every pixel
Black Forest Labs
Abrir el artículo ↗

Para ti

Ponla a trabajar con tus fuentes.

Gratis: un mes de artículos y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.

Para tu equipo

La misma máquina, sobre tus temas.

Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.

Sigue leyendo