Source primaireIAArticle··5 min de lecture

FLUX 3 Image : Black Forest Labs mise sur la mise en page au pixel près

Avec FLUX 3 Image, on ne décrit plus seulement une image : on la dessine boîte par boîte, puis on la retouche sans que le reste ne bouge.

FLUX 3 Image : Black Forest Labs mise sur la mise en page au pixel près
Source : Black Forest Labs · Black Forest LabsVoir l'original ↗

Qui en parle

Hacker News 345 pts ↗Citée dans The Rundown AI

En bref

Black Forest Labs présente FLUX 3 Image, le volet image de son nouveau modèle multimodal FLUX 3, construit autour des bounding boxes : chaque élément est placé sur une grille, puis modifiable isolément. Le modèle rend en 2K et 4K natifs, accepte jusqu'à 10 références et se pilote aussi bien par un humain que par un agent. Le pari : faire de la génération d'image un outil de composition contrôlable, pas une machine à sous.

🍺 Version comptoir

Jusqu'ici, générer une image avec une IA, c'était un peu comme commander au restaurant en décrivant le plat à un chef qui ne parle pas ta langue : tu obtiens quelque chose, rarement ce que tu voulais. Black Forest Labs te donne maintenant un plan de table : tu dessines des cases, tu dis ce qu'il y a dans chacune, et le modèle range tout bien comme il faut. Et si tu veux changer la couleur d'une combinaison de surf, il ne repeint pas la plage au passage, ce qui est déjà plus poli que la plupart des logiciels. Pour les graphistes, les agences et tous ceux qui font des images à la chaîne, c'est la différence entre un jouet et un outil.

À retenir

  1. 1

    FLUX 3 est le modèle multimodal de Black Forest Labs (vidéo, audio, images, actions) ; FLUX 3 Image en est la brique dédiée à la génération et à l'édition d'images.

  2. 2

    La composition passe par des bounding boxes sur une grille de 0 à 1000 sur les deux axes, quel que soit le format, chaque boîte étant notée [y_min, x_min, y_max, x_max].

  3. 3

    Un « layout prompt » combine une légende globale et une table d'éléments en JSON (id, bbox, description), la légende citant chaque élément par son id.

  4. 4

    L'édition se fait boîte par boîte, plusieurs modifications à la fois, avec la promesse que tout ce qui n'est pas touché reste exactement en place.

  5. 5

    Le modèle génère en 2K et 4K natifs, jusqu'à 5456 × 3072 pixels dans l'exemple de la boutique de soba, et combine jusqu'à 10 images de référence.

  6. 6

    Pensé pour les agents : un LLM peut planifier seul la mise en page à partir d'une ligne de texte et d'un format, chaque boîte restant ensuite modifiable.

  7. 7

    Les poids sont proposés sous licence commerciale aux entreprises qui veulent fine-tuner et déployer le modèle sur leur propre infrastructure ; l'accès grand public passe par le Playground et l'API BFL.

Composer plutôt que décrire

Le cœur de FLUX 3 Image, c'est la bounding box. Pour chaque élément important, on trace une boîte et on décrit son contenu, puis une phrase de scène relie l'ensemble. Le modèle rend l'image en respectant chaque emplacement.

La grille est normalisée de 0 à 1000 sur les deux axes, quel que soit le ratio choisi. L'exemple « Le Festival du Soleil » montre la logique : cinq lignes dans la table, un titre en typographie serif crème, une ville côtière, un dôme parabolique en béton, des baigneurs en silhouette et une foule sur la plage.

Le format du prompt est explicite : une légende globale d'un paragraphe, suivie d'un tableau JSON où chaque ligne porte un id, une boîte et une description. La légende mentionne chaque élément par son identifiant (animal_1, crowd_1…) là où il apparaît.

Une édition qui ne casse rien

Deuxième promesse : retoucher une image finie sans la dénaturer. Chaque boîte peut être redécrite, remplacée ou déplacée, et plusieurs modifications peuvent être appliquées en une seule passe.

Black Forest Labs insiste sur la stabilité : ce qui n'a pas été modifié reste à sa place, ce qui permet d'enchaîner les tours d'édition sans que l'image ne dérive. Les démonstrations montrent une combinaison et une planche de surf recolorées, ou deux plongeurs ajoutés à une scène existante.

C'est précisément le point faible historique des modèles de diffusion, qui avaient tendance à tout régénérer dès qu'on touchait à un détail.

Le rôle discret de l'upsampler

Les requêtes courtes passent par un prompt upsampler, qui les transforme en légendes denses, le format sur lequel FLUX 3 a été entraîné. Il peut réécrire la légende autour des boîtes et suggérer d'autres éléments.

Mais la règle est stricte : chaque boîte dessinée par l'utilisateur arrive au modèle telle quelle, avec le même id et les mêmes coordonnées. Ce que l'upsampler ajoute ne survit que si la légende y fait référence. Une manière de garder la main humaine prioritaire sur la réécriture automatique.

Un modèle taillé pour les agents

Black Forest Labs présente FLUX 3 Image comme « designed for agents ». Il suffit de donner une ligne et un format : un LLM planifie la mise en page, écrit la légende et la table d'éléments avec des ids sémantiques.

L'utilisateur peut ensuite déplacer les boîtes qui ne lui conviennent pas, le modèle générant dans les autres telles que l'agent les a placées. L'exemple d'un « Lac des cygnes vu des coulisses » illustre cette chaîne.

Sans boîtes du tout, le modèle reste un text-to-image classique, avec un suivi de prompt revendiqué comme solide et une compréhension native de la composition.

Usages visés et accès

Les cas d'usage mis en avant sont ceux où beaucoup d'éléments obéissent à des relations strictes : texte composé autour d'une photo, collages, grilles de vignettes, doubles pages éditoriales, scènes de foule où chaque visage a sa place.

Côté accès, on peut dessiner les boîtes à la main dans le Playground ou envoyer un layout prompt via l'API BFL. Les entreprises qui génèrent à grande échelle peuvent obtenir les poids sous licence commerciale pour les fine-tuner et les héberger chez elles, sur demande.

“Everything you didn't touch stays exactly where it was.”
“Every box you drew reaches the model verbatim, with the same id and the same coordinates.”
“Anything the upsampler adds survives only if the caption refers to it.”

Pourquoi ça compte

FLUX 3 Image acte un déplacement de la génération d'image : la bataille ne se joue plus seulement sur la beauté du rendu, mais sur le contrôle. Les bounding boxes, la table JSON et l'édition localisée transforment le prompt en spécification, lisible par un humain comme par un agent, ce qui colle parfaitement aux workflows de production (publicité, presse, e-commerce) où l'on veut une image précise et reproductible. Le format structuré est aussi une évidence pour les agents : un LLM sait écrire du JSON avec des coordonnées bien mieux qu'il ne sait deviner l'esthétique d'un modèle. Reste qu'il s'agit d'une page produit : aucun benchmark, aucun tarif, aucune comparaison avec la concurrence, et la promesse que « tout le reste ne bouge pas » demande à être vérifiée sur des cas difficiles. On note aussi le choix d'une licence de poids commerciale, sur demande, plutôt qu'une ouverture large : un signal que Black Forest Labs assume désormais un positionnement d'éditeur pour entreprises. Enfin, FLUX 3 est présenté comme multimodal (vidéo, audio, actions), mais cette page n'en montre que l'image : le reste de la famille sera le vrai test de l'ambition.

Compte gratuit

Vous venez de lire un article d'AI Sources

Créez un compte gratuit : un mois d'archives en entier, vos propres sources résumées comme celle-ci, vos notes et surlignages.

#génération d'image#black forest labs#flux#agents#multimodal#ia
Source originale
FLUX 3 Image: Maximum control over every pixel
Black Forest Labs
Source primaireIl s'agit de la page officielle de Black Forest Labs présentant son propre modèle FLUX 3 Image.
Ouvrir l'article ↗

Pour vous

Faites-la travailler sur vos sources.

Gratuit : un mois d'articles et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.

Pour votre équipe

La même machine, sur vos sujets.

Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.

À lire aussi