FLUX 3 Image : Black Forest Labs mise sur la mise en page au pixel près
Avec FLUX 3 Image, on ne décrit plus seulement une image : on la dessine boîte par boîte, puis on la retouche sans que le reste ne bouge.

Qui en parle
En bref
Black Forest Labs présente FLUX 3 Image, le volet image de son nouveau modèle multimodal FLUX 3, construit autour des bounding boxes : chaque élément est placé sur une grille, puis modifiable isolément. Le modèle rend en 2K et 4K natifs, accepte jusqu'à 10 références et se pilote aussi bien par un humain que par un agent. Le pari : faire de la génération d'image un outil de composition contrôlable, pas une machine à sous.
🍺 Version comptoir
Jusqu'ici, générer une image avec une IA, c'était un peu comme commander au restaurant en décrivant le plat à un chef qui ne parle pas ta langue : tu obtiens quelque chose, rarement ce que tu voulais. Black Forest Labs te donne maintenant un plan de table : tu dessines des cases, tu dis ce qu'il y a dans chacune, et le modèle range tout bien comme il faut. Et si tu veux changer la couleur d'une combinaison de surf, il ne repeint pas la plage au passage, ce qui est déjà plus poli que la plupart des logiciels. Pour les graphistes, les agences et tous ceux qui font des images à la chaîne, c'est la différence entre un jouet et un outil.
À retenir
- 1
FLUX 3 est le modèle multimodal de Black Forest Labs (vidéo, audio, images, actions) ; FLUX 3 Image en est la brique dédiée à la génération et à l'édition d'images.
- 2
La composition passe par des bounding boxes sur une grille de 0 à 1000 sur les deux axes, quel que soit le format, chaque boîte étant notée [y_min, x_min, y_max, x_max].
- 3
Un « layout prompt » combine une légende globale et une table d'éléments en JSON (id, bbox, description), la légende citant chaque élément par son id.
- 4
L'édition se fait boîte par boîte, plusieurs modifications à la fois, avec la promesse que tout ce qui n'est pas touché reste exactement en place.
- 5
Le modèle génère en 2K et 4K natifs, jusqu'à 5456 × 3072 pixels dans l'exemple de la boutique de soba, et combine jusqu'à 10 images de référence.
- 6
Pensé pour les agents : un LLM peut planifier seul la mise en page à partir d'une ligne de texte et d'un format, chaque boîte restant ensuite modifiable.
- 7
Les poids sont proposés sous licence commerciale aux entreprises qui veulent fine-tuner et déployer le modèle sur leur propre infrastructure ; l'accès grand public passe par le Playground et l'API BFL.
Composer plutôt que décrire
Le cœur de FLUX 3 Image, c'est la bounding box. Pour chaque élément important, on trace une boîte et on décrit son contenu, puis une phrase de scène relie l'ensemble. Le modèle rend l'image en respectant chaque emplacement.
La grille est normalisée de 0 à 1000 sur les deux axes, quel que soit le ratio choisi. L'exemple « Le Festival du Soleil » montre la logique : cinq lignes dans la table, un titre en typographie serif crème, une ville côtière, un dôme parabolique en béton, des baigneurs en silhouette et une foule sur la plage.
Le format du prompt est explicite : une légende globale d'un paragraphe, suivie d'un tableau JSON où chaque ligne porte un id, une boîte et une description. La légende mentionne chaque élément par son identifiant (animal_1, crowd_1…) là où il apparaît.
Une édition qui ne casse rien
Deuxième promesse : retoucher une image finie sans la dénaturer. Chaque boîte peut être redécrite, remplacée ou déplacée, et plusieurs modifications peuvent être appliquées en une seule passe.
Black Forest Labs insiste sur la stabilité : ce qui n'a pas été modifié reste à sa place, ce qui permet d'enchaîner les tours d'édition sans que l'image ne dérive. Les démonstrations montrent une combinaison et une planche de surf recolorées, ou deux plongeurs ajoutés à une scène existante.
C'est précisément le point faible historique des modèles de diffusion, qui avaient tendance à tout régénérer dès qu'on touchait à un détail.
Le rôle discret de l'upsampler
Les requêtes courtes passent par un prompt upsampler, qui les transforme en légendes denses, le format sur lequel FLUX 3 a été entraîné. Il peut réécrire la légende autour des boîtes et suggérer d'autres éléments.
Mais la règle est stricte : chaque boîte dessinée par l'utilisateur arrive au modèle telle quelle, avec le même id et les mêmes coordonnées. Ce que l'upsampler ajoute ne survit que si la légende y fait référence. Une manière de garder la main humaine prioritaire sur la réécriture automatique.
Un modèle taillé pour les agents
Black Forest Labs présente FLUX 3 Image comme « designed for agents ». Il suffit de donner une ligne et un format : un LLM planifie la mise en page, écrit la légende et la table d'éléments avec des ids sémantiques.
L'utilisateur peut ensuite déplacer les boîtes qui ne lui conviennent pas, le modèle générant dans les autres telles que l'agent les a placées. L'exemple d'un « Lac des cygnes vu des coulisses » illustre cette chaîne.
Sans boîtes du tout, le modèle reste un text-to-image classique, avec un suivi de prompt revendiqué comme solide et une compréhension native de la composition.
Usages visés et accès
Les cas d'usage mis en avant sont ceux où beaucoup d'éléments obéissent à des relations strictes : texte composé autour d'une photo, collages, grilles de vignettes, doubles pages éditoriales, scènes de foule où chaque visage a sa place.
Côté accès, on peut dessiner les boîtes à la main dans le Playground ou envoyer un layout prompt via l'API BFL. Les entreprises qui génèrent à grande échelle peuvent obtenir les poids sous licence commerciale pour les fine-tuner et les héberger chez elles, sur demande.
“Everything you didn't touch stays exactly where it was.”
“Every box you drew reaches the model verbatim, with the same id and the same coordinates.”
“Anything the upsampler adds survives only if the caption refers to it.”
Pourquoi ça compte
FLUX 3 Image acte un déplacement de la génération d'image : la bataille ne se joue plus seulement sur la beauté du rendu, mais sur le contrôle. Les bounding boxes, la table JSON et l'édition localisée transforment le prompt en spécification, lisible par un humain comme par un agent, ce qui colle parfaitement aux workflows de production (publicité, presse, e-commerce) où l'on veut une image précise et reproductible. Le format structuré est aussi une évidence pour les agents : un LLM sait écrire du JSON avec des coordonnées bien mieux qu'il ne sait deviner l'esthétique d'un modèle. Reste qu'il s'agit d'une page produit : aucun benchmark, aucun tarif, aucune comparaison avec la concurrence, et la promesse que « tout le reste ne bouge pas » demande à être vérifiée sur des cas difficiles. On note aussi le choix d'une licence de poids commerciale, sur demande, plutôt qu'une ouverture large : un signal que Black Forest Labs assume désormais un positionnement d'éditeur pour entreprises. Enfin, FLUX 3 est présenté comme multimodal (vidéo, audio, actions), mais cette page n'en montre que l'image : le reste de la famille sera le vrai test de l'ambition.
Compte gratuit
Vous venez de lire un article d'AI Sources
Créez un compte gratuit : un mois d'archives en entier, vos propres sources résumées comme celle-ci, vos notes et surlignages.
Pour vous
Faites-la travailler sur vos sources.
Gratuit : un mois d'articles et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.
Pour votre équipe
La même machine, sur vos sujets.
Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.
À lire aussi
#superintelligenceHierHinton, Bengio, OpenAI et Anthropic signent un plan contre l'explosion d'intelligence
Vingt-deux chercheurs, dont des cadres d'OpenAI et d'Anthropic, estiment que l'automatisation de la recherche en IA pourrait comprimer des années de progrès en quelques mois, et que les États n'y sont pas préparés.
Source · Cambridge Programme on AI Science & Policy (CASP) · What if automating AI R&D triggers an intelligence explosion?
#apiHierGPT-6 : le mode d'emploi d'OpenAI pour passer du prototype à la production
Trois modèles, cinq niveaux de raisonnement, deux vitesses et des agents qui travaillent des heures : OpenAI publie la notice de sa nouvelle famille.
Source · OpenAI · A model guide for the GPT-6 family
#open source2 oct.Clef : Cloudflare lance ses propres modèles de décision, open source
Avec Clef et Clef-flash, Cloudflare entre sur le marché naissant des « decision models » et y ajoute une plateforme de fine-tuning par reinforcement learning.
Source · Cloudflare Blog · Introducing Clef: our open-source decision models, and new RL fine-tuning platform