FLUX 3 Image: Black Forest Labs setzt auf pixelgenaues Layout
Mit FLUX 3 Image beschreibt man ein Bild nicht mehr nur: man zeichnet es Box für Box und retuschiert es anschließend, ohne dass der Rest sich bewegt.

Wer darüber berichtet
Kurz gesagt
Black Forest Labs stellt FLUX 3 Image vor, den Bild-Zweig seines neuen multimodalen Modells FLUX 3, aufgebaut rund um Bounding Boxes: jedes Element wird auf einem Raster platziert und dann isoliert veränderbar. Das Modell rendert nativ in 2K und 4K, akzeptiert bis zu 10 Referenzen und lässt sich ebenso gut von einem Menschen wie von einem Agenten steuern. Die Wette: Bildgenerierung zu einem kontrollierbaren Kompositionswerkzeug machen, keine Lotteriemaschine.
🍺 Tresen-Version
Bis jetzt war das Generieren eines Bildes mit KI ein bisschen wie im Restaurant zu bestellen, indem man einem Koch, der die eigene Sprache nicht spricht, das Gericht beschreibt: man bekommt etwas, selten das, was man wollte. Black Forest Labs gibt dir jetzt einen Tischplan: du zeichnest Kästchen, sagst was in jedem davon sein soll, und das Modell räumt alles ordentlich ein. Und wenn du die Farbe eines Surfanzugs ändern willst, streicht es nicht gleich den ganzen Strand mit, was schon höflicher ist als die meisten Softwares. Für Grafiker, Agenturen und alle, die Bilder am Fließband produzieren, ist das der Unterschied zwischen Spielzeug und Werkzeug.
Das Wichtigste
- 1
FLUX 3 ist das multimodale Modell von Black Forest Labs (Video, Audio, Bilder, Aktionen); FLUX 3 Image ist der Baustein für Bildgenerierung und -bearbeitung.
- 2
Die Komposition läuft über Bounding Boxes auf einem Raster von 0 bis 1000 auf beiden Achsen, unabhängig vom Format, wobei jede Box als [y_min, x_min, y_max, x_max] notiert wird.
- 3
Ein „Layout-Prompt“ kombiniert eine globale Bildunterschrift mit einer Elementtabelle im JSON-Format (id, bbox, description), wobei die Bildunterschrift jedes Element über seine id referenziert.
- 4
Die Bearbeitung erfolgt Box für Box, mehrere Änderungen gleichzeitig möglich, mit dem Versprechen, dass alles Unberührte exakt an seinem Platz bleibt.
- 5
Das Modell generiert nativ in 2K und 4K, bis zu 5456 × 3072 Pixel im Beispiel des Soba-Ladens, und kombiniert bis zu 10 Referenzbilder.
- 6
Für Agenten gedacht: Ein LLM kann das Layout allein aus einer Textzeile und einem Format planen, wobei jede Box danach noch veränderbar bleibt.
- 7
Die Gewichte werden unter kommerzieller Lizenz an Unternehmen angeboten, die das Modell fine-tunen und auf eigener Infrastruktur betreiben wollen; der Zugang für die breite Öffentlichkeit läuft über Playground und BFL-API.
Komponieren statt beschreiben
Das Herzstück von FLUX 3 Image ist die Bounding Box. Für jedes wichtige Element zeichnet man eine Box und beschreibt ihren Inhalt, ein Szenensatz verbindet dann alles. Das Modell rendert das Bild unter Einhaltung jeder Platzierung.
Das Raster ist auf beiden Achsen von 0 bis 1000 normalisiert, unabhängig vom gewählten Seitenverhältnis. Das Beispiel „Le Festival du Soleil“ zeigt die Logik: fünf Zeilen in der Tabelle, ein Titel in cremefarbener Serif-Typografie, eine Küstenstadt, eine parabolische Betonkuppel, Badende als Silhouetten und eine Menschenmenge am Strand.
Das Format des Prompts ist explizit: eine globale, einabsätzige Bildunterschrift, gefolgt von einer JSON-Tabelle, in der jede Zeile eine id, eine Box und eine Beschreibung trägt. Die Bildunterschrift erwähnt jedes Element über seine Kennung (animal_1, crowd_1…) dort, wo es auftaucht.
Eine Bearbeitung, die nichts zerstört
Zweites Versprechen: ein fertiges Bild retuschieren, ohne es zu verfälschen. Jede Box kann neu beschrieben, ersetzt oder verschoben werden, und mehrere Änderungen lassen sich in einem einzigen Durchgang anwenden.
Black Forest Labs betont die Stabilität: Was nicht verändert wurde, bleibt an seinem Platz, was es erlaubt, Bearbeitungsrunden aneinanderzureihen, ohne dass das Bild abdriftet. Die Demonstrationen zeigen einen umgefärbten Neoprenanzug und ein umgefärbtes Surfbrett, oder zwei zusätzlich eingefügte Taucher in einer bestehenden Szene.
Das war genau der historische Schwachpunkt der Diffusionsmodelle, die dazu neigten, alles neu zu generieren, sobald man ein Detail anfasste.
Die diskrete Rolle des Upsamplers
Kurze Anfragen laufen über einen Prompt-Upsampler, der sie in dichte Bildunterschriften verwandelt, das Format, auf das FLUX 3 trainiert wurde. Er kann die Bildunterschrift rund um die Boxen umschreiben und weitere Elemente vorschlagen.
Doch die Regel ist strikt: Jede vom Nutzer gezeichnete Box erreicht das Modell wortwörtlich, mit derselben id und denselben Koordinaten. Was der Upsampler hinzufügt, überlebt nur, wenn die Bildunterschrift darauf verweist. Ein Weg, der menschlichen Hand Vorrang vor der automatischen Umschreibung zu geben.
Ein Modell, zugeschnitten auf Agenten
Black Forest Labs präsentiert FLUX 3 Image als „designed for agents“. Es genügt, eine Zeile und ein Format vorzugeben: Ein LLM plant das Layout, schreibt die Bildunterschrift und die Elementtabelle mit semantischen ids.
Der Nutzer kann anschließend die Boxen verschieben, die ihm nicht zusagen, während das Modell in den übrigen so generiert, wie der Agent sie platziert hat. Das Beispiel eines „Schwanensees hinter den Kulissen“ veranschaulicht diese Kette.
Ganz ohne Boxen bleibt das Modell ein klassisches Text-to-Image-System, mit einer als solide beworbenen Prompt-Treue und einem nativen Verständnis von Komposition.
Angestrebte Nutzung und Zugang
Die hervorgehobenen Anwendungsfälle sind jene, in denen viele Elemente strengen Beziehungen gehorchen: Text, der um ein Foto herum gesetzt wird, Collagen, Vorschaubild-Raster, redaktionelle Doppelseiten, Menschenmengen-Szenen, in denen jedes Gesicht seinen Platz hat.
Beim Zugang kann man die Boxen im Playground von Hand zeichnen oder einen Layout-Prompt über die BFL-API senden. Unternehmen, die im großen Maßstab generieren, können auf Anfrage die Gewichte unter kommerzieller Lizenz erhalten, um sie zu fine-tunen und bei sich selbst zu hosten.
“Everything you didn't touch stays exactly where it was.”
“Every box you drew reaches the model verbatim, with the same id and the same coordinates.”
“Anything the upsampler adds survives only if the caption refers to it.”
Warum es zählt
FLUX 3 Image markiert eine Verschiebung in der Bildgenerierung: Der Kampf spielt sich nicht mehr nur um die Schönheit des Renderings ab, sondern um die Kontrolle. Die Bounding Boxes, die JSON-Tabelle und die lokalisierte Bearbeitung verwandeln den Prompt in eine Spezifikation, lesbar sowohl für Menschen als auch für Agenten, was perfekt zu Produktions-Workflows (Werbung, Presse, E-Commerce) passt, in denen man ein präzises, reproduzierbares Bild will. Das strukturierte Format ist auch eine Selbstverständlichkeit für Agenten: Ein LLM weiß, wie man JSON mit Koordinaten schreibt, viel besser als es die Ästhetik eines Modells erraten kann. Es bleibt jedoch eine Produktseite: kein Benchmark, kein Preis, kein Vergleich mit der Konkurrenz, und das Versprechen, dass „alles andere sich nicht bewegt“, muss noch an schwierigen Fällen überprüft werden. Bemerkenswert ist auch die Wahl einer kommerziellen Gewichtslizenz auf Anfrage statt einer breiten Öffnung: ein Signal, dass Black Forest Labs sich nun als Anbieter für Unternehmen positioniert. Schließlich wird FLUX 3 als multimodal (Video, Audio, Aktionen) präsentiert, doch diese Seite zeigt nur den Bildteil: der Rest der Familie wird der eigentliche Test des Ambitionsniveaus sein.
Kostenloses Konto
Sie haben gerade einen Artikel von AI Sources gelesen
Erstellen Sie ein kostenloses Konto: ein Monat Archiv in voller Länge, Ihre eigenen Quellen zusammengefasst wie diese, Ihre Notizen und Markierungen.
Für dich
Lass sie mit deinen Quellen arbeiten.
Kostenlos: einen Monat Artikel und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.
Für dein Team
Dieselbe Maschine, zu euren Themen.
Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.
Weiterlesen
#forschungGesternHinton, Bengio, OpenAI und Anthropic unterzeichnen Plan gegen die Intelligenzexplosion
Zweiundzwanzig Forscher, darunter Führungskräfte von OpenAI und Anthropic, meinen, dass die Automatisierung der KI-Forschung Jahre des Fortschritts in wenige Monate pressen könnte – und dass die Staaten darauf nicht vorbereitet sind.
Quelle · Cambridge Programme on AI Science & Policy (CASP) · What if automating AI R&D triggers an intelligence explosion?
#gpt-6GesternGPT-6: OpenAIs Gebrauchsanweisung für den Weg vom Prototyp zur Produktion
Drei Modelle, fünf Reasoning-Stufen, zwei Geschwindigkeiten und Agenten, die stundenlang arbeiten: OpenAI veröffentlicht die Anleitung für seine neue Modellfamilie.
Quelle · OpenAI · A model guide for the GPT-6 family
#open source2. Okt.Clef: Cloudflare bringt eigene Decision-Modelle als Open Source
Mit Clef und Clef-flash steigt Cloudflare in den aufstrebenden Markt der „Decision Models“ ein und ergänzt dies um eine Fine-Tuning-Plattform per Reinforcement Learning.
Quelle · Cloudflare Blog · Introducing Clef: our open-source decision models, and new RL fine-tuning platform