PrimärquelleKIArtikel··5 Min. Lesezeit

FLUX 3 Image: Black Forest Labs setzt auf pixelgenaues Layout

Mit FLUX 3 Image beschreibt man ein Bild nicht mehr nur: man zeichnet es Box für Box und retuschiert es anschließend, ohne dass der Rest sich bewegt.

FLUX 3 Image: Black Forest Labs setzt auf pixelgenaues Layout
Quelle : Black Forest Labs · Black Forest LabsOriginal ansehen ↗

Wer darüber berichtet

Hacker News 345 Pkt. ↗Erwähnt in The Rundown AI

Kurz gesagt

Black Forest Labs stellt FLUX 3 Image vor, den Bild-Zweig seines neuen multimodalen Modells FLUX 3, aufgebaut rund um Bounding Boxes: jedes Element wird auf einem Raster platziert und dann isoliert veränderbar. Das Modell rendert nativ in 2K und 4K, akzeptiert bis zu 10 Referenzen und lässt sich ebenso gut von einem Menschen wie von einem Agenten steuern. Die Wette: Bildgenerierung zu einem kontrollierbaren Kompositionswerkzeug machen, keine Lotteriemaschine.

🍺 Tresen-Version

Bis jetzt war das Generieren eines Bildes mit KI ein bisschen wie im Restaurant zu bestellen, indem man einem Koch, der die eigene Sprache nicht spricht, das Gericht beschreibt: man bekommt etwas, selten das, was man wollte. Black Forest Labs gibt dir jetzt einen Tischplan: du zeichnest Kästchen, sagst was in jedem davon sein soll, und das Modell räumt alles ordentlich ein. Und wenn du die Farbe eines Surfanzugs ändern willst, streicht es nicht gleich den ganzen Strand mit, was schon höflicher ist als die meisten Softwares. Für Grafiker, Agenturen und alle, die Bilder am Fließband produzieren, ist das der Unterschied zwischen Spielzeug und Werkzeug.

Das Wichtigste

  1. 1

    FLUX 3 ist das multimodale Modell von Black Forest Labs (Video, Audio, Bilder, Aktionen); FLUX 3 Image ist der Baustein für Bildgenerierung und -bearbeitung.

  2. 2

    Die Komposition läuft über Bounding Boxes auf einem Raster von 0 bis 1000 auf beiden Achsen, unabhängig vom Format, wobei jede Box als [y_min, x_min, y_max, x_max] notiert wird.

  3. 3

    Ein „Layout-Prompt“ kombiniert eine globale Bildunterschrift mit einer Elementtabelle im JSON-Format (id, bbox, description), wobei die Bildunterschrift jedes Element über seine id referenziert.

  4. 4

    Die Bearbeitung erfolgt Box für Box, mehrere Änderungen gleichzeitig möglich, mit dem Versprechen, dass alles Unberührte exakt an seinem Platz bleibt.

  5. 5

    Das Modell generiert nativ in 2K und 4K, bis zu 5456 × 3072 Pixel im Beispiel des Soba-Ladens, und kombiniert bis zu 10 Referenzbilder.

  6. 6

    Für Agenten gedacht: Ein LLM kann das Layout allein aus einer Textzeile und einem Format planen, wobei jede Box danach noch veränderbar bleibt.

  7. 7

    Die Gewichte werden unter kommerzieller Lizenz an Unternehmen angeboten, die das Modell fine-tunen und auf eigener Infrastruktur betreiben wollen; der Zugang für die breite Öffentlichkeit läuft über Playground und BFL-API.

Komponieren statt beschreiben

Das Herzstück von FLUX 3 Image ist die Bounding Box. Für jedes wichtige Element zeichnet man eine Box und beschreibt ihren Inhalt, ein Szenensatz verbindet dann alles. Das Modell rendert das Bild unter Einhaltung jeder Platzierung.

Das Raster ist auf beiden Achsen von 0 bis 1000 normalisiert, unabhängig vom gewählten Seitenverhältnis. Das Beispiel „Le Festival du Soleil“ zeigt die Logik: fünf Zeilen in der Tabelle, ein Titel in cremefarbener Serif-Typografie, eine Küstenstadt, eine parabolische Betonkuppel, Badende als Silhouetten und eine Menschenmenge am Strand.

Das Format des Prompts ist explizit: eine globale, einabsätzige Bildunterschrift, gefolgt von einer JSON-Tabelle, in der jede Zeile eine id, eine Box und eine Beschreibung trägt. Die Bildunterschrift erwähnt jedes Element über seine Kennung (animal_1, crowd_1…) dort, wo es auftaucht.

Eine Bearbeitung, die nichts zerstört

Zweites Versprechen: ein fertiges Bild retuschieren, ohne es zu verfälschen. Jede Box kann neu beschrieben, ersetzt oder verschoben werden, und mehrere Änderungen lassen sich in einem einzigen Durchgang anwenden.

Black Forest Labs betont die Stabilität: Was nicht verändert wurde, bleibt an seinem Platz, was es erlaubt, Bearbeitungsrunden aneinanderzureihen, ohne dass das Bild abdriftet. Die Demonstrationen zeigen einen umgefärbten Neoprenanzug und ein umgefärbtes Surfbrett, oder zwei zusätzlich eingefügte Taucher in einer bestehenden Szene.

Das war genau der historische Schwachpunkt der Diffusionsmodelle, die dazu neigten, alles neu zu generieren, sobald man ein Detail anfasste.

Die diskrete Rolle des Upsamplers

Kurze Anfragen laufen über einen Prompt-Upsampler, der sie in dichte Bildunterschriften verwandelt, das Format, auf das FLUX 3 trainiert wurde. Er kann die Bildunterschrift rund um die Boxen umschreiben und weitere Elemente vorschlagen.

Doch die Regel ist strikt: Jede vom Nutzer gezeichnete Box erreicht das Modell wortwörtlich, mit derselben id und denselben Koordinaten. Was der Upsampler hinzufügt, überlebt nur, wenn die Bildunterschrift darauf verweist. Ein Weg, der menschlichen Hand Vorrang vor der automatischen Umschreibung zu geben.

Ein Modell, zugeschnitten auf Agenten

Black Forest Labs präsentiert FLUX 3 Image als „designed for agents“. Es genügt, eine Zeile und ein Format vorzugeben: Ein LLM plant das Layout, schreibt die Bildunterschrift und die Elementtabelle mit semantischen ids.

Der Nutzer kann anschließend die Boxen verschieben, die ihm nicht zusagen, während das Modell in den übrigen so generiert, wie der Agent sie platziert hat. Das Beispiel eines „Schwanensees hinter den Kulissen“ veranschaulicht diese Kette.

Ganz ohne Boxen bleibt das Modell ein klassisches Text-to-Image-System, mit einer als solide beworbenen Prompt-Treue und einem nativen Verständnis von Komposition.

Angestrebte Nutzung und Zugang

Die hervorgehobenen Anwendungsfälle sind jene, in denen viele Elemente strengen Beziehungen gehorchen: Text, der um ein Foto herum gesetzt wird, Collagen, Vorschaubild-Raster, redaktionelle Doppelseiten, Menschenmengen-Szenen, in denen jedes Gesicht seinen Platz hat.

Beim Zugang kann man die Boxen im Playground von Hand zeichnen oder einen Layout-Prompt über die BFL-API senden. Unternehmen, die im großen Maßstab generieren, können auf Anfrage die Gewichte unter kommerzieller Lizenz erhalten, um sie zu fine-tunen und bei sich selbst zu hosten.

“Everything you didn't touch stays exactly where it was.”
“Every box you drew reaches the model verbatim, with the same id and the same coordinates.”
“Anything the upsampler adds survives only if the caption refers to it.”

Warum es zählt

FLUX 3 Image markiert eine Verschiebung in der Bildgenerierung: Der Kampf spielt sich nicht mehr nur um die Schönheit des Renderings ab, sondern um die Kontrolle. Die Bounding Boxes, die JSON-Tabelle und die lokalisierte Bearbeitung verwandeln den Prompt in eine Spezifikation, lesbar sowohl für Menschen als auch für Agenten, was perfekt zu Produktions-Workflows (Werbung, Presse, E-Commerce) passt, in denen man ein präzises, reproduzierbares Bild will. Das strukturierte Format ist auch eine Selbstverständlichkeit für Agenten: Ein LLM weiß, wie man JSON mit Koordinaten schreibt, viel besser als es die Ästhetik eines Modells erraten kann. Es bleibt jedoch eine Produktseite: kein Benchmark, kein Preis, kein Vergleich mit der Konkurrenz, und das Versprechen, dass „alles andere sich nicht bewegt“, muss noch an schwierigen Fällen überprüft werden. Bemerkenswert ist auch die Wahl einer kommerziellen Gewichtslizenz auf Anfrage statt einer breiten Öffnung: ein Signal, dass Black Forest Labs sich nun als Anbieter für Unternehmen positioniert. Schließlich wird FLUX 3 als multimodal (Video, Audio, Aktionen) präsentiert, doch diese Seite zeigt nur den Bildteil: der Rest der Familie wird der eigentliche Test des Ambitionsniveaus sein.

Kostenloses Konto

Sie haben gerade einen Artikel von AI Sources gelesen

Erstellen Sie ein kostenloses Konto: ein Monat Archiv in voller Länge, Ihre eigenen Quellen zusammengefasst wie diese, Ihre Notizen und Markierungen.

#bildgenerierung#black forest labs#flux#agenten#multimodal#ki
Originalquelle
FLUX 3 Image: Maximum control over every pixel
Black Forest Labs
Artikel öffnen ↗

Für dich

Lass sie mit deinen Quellen arbeiten.

Kostenlos: einen Monat Artikel und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.

Für dein Team

Dieselbe Maschine, zu euren Themen.

Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.

Weiterlesen