FLUX 3 Image: Black Forest Labs punta sull'impaginazione al pixel
Con FLUX 3 Image non si descrive più solo un'immagine: la si disegna riquadro per riquadro, poi la si ritocca senza che il resto si muova.

Chi ne parla
In breve
Black Forest Labs presenta FLUX 3 Image, il versante immagine del suo nuovo modello multimodale FLUX 3, costruito attorno alle bounding box: ogni elemento viene posizionato su una griglia, poi modificabile isolatamente. Il modello rende in 2K e 4K nativi, accetta fino a 10 riferimenti e si pilota sia tramite un umano sia tramite un agente. La scommessa: trasformare la generazione d'immagini in uno strumento di composizione controllabile, non una slot machine.
🍺 Versione da bancone
Finora, generare un'immagine con un'IA era un po' come ordinare al ristorante descrivendo il piatto a uno chef che non parla la tua lingua: ottieni qualcosa, raramente quello che volevi. Black Forest Labs ti dà ora una piantina del tavolo: disegni delle caselle, dici cosa c'è in ciascuna, e il modello sistema tutto per bene. E se vuoi cambiare il colore di una muta da surf, non ridipinge la spiaggia di passaggio, il che è già più educato della maggior parte dei software. Per i grafici, le agenzie e tutti quelli che sfornano immagini a catena, è la differenza tra un giocattolo e uno strumento.
Da ricordare
- 1
FLUX 3 è il modello multimodale di Black Forest Labs (video, audio, immagini, azioni); FLUX 3 Image ne è il mattone dedicato alla generazione e all'editing di immagini.
- 2
La composizione passa attraverso bounding box su una griglia da 0 a 1000 su entrambi gli assi, qualunque sia il formato, con ogni riquadro indicato come [y_min, x_min, y_max, x_max].
- 3
Un "layout prompt" combina una didascalia globale e una tabella di elementi in JSON (id, bbox, description), con la didascalia che cita ogni elemento tramite il suo id.
- 4
L'editing avviene riquadro per riquadro, con più modifiche contemporanee, con la promessa che tutto ciò che non viene toccato resta esattamente al suo posto.
- 5
Il modello genera in 2K e 4K nativi, fino a 5456 × 3072 pixel nell'esempio del negozio di soba, e combina fino a 10 immagini di riferimento.
- 6
Pensato per gli agenti: un LLM può pianificare da solo il layout a partire da una riga di testo e un formato, con ogni riquadro comunque modificabile in seguito.
- 7
I pesi sono offerti sotto licenza commerciale alle aziende che vogliono fare fine-tuning e distribuire il modello sulla propria infrastruttura; l'accesso al grande pubblico passa dal Playground e dall'API BFL.
Comporre invece di descrivere
Il cuore di FLUX 3 Image è la bounding box. Per ogni elemento importante, si traccia un riquadro e se ne descrive il contenuto, poi una frase di scena collega l'insieme. Il modello rende l'immagine rispettando ogni posizione.
La griglia è normalizzata da 0 a 1000 su entrambi gli assi, qualunque sia il rapporto scelto. L'esempio "Le Festival du Soleil" mostra la logica: cinque righe nella tabella, un titolo in tipografia serif crema, una città costiera, una cupola parabolica in cemento, bagnanti in silhouette e una folla sulla spiaggia.
Il formato del prompt è esplicito: una didascalia globale di un paragrafo, seguita da una tabella JSON in cui ogni riga ha un id, un riquadro e una descrizione. La didascalia menziona ogni elemento tramite il suo identificatore (animal_1, crowd_1…) dove compare.
Un editing che non rompe nulla
Seconda promessa: ritoccare un'immagine finita senza snaturarla. Ogni riquadro può essere ridescritto, sostituito o spostato, e più modifiche possono essere applicate in un solo passaggio.
Black Forest Labs insiste sulla stabilità: ciò che non è stato modificato resta al suo posto, il che permette di concatenare più round di editing senza che l'immagine derivi. Le demo mostrano una muta e una tavola da surf ricolorate, oppure due subacquei aggiunti a una scena esistente.
È esattamente il punto debole storico dei modelli di diffusione, che tendevano a rigenerare tutto non appena si toccava un dettaglio.
Il ruolo discreto dell'upsampler
Le richieste brevi passano attraverso un prompt upsampler, che le trasforma in didascalie dense, il formato su cui FLUX 3 è stato addestrato. Può riscrivere la didascalia attorno ai riquadri e suggerire altri elementi.
Ma la regola è rigida: ogni riquadro disegnato dall'utente arriva al modello tale e quale, con lo stesso id e le stesse coordinate. Ciò che l'upsampler aggiunge sopravvive solo se la didascalia lo richiama. Un modo per mantenere la mano umana prioritaria sulla riscrittura automatica.
Un modello su misura per gli agenti
Black Forest Labs presenta FLUX 3 Image come "designed for agents". Basta dare una riga e un formato: un LLM pianifica il layout, scrive la didascalia e la tabella di elementi con id semantici.
L'utente può poi spostare i riquadri che non gli convincono, con il modello che genera negli altri così come l'agente li ha posizionati. L'esempio di un "Lago dei cigni visto dal dietro le quinte" illustra questa catena.
Senza alcun riquadro, il modello resta un classico text-to-image, con un seguimento del prompt rivendicato come solido e una comprensione nativa della composizione.
Usi previsti e accesso
I casi d'uso messi in evidenza sono quelli in cui molti elementi obbediscono a relazioni rigide: testo composto attorno a una foto, collage, griglie di miniature, doppie pagine editoriali, scene di folla dove ogni volto ha il suo posto.
Quanto all'accesso, si possono disegnare i riquadri a mano nel Playground o inviare un layout prompt tramite l'API BFL. Le aziende che generano su larga scala possono ottenere i pesi sotto licenza commerciale per fare fine-tuning e ospitarli presso di sé, su richiesta.
“Everything you didn't touch stays exactly where it was.”
“Every box you drew reaches the model verbatim, with the same id and the same coordinates.”
“Anything the upsampler adds survives only if the caption refers to it.”
Perché conta
FLUX 3 Image sancisce uno spostamento nella generazione di immagini: la battaglia non si gioca più solo sulla bellezza del rendering, ma sul controllo. Le bounding box, la tabella JSON e l'editing localizzato trasformano il prompt in una specifica, leggibile sia da un umano sia da un agente, il che si adatta perfettamente ai workflow di produzione (pubblicità, stampa, e-commerce) dove si vuole un'immagine precisa e riproducibile. Il formato strutturato è anche un'ovvietà per gli agenti: un LLM sa scrivere JSON con coordinate molto meglio di quanto sappia indovinare l'estetica di un modello. Resta il fatto che si tratta di una pagina prodotto: nessun benchmark, nessun prezzo, nessun confronto con la concorrenza, e la promessa che "tutto il resto non si muove" richiede verifica su casi difficili. Si nota anche la scelta di una licenza di pesi commerciale, su richiesta, piuttosto che un'apertura ampia: un segnale che Black Forest Labs assume ormai un posizionamento da editore per aziende. Infine, FLUX 3 è presentato come multimodale (video, audio, azioni), ma questa pagina ne mostra solo l'immagine: il resto della famiglia sarà il vero banco di prova dell'ambizione.
Account gratuito
Hai appena letto un articolo di AI Sources
Crea un account gratuito: un mese di archivio completo, le tue fonti riassunte come questa, le tue note ed evidenziazioni.
Per te
Falla lavorare sulle tue fonti.
Gratis: un mese di articoli e tre fonti tue. Pro: tutto l'archivio e le tue fonti, da 8 €/mese.
Per il tuo team
La stessa macchina, sui vostri temi.
Uno spazio con i vostri colori, i vostri angoli di monitoraggio, i vostri curatori. Pilota aperto a tre aziende.
Da leggere anche
#ricercaIeriHinton, Bengio, OpenAI e Anthropic firmano un piano contro l'esplosione di intelligenza
Ventidue ricercatori, tra cui dirigenti di OpenAI e Anthropic, ritengono che l'automazione della ricerca in IA potrebbe comprimere anni di progresso in pochi mesi, e che gli Stati non sono preparati.
Fonte · Cambridge Programme on AI Science & Policy (CASP) · What if automating AI R&D triggers an intelligence explosion?
#gpt-6IeriGPT-6: la guida di OpenAI per passare dal prototipo alla produzione
Tre modelli, cinque livelli di ragionamento, due velocità e agenti che lavorano per ore: OpenAI pubblica il manuale d'uso della sua nuova famiglia.
Fonte · OpenAI · A model guide for the GPT-6 family
#open source2 ottClef: Cloudflare lancia i propri modelli di decisione, open source
Con Clef e Clef-flash, Cloudflare entra nel mercato nascente dei «decision model» e vi aggiunge una piattaforma di fine-tuning tramite reinforcement learning.
Fonte · Cloudflare Blog · Introducing Clef: our open-source decision models, and new RL fine-tuning platform