Diffusion Controller: Google vereinheitlicht die Steuerung von Bildgeneratoren
Google Research verwandelt das Denoising in ein kontinuierliches Kontrollproblem und präsentiert einen „Lenkdämpfer“, der sogar ein geschlossenes Modell steuern kann.

Kurz gesagt
Google Research stellt Diffusion Controller vor, ein mathematisches Rahmenwerk, das Inferenz-Guidance-Techniken und Fine-Tuning von Diffusionsmodellen unter einem gemeinsamen Formalismus vereint. Sein leichtes Zusatznetzwerk, das das Basismodell unangetastet lässt, schlägt LoRA bei Human-Preference-Scores, und die „White-Box“-Version erreicht eine Win-Rate von 90 % gegenüber dem Referenzmodell. Der Einsatz: geschlossene Modelle personalisieren, ohne ihre Gewichte anzufassen.
🍺 Tresen-Version
Du bittest um eine Eidechse mit Sonnenbrille, und die KI liefert dir entweder eine Eidechse ohne Brille oder eine Brille mit etwas, das mal eine Eidechse gewesen sein könnte. Bisher haben Ingenieure das mit einem Werkzeugkasten geflickt, in dem jeder Schlüssel aus einem anderen Laden kam. Google kommt jetzt mit einer einheitlichen Theorie und einem kleinen Modul, das man dem Modell aufpfropft, ohne die Haube zu öffnen – etwa so, wie man die Spur eines Motorrads korrigiert, indem man den Lenker justiert statt den Motor auszubauen. Und weil das auch bei Modellen funktioniert, deren Baupläne man nicht kennt, werden Black Boxes plötzlich deutlich gefügiger.
Das Wichtigste
- 1
Diffusion Controller formuliert den gesamten Denoising-Prozess als kontinuierliches Kontrollproblem um, statt als Abfolge isolierter Schritte.
- 2
Das Rahmenwerk vereint bisher getrennt behandelte Methoden: Classifier-free Guidance zur Inferenzzeit, LoRA-Adapter, belohnungsgewichtete Regression und Policy Gradients.
- 3
Das Basismodell bleibt eingefroren: ein leichtes Netzwerk, der „Lenkdämpfer“, injiziert während der Generierung kleine Kurskorrekturen.
- 4
Daraus ergeben sich zwei praktische Fine-Tuning-Methoden, beide basierend auf einem finalen Belohnungswert: PPO mit Clipping-Regel und ein belohnungsgewichteter Loss.
- 5
Getestet an Stable Diffusion v1.4, übertrifft das Netzwerk mit „Gray-Box“-Zugriff LoRA, obwohl dieses White-Box ist, beim HPS-v2-Score in SFT und RWL.
- 6
Die vollständig entfesselte White-Box-Version erreicht eine Win-Rate von 90 % gegenüber dem Referenzmodell.
- 7
Ein einziger, zur Inferenzzeit einstellbarer Guidance-Stärke-Parameter erlaubt es, die Kontrollintensität zu dosieren, ohne das Bild zu beschädigen.
Das Problem: steuern, ohne kaputtzumachen
Text-to-Image-Modelle wie Nano Banana, Stable Diffusion oder Flux erzeugen fotorealistische Bilder, aber sie präzise zu steuern bleibt eine Gratwanderung. Googles Beispiel: „eine Eidechse mit Sonnenbrille“. Das Modell kann die Brille vergessen oder sie erzwingen, auf Kosten eines verzerrten Eidechsengesichts.
Um das zu korrigieren, verfügen Entwickler über zwei unzusammenhängende Werkzeugfamilien. Zum einen Inferenz-Guidance wie Classifier-free Guidance, die den Einfluss des Prompts in Echtzeit moduliert. Zum anderen schwergewichtiges Fine-Tuning per LoRA, belohnungsgewichtete Regression oder Policy Gradients.
Mangels einer gemeinsamen mathematischen Sprache läuft die Abwägung zwischen Ausrichtung an Präferenzen und Bildqualität laut den Forschern oft auf Trial-and-Error hinaus.
Denoising als gesteuerte Trajektorie
Diffusion Controller behandelt die Generierung, die von zufälligem Rauschen zu einem scharfen Bild führt, als kontinuierliche Trajektorie, die sich lenken lässt. Google führt die Metapher fort: Das vortrainierte Modell ist ein großes Motorrad, an dessen Motor man riskant herumbasteln würde.
Das Rahmenwerk fügt also einen leichten „Lenkdämpfer“ hinzu, während das Hauptmodell eingefroren bleibt. Dieses Modul rekalibriert das Standardverhalten, indem es Richtungen bevorzugt, die eine vom Nutzer definierte Zielgröße maximieren, etwa Stil oder Kontexttreue.
Eine Strafe fungiert als Leitplanke: Im Eidechsen-Beispiel wird die Brille zwar hinzugefügt, aber ohne die Schuppen und Proportionen des Tieres zu opfern.
Von der Theorie zu zwei konkreten Methoden
Die Kontrollgleichungen, die in ihrer ursprünglichen Form möglicherweise unlösbar sind, werden in zwei Fine-Tuning-Methoden übersetzt, die allein auf einem finalen Belohnungswert basieren.
Die erste, basierend auf Policy Gradients und PPO, geht in kleinen schrittweisen Anpassungen vor und integriert eine Clipping-Regel, die wie ein Tempolimit wirkt, um das Training stabil zu halten.
Die zweite, ein belohnungsgewichteter Loss, dient als Abkürzung: Sie bevorzugt stark erfolgreiche Generierungen und geht laut Google mit einer mathematischen Garantie einher, die Zielbilder zu erlernen.
Ein Modell steuern, das man nicht öffnen kann
Das Business-Argument ist explizit: Die besten Bildgeneratoren sind oft Black- oder Gray-Boxes, deren Gewichte man nicht ändern kann. Klassisches Fine-Tuning erfordert jedoch White-Box-Zugriff.
Das Dämpfungsnetzwerk kombiniert das Wissen des Basismodells mit einer kleinen Korrektur. Es beobachtet das Bild während des Denoisings und injiziert feine Korrekturen, wodurch sich geschlossene Modelle personalisieren ließen, ohne deren Code anzufassen.
Was die Experimente zeigen
Die Tests beruhen auf Stable Diffusion v1.4 in drei Regimen: SFT, RWL und PPO, mit dem Human Preference Score (HPS-v2) als Messgröße. Vier Architekturen werden verglichen: Diffusion Controller (Gray-Box, mit inversem Zwischenmittelwert und seitlichem Adapter-Fluss), eine naive Version ohne diese beiden Elemente, und zwei White-Box-Varianten, J (gemeinsames Training mit dem Basismodell) und S (getrenntes Training).
In SFT und RWL schlägt die Gray-Box-Version LoRA bei der HPS-v2-Win-Rate, während sie deutlich weniger interne Schichten verändert. Auch menschliche Bewertungspanels attestieren ihr die beste wahrgenommene Qualität und die beste Treue bei komplexen Multi-Attribut-Prompts.
Letzter Trumpf: ein einziger, zur Inferenzzeit einstellbarer Guidance-Stärke-Parameter, um die Kontrollintensität zu erhöhen oder zu senken, ohne die Verzerrungen älterer Guidance-Methoden.
Und weiter
Da die Kontrollschicht vom Kern-Engine getrennt ist, sieht Google Einsatzmöglichkeiten über die reine Prompt-Treue hinaus: fortgeschrittene Personalisierungswerkzeuge, Sicherheitsmechanismen zur Begrenzung schädlicher Inhalte und Anpassung an Video-Modelle der nächsten Generation.
“Diffusion Controller reframes the entire denoising process as a smooth, continuous control problem.”
“This allows engineers to perfectly control and customize even tightly locked, closed-source models without ever touching the underlying code.”
Warum es zählt
Der Reiz von Diffusion Controller liegt weniger im Score-Gewinn als im Rahmenwechsel: Guidance und Fine-Tuning in eine gemeinsame Kontrolltheorie zu bringen bedeutet, Teams ein Mittel zu geben, ihre Abwägungen zu analysieren, statt sie zu erraten. Das folgenreichste Versprechen ist die „Gray-Box“-Steuerung: Wenn man ein Modell effektiv personalisieren kann, ohne Zugriff auf seine Gewichte zu haben, könnten Anbieter geschlossener Modelle ihren Kunden diese Art von Schnittstelle anbieten, und das Open-Weights-Argument für Personalisierung würde dadurch geschwächt. Man sollte jedoch nüchtern bleiben: Die Ergebnisse beziehen sich auf Stable Diffusion v1.4, ein älteres Modell, mit HPS-v2 als Hauptmetrik, einem Präferenzscore, der nicht alles erfasst. Die 90 %-Zahl bezieht sich auf die White-Box-Version gegenüber dem Basismodell, nicht gegenüber Konkurrenten. Und der Beitrag präzisiert nicht, welchen minimalen Zugriff der Gray-Box-Modus tatsächlich erfordert, da er Zwischenzustände des Denoisings verbraucht, die nur wenige kommerzielle APIs offenlegen. Es bleibt abzuwarten, wie die Skalierung auf neuere Modelle und auf Video funktioniert.
Kostenloses Konto
Sie haben gerade einen Artikel von AI Sources gelesen
Erstellen Sie ein kostenloses Konto: ein Monat Archiv in voller Länge, Ihre eigenen Quellen zusammengefasst wie diese, Ihre Notizen und Markierungen.
Für dich
Lass sie mit deinen Quellen arbeiten.
Kostenlos: einen Monat Artikel und drei eigene Quellen. Pro: das ganze Archiv und deine Quellen, ab 8 €/Monat.
Für dein Team
Dieselbe Maschine, zu euren Themen.
Ein Bereich in euren Farben, eure Beobachtungswinkel, eure Kuratoren. Pilot offen für drei Unternehmen.
Weiterlesen
#chatgptHeuteDevDay 2026: OpenAI macht ChatGPT zur Plattform für Agenten
Über 20 Ankündigungen, ein Modell namens GPT-6 Astra und ein klares Ziel: ChatGPT soll der Ort werden, an dem Menschen, Agenten und Entwickler zusammenkommen.
Quelle · Blog d'OpenAI · DevDay 2026 Recap
#benchmarksHeuteGPT-6.1 Sol: fast auf Astra-Niveau, für ein Fünftel des Preises
OpenAI aktualisiert sein mittleres Modell und verspricht die Leistung seines Spitzenmodells bei Code, Agenten und professionellen Aufgaben – bei einem fünfmal niedrigeren Preis.
Quelle · OpenAI · Introducing GPT-6.1 Sol
#regulierungHeuteTrump benennt KI per Präsidialerlass in „Super Intelligence“ um
In der US-Regierung ist das Wort „AI“ ab sofort tabu: Das Weiße Haus schreibt „SI“ für Super Intelligence vor und beauftragt seinen wissenschaftlichen Berater mit der bundesweiten Definition.
Quelle · The White House · Fact Sheet: President Donald J. Trump Inaugurates The Era of Super Intelligence