Diffusion Controller: ein Steuerungsrahmen für das Fine-Tuning von Diffusionsmodellen
Diffusion Controller, entwickelt von Forschenden bei Google und an zwei Universitäten, behandelt das Fine-Tuning von Diffusionsmodellen als Steuerungsproblem über den Entrauschungsprozess. Aus dem Ansatz folgen zwei Verfahren des bestärkenden Lernens und ein kleines Seitennetz, das ein eingefrorenes Bildmodell lenkt. Laut den Autoren übertraf es LoRA in zwei von drei Trainingsregimen auf Stable Diffusion v1.4.

Warum ist es so schwer, Text-zu-Bild-Modelle gezielt zu lenken?
Wer ein Bildmodell stärker auf ein Ziel drängt, entfernt es meist von dem, was es im Vortraining gelernt hat, und diese Distanz kostet Bildqualität. Teams kombinieren heute Guidance zur Inferenzzeit mit Werkzeugen zur Trainingszeit wie Adaptern und belohnungsbasiertem Fine-Tuning. Das Paper argumentiert, dass diese Verfahren als getrennte Lösungen mit eigenen Zielfunktionen dargestellt wurden. Wie stark man lenkt, beruhte daher auf Ausprobieren statt auf einer gemeinsamen Theorie.
Der Beitrag von Google Research veranschaulicht den Zielkonflikt mit einer Eidechse, die eine Sonnenbrille trägt. Ein schwach gelenktes Modell zeichnet vielleicht eine überzeugende Eidechse und vergisst die Brille. Ein stark gelenktes Modell fügt sie ein, verzerrt aber das Gesicht des Tieres. In beiden Fällen verfehlt das Bild einen Teil des Auftrags.
Der Zugang ist eine zweite Hürde. Verbreitete Adapter wie LoRA fügen trainierbare Schichten in das Netz ein und brauchen daher White-Box-Zugriff auf die Gewichte. Das Paper beschreibt einen häufigen Mittelweg, den Gray-Box-Zugriff: Ein proprietäres oder sicherheitskritisches Modell bleibt versiegelt, gibt aber begrenzte Signale preis, etwa seine Rauschvorhersagen pro Schritt oder den Entrauschungsverlauf. Verfahren, die die Gewichte benötigen, scheiden dort aus.
Wie fasst Diffusion Controller das Fine-Tuning von Diffusionsmodellen neu?
Es behandelt den Entrauschungsprozess als stochastisches Steuerungsproblem. In der Formulierung der Autoren gewichtet ein Regler den Übergang des vortrainierten Modells von einem verrauschten Zustand zum nächsten neu, eine Belohnung bewertet nur das fertige Bild, und eine Divergenzstrafe belastet jeden Schritt, der vom ursprünglichen Verhalten abweicht. Fine-Tuning heißt dann, die Steuerung zu finden, die Belohnung und Strafe am besten ausbalanciert.
Der mathematische Rahmen ist ein linear lösbarer Markov-Entscheidungsprozess, eine Klasse von Steuerungsproblemen, in denen der Regler direkt auf Übergangswahrscheinlichkeiten wirkt, statt eigene Aktionen zu wählen. Frühere Verfahren des bestärkenden Lernens für Diffusion wie DDPO und DPOK modellierten das nächste verrauschte Bild als Aktion. Die Autoren weisen darauf hin, dass diese Aktion eigentlich nur der nächste Zustand ist. Den Übergang selbst zu formen, beschreibt das Problem daher direkter.
Die Strafe ist eine allgemeine f-Divergenz. Mit der Kullback-Leibler-Divergenz ergibt sich die klassische Variante dieses Steuerungsproblems, und ein Regularisierungskoeffizient legt fest, wie eng das Modell an seinem vortrainierten Verhalten bleibt. Weil sich aus den idealen gesteuerten Übergängen nur aufwendig Stichproben ziehen lassen, trainieren die Autoren stattdessen einen gewöhnlichen Diffusions-Entrauscher, dessen Endausgaben derselben Zielverteilung folgen.
Zwei Fine-Tuning-Verfahren aus einem Rahmen
Die Steuerungssicht liefert zwei Rezepte des bestärkenden Lernens, die nur ein Belohnungsmodell für das fertige Bild benötigen. Beide folgen aus denselben Optimalitätsbedingungen, und genau darin liegt der Kern des Vereinheitlichungsanspruchs: Getrennt entwickelte Verfahren erweisen sich als Varianten einer einzigen Zielfunktion.
Dieselbe Modellstruktur lässt sich auch mit gewöhnlichem überwachtem Fine-Tuning trainieren, wenn Beispielbilder aus der Zielverteilung vorliegen. Ein Entwurf deckt so datengetriebene und belohnungsgetriebene Anpassung ab.
- Policy Gradient mit PPO-artigem Update. Das Modell verbessert sich in kleinen, wiederholten Schritten, gewichtet mit einer Vorteilsschätzung. Eine Clipping-Regel begrenzt, wie weit ein einzelnes Update das Modell verschieben kann, und hält das Training stabil. Ohne Regularisierung entspricht das Update DDPO, mit einer Kullback-Leibler-Strafe ähnelt es stark DPOK.
- Belohnungsgewichteter Verlust. Der übliche Entrauschungsverlust wird mit der Belohnung jeder Stichprobe gewichtet, wodurch aus einer nicht direkt berechenbaren Zielfunktion eine gewöhnliche Regression wird. Unter der Kullback-Leibler-Strafe beweisen die Autoren, dass dieser Verlust sein Minimum mit der idealen Zielfunktion teilt. Daraus folgt eine exponentielle Gewichtung, aus einer Alpha-Divergenz-Strafe eine polynomielle.
Was leistet das Seitennetz an einem eingefrorenen Modell?
Es liefert die Korrektur, während das ursprüngliche Modell unberührt bleibt. Die Steuerungsanalyse zeigt, dass der optimale angepasste Prädiktor dem vortrainierten Prädiktor plus einer kleinen, strukturierten Anpassung entspricht. Diffusion Controller friert deshalb das Basismodell ein und trainiert ein separates, leichtgewichtiges Netz, das bei jedem Schritt die Zwischenausgabe des Basismodells sowie Prompt und Zeitschritt liest und diese Anpassung zurückgibt.
Entscheidend ist die Eingabe. Statt des verrauschten Latents erhält das Seitennetz den Reverse Mean, also die Schätzung des Basismodells, wo der nächste Entrauschungsschritt landen soll. Seine Ausgabe teilt sich in einen einzelnen Gating-Wert und einen Korrekturterm auf. Das spiegelt die Zerlegung in der zentralen Proposition des Papers wider, die die Autoren mit Cross-Attention über Merkmale des Reverse Mean vergleichen. Umgesetzt ist das Seitennetz als kleines UNet im latenten Raum.
Zwei praktische Details fallen auf. Die letzte Schicht startet bei null, sodass sich das kombinierte Modell vor dem Training genau wie das vortrainierte verhält, ähnlich wie ein frisch initialisierter LoRA-Adapter. Zudem lässt sich eine Stärkeeinstellung des Seitennetzes zur Inferenzzeit ändern, sodass Nutzer die Lenkung ohne neues Training verstärken oder abschwächen können.
Wie wurde Diffusion Controller evaluiert?
Alle Experimente nutzten Stable Diffusion v1.4. Textencoder und Bild-Autoencoder blieben eingefroren, angepasst wurde nur der latente Entrauscher. Die Autoren testeten drei Regime: überwachtes Fine-Tuning auf bevorzugten Bildern aus dem Human Preference Dataset v2 sowie belohnungsgewichtetes und PPO-Fine-Tuning mit dem Belohnungsmodell Human Preference Score v2. Die zentrale Kennzahl ist, wie oft ein Modell das vortrainierte Modell nach diesem Score schlägt.
Überwachte Läufe umfassten 1000 Iterationen mit einer Batchgröße von 128. Belohnungsgewichtete Läufe umfassten 2000 Iterationen und PPO-Läufe 2400 Iterationen, jeweils mit einer Batchgröße von 64, und die Classifier-free Guidance war auf 7,5 festgelegt. Die Autoren verfolgten außerdem CLIP, CLIP-Aesthetics und PickScore, um zu prüfen, ob andere Qualitäten erhalten blieben, und ließen mehr als 50 bezahlte Bewertende PPO-Modelle anhand von 50 Prompts vergleichen.
- DiffCon als Gray-Box-Variante. Das vorgeschlagene Seitennetz, gespeist mit dem Reverse Mean und über die gegatete Korrektur kombiniert. Es trainiert rund 12 Millionen Parameter.
- DiffCon-Naive als Gray-Box-Vergleich. Ein nahezu identisches Seitennetz, das das verrauschte Latent sieht und eine ungegatete Korrektur addiert. So lässt sich der Effekt von Eingabewahl und Ausgabestruktur isolieren.
- LoRA als White-Box-Vergleich. Adapter mit Rang 16 im Basismodell, mit rund 17 Millionen trainierbaren Parametern.
- DiffCon-J als White-Box-Variante. LoRA-Adapter mit Rang 4 und das Seitennetz, gemeinsam trainiert, mit insgesamt rund 16 Millionen Parametern.
- DiffCon-S als getrennt trainierte White-Box-Variante. Dieselben beiden Komponenten, getrennt trainiert und erst bei der Evaluation kombiniert.
Welche Ergebnisse berichten die Autoren?
In zwei der drei Regime schlug der Gray-Box-Regler LoRA und trainierte dabei weniger Parameter. Die Autoren berichten Gewinnraten gegenüber dem vortrainierten Modell von 0,6667 für DiffCon gegenüber 0,5766 für LoRA beim überwachten Fine-Tuning sowie 0,6815 gegenüber 0,6109 beim belohnungsgewichteten Fine-Tuning. Mit PPO ändert sich das Bild: LoRA erreichte 0,9048, das Gray-Box-DiffCon 0,6957.
Die White-Box-Kombinationen schnitten mit PPO am besten ab, mit 0,9353 für DiffCon-J und 0,9315 für DiffCon-S. Der Beitrag von Google Research fasst diese vollständig geöffnete Einstellung als Gewinnrate von 90 % gegenüber dem Basismodell zusammen. DiffCon-S erzielte zudem das beste belohnungsgewichtete Ergebnis, 0,7091.
Das naive Seitennetz bewegte sich kaum, mit Gewinnraten von 0,5655, 0,5060 und 0,5201 in den drei Regimen. Da es Größe und Basismodell mit dem Regler teilt, deutet der Abstand darauf hin, dass die Zugewinne davon abhängen, was das Seitennetz sieht und wie seine Ausgabe eingebunden wird, und nicht allein von zusätzlicher Kapazität.
Die sekundären Prüfungen blieben stabil. CLIP, CLIP-Aesthetics und PickScore lagen nahe an den Werten des vortrainierten Modells, was die Autoren als Zeichen werten, dass keine anderen Qualitäten verloren gingen. In der Studie mit menschlichen Bewertenden zu PPO-Modellen schlug laut den Autoren jede ihrer Varianten die jeweils eigene Vergleichsbasis. Die polynomielle Belohnungsgewichtung des Papers übertraf außerdem den belohnungsgewichteten Verlust aus DPOK und kam dabei mit einem Viertel der Stichproben aus.
Grenzen und offene Fragen
Die Belege sind vielversprechend, aber schmal. Alle Ergebnisse stammen von einem einzigen Basismodell, Stable Diffusion v1.4, das älter ist als Systeme, die das Paper selbst nennt, etwa Stable Diffusion 3 und Flux.1, und von einem einzigen Präferenzsignal, Human Preference Score v2. Personalisierung, Sicherheitsausrichtung und Transfer Learning nennen die Autoren als künftige Richtungen; getestet wird davon nichts.
Unsere eigene Lektüre des Papers ergibt vier Vorbehalte.
- Überschneidung von Belohnung und Kennzahl. Die belohnungsgetriebenen Läufe optimieren Human Preference Score v2 und werden vor allem am selben Score gemessen. Sekundäre Kennzahlen und die Studie mit Bewertenden verringern das Risiko, dass Modelle lernen, dem Bewerter zu gefallen, beseitigen es aber nicht.
- Berichtet wird die beste Einstellung. Für jeden Checkpoint testen die Autoren mehrere Stärkeeinstellungen des Seitennetzes und berichten die beste Gewinnrate. Eine einzige feste Einstellung würde vermutlich schlechter abschneiden.
- Gray-Box ist nicht Black-Box. Der Regler braucht bei jedem Entrauschungsschritt die Zwischenausgaben des Basismodells. Viele gehostete Bilddienste liefern nur fertige Bilder. Die Methode passt daher zu Anbietern, die diese Signale freigeben, nicht zu jedem geschlossenen Modell.
- Lückenhafte Abdeckung. Die menschliche Bewertung umfasst nur PPO-Modelle und vergleicht jede Variante mit ihrer eigenen Vergleichsbasis, nicht den Gray-Box-Regler mit LoRA. Weder das Paper noch der Blogbeitrag erwähnen eine Veröffentlichung des Codes.
Warum ist das für die Bildgenerierung in Unternehmen relevant?
Nach unserer Analyse ist die Trennung der beachtenswerte Gedanke. Ein geprüftes, eingefrorenes Basismodell plus ein kleiner, für ein bestimmtes Ziel trainierter Regler lässt sich leichter versionieren, testen und zurückrollen als eine vollständig veränderte Kopie des Netzes. Eine Stärkeeinstellung zur Laufzeit bietet zudem eine einfache Möglichkeit, Prompt-Treue und Bildtreue je Anwendungsfall abzuwägen.
Der Haken liegt im Zugang. Der Ansatz braucht einen Modellanbieter, der Zwischenausgaben der Entrauschung freigibt, und die Belohnung bestimmt, was sich verbessert. Wer Bilder an einen Markenstil oder an Produktgenauigkeit anpassen will, bräuchte eine Belohnung, die genau das misst, denn Ergebnisse auf Stable Diffusion v1.4 mit einem allgemeinen Präferenzscore übertragen sich nicht automatisch auf solche Ziele.
Das Paper bietet außerdem ein nützliches Vokabular. Wer Guidance, Adapter und belohnungsbasiertes Fine-Tuning als Varianten eines Steuerungsproblems begreift, kann Verfahren klarer vergleichen und die Kosten abschätzen, die entstehen, wenn ein Modell weiter von seiner Basis weggelenkt wird.
Ist Diffusion Controller verfügbar?
Nicht als veröffentlichte Software. Weder das Paper noch der Beitrag von Google Research verlinken Code oder trainierte Gewichte. Das Paper, arXiv:2603.06981, wird unter der standardmäßigen, nicht exklusiven Lizenz von arXiv verbreitet, weshalb dieser Überblick keine seiner Abbildungen wiedergibt. Datensatz und Belohnungsmodell der Experimente, Human Preference Score v2, stellen ihre eigenen Autoren öffentlich bereit.
Fragen und Antworten
Was ist Diffusion Controller?
Diffusion Controller, kurz DiffCon, ist ein Rahmenwerk von Forschenden bei Google Research, Google DeepMind, der Carnegie Mellon University und der Yale University. Es beschreibt das Fine-Tuning von Diffusionsmodellen als optimale Steuerung des Entrauschungsprozesses, leitet daraus Policy-Gradient- und belohnungsgewichtete Trainingsverfahren ab und schlägt ein kleines Seitennetz vor, das ein eingefrorenes Basismodell lenkt. Getestet wird es auf Stable Diffusion v1.4.
Worin unterscheidet sich Diffusion Controller von LoRA?
LoRA fügt kleine trainierbare Matrizen in das Modell ein und braucht deshalb Zugriff auf die Gewichte. Diffusion Controller lässt das Modell unberührt und trainiert ein separates Netz, das die Zwischenvorhersagen des Modells liest und eine Korrektur hinzufügt. In den Tests der Autoren schlug das Seitennetz LoRA beim überwachten und beim belohnungsgewichteten Fine-Tuning mit weniger Parametern, während LoRA mit PPO vorn blieb. Beide lassen sich auch kombinieren.
Kann Diffusion Controller ein geschlossenes Bildmodell anpassen?
Nur ein teilweise geschlossenes. Die Methode lässt das Basismodell eingefroren, braucht aber bei jedem Entrauschungsschritt dessen Reverse Mean, was das Paper Gray-Box-Zugriff nennt. Ein Anbieter, der nur fertige Bilder zurückgibt, liefert dieses Signal nicht. Die Methode passt daher zu Umgebungen, in denen ein Anbieter Ausgaben pro Schritt freigibt oder den Regler neben dem eigenen Modell betreibt.
Welche Belohnung und welchen Benchmark nutzten die Experimente?
Die belohnungsgetriebenen Läufe optimierten Human Preference Score v2, ein Modell, das vorhersagt, welche Bilder Menschen zu einem Prompt bevorzugen. Die überwachten Läufe trainierten auf bevorzugten Bildern aus dem zugehörigen Datensatz. Die Ergebnisse werden als Gewinnraten gegenüber dem unveränderten Stable Diffusion v1.4 auf den Testprompts des Benchmarks berichtet, mit CLIP, CLIP-Aesthetics, PickScore und einer Studie mit Bewertenden als sekundären Prüfungen.
Quellen
- Yang, T., Ryu, M., Hsu, C.-W., Tennenholtz, G., Chi, Y., Boutilier, C., & Dai, B. (2026). Diffusion Controller: Framework, algorithms and parameterization. arXiv:2603.06981. https://arxiv.org/abs/2603.06981 (externe Website)
- Wu, X., Hao, Y., Sun, K., Chen, Y., Zhu, F., Zhao, R., & Li, H. (2023). Human Preference Score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis. arXiv:2306.09341. https://arxiv.org/abs/2306.09341 (externe Website)
- Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2021). High-resolution image synthesis with latent diffusion models. arXiv:2112.10752. https://arxiv.org/abs/2112.10752 (externe Website)
- Hu, E. J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., & Chen, W. (2021). LoRA: Low-rank adaptation of large language models. arXiv:2106.09685. https://arxiv.org/abs/2106.09685 (externe Website)
- Ho, J., & Salimans, T. (2022). Classifier-free diffusion guidance. arXiv:2207.12598. https://arxiv.org/abs/2207.12598 (externe Website)
- tgxs002. (n.d.). HPSv2: Human Preference Score v2 benchmark and reward model [Computer software]. GitHub. https://github.com/tgxs002/HPSv2 (externe Website)
Originalbeitrag
Hsu, C.-W., & Ryu, M. (2026, 29 September). How Diffusion Controller unifies and simplifies AI image generation. Google Research Blog. https://research.google/blog/how-diffusion-controller-unifies-and-simplifies-ai-image-generation/ (externe Website)