Zum Hauptinhalt springen
Bibha Startseite

Forschungsüberblick,

Learning Interactives: Wie Generative UI in der Bildung Lernziele in geführte Simulationen übersetzt

Learning Interactives ist ein Framework von Google Research, das Generative UI in der Bildung nutzt: Gemini baut aus der Anfrage einer Lehrkraft geführte MINT-Simulationen. Eine Schleife automatischer Prüfer steigert den Anteil brauchbarer Simulationen deutlich, und Lehrkräfte prüfen jede einzelne, bevor sie in die öffentliche Bibliothek aufgenommen wird.

Von Ayushman Thakur, Lead Engineer bei Bibha AI Labs

FachartikelKovshov, A., Choudhury, A., Iurchenko, A., Keeling, A., Hassidim, A., Shasha Evron, A., Çakmakli, A., Akrong, D., Olanubi, F., Elidan, G., Li, I., Lerer, I., Chou, K., Hackmon, L., Gordon, M., Kerem, N., Efron, N., Singh, P., Levitt, R., . . . Lev, Y. (2026). Harnessing generative UI for education: Tailored learning interactives. arXiv:2609.20738. (externe Website)

Pendel aus Ton, kreisender Planet und gepunktete Wurfbahn auf Stufenpodesten neben einer Milchglasscheibe auf einem Eichentisch
KI-generierte Illustration: eine Physiksimulation im Miniaturformat auf Stufen, die Level mit wachsendem Anspruch andeuten.

Warum ist interaktives Üben so schwer herzustellen?

Interaktive Simulationen helfen Lernenden, durch eigenes Tun zu lernen, doch sie sind teuer in der Entwicklung, selten und schwer an eine bestimmte Klasse anzupassen. In einem Beitrag von Google Research (17. September 2026) beschreiben Gal Elidan und Yael Haramaty Forschung, die in einem begleitenden technischen Bericht dargelegt ist und prüft, ob generative Modelle diese Lücke schließen können, ohne den Unterricht zu schwächen.

Der Nutzen aktiven Lernens ist seit Langem belegt. Der Bericht stützt sich auf Dewey, Piaget, Bruner und Papert sowie auf das ICAP-Modell von Chi und Wylie (2014), das interaktive Beteiligung mit tieferem Verständnis und längerem Behalten verbindet als passives Lesen oder Zuhören. Koedinger und Kollegen (2015) fassten das in einem Satz zusammen, den der Beitrag aufgreift: „Lernen ist kein Zuschauersport.“

Der Bericht benennt außerdem zwei Risiken. Generative UI liefert ohne Anpassung eher einzelne Widgets als strukturierte Lerneinheiten mit mehreren Phasen. Zudem funktioniert ungelenktes Entdecken schlecht, wie Kirschner, Sweller und Clark (2006) darlegten, während die uneingeschränkte Nutzung von KI-Assistenten dazu verleiten kann, das Denken an das Werkzeug abzugeben. Der Bericht beschreibt diese Spannung unter Verweis auf Jose und Kollegen (2025) als Gegensatz von Stärkung und Erosion.

Was bedeutet Generative UI in der Bildung?

Generative UI bedeutet, dass ein Modell die Oberfläche selbst als funktionierenden Code erstellt, statt ein vorab entworfenes Layout zu befüllen. Im Bildungsbereich kann eine Lehrkraft so ein Thema beschreiben und eine maßgeschneiderte Simulation erhalten. Learning Interactives ist das Framework der Autoren, um dies mit Gemini unter pädagogischen Leitplanken umzusetzen, damit eine geführte Lerneinheit entsteht und kein einmaliges Widget.

Frühere Arbeiten von Google Research, verfasst von Leviathan und Kollegen (2026), zeigten, dass ein gut instruiertes Modell mit passenden Werkzeugen für nahezu jeden Prompt eigene Oberflächen erzeugen kann. Der Bildungsbericht argumentiert, dass generische Ergebnisse für komplexe Lerneinheiten nicht genügen, und umgibt das Modell deshalb mit einer Struktur aus vier lernwissenschaftlichen Prinzipien, die jeweils einer Gestaltungsentscheidung zugeordnet sind.

  • Ausrichtung am Lehrplan. Gemini entwirft aus der Anfrage der Lehrkraft präzise Lernziele. Die Lehrkraft kann sie bearbeiten, und sie müssen freigegeben sein, bevor der Rest des Interactives erzeugt wird.
  • Eigenständigkeit und Motivation. Jedes Thema wird in Level mit klaren Zielen gegliedert, die Schritt für Schritt schwieriger werden. Elemente des spielbasierten Lernens halten Herausforderung und Erfolgserlebnis im Gleichgewicht.
  • Anleitung und Lerngerüste. Eine Einführung aktiviert Vorwissen, eine Werkzeugkiste enthält die nötigen Formeln und Theorien, und Hinweise kommen in Stufen, sodass Lernende Hilfe bekommen, ohne dass ihnen die Lösung vorgegeben wird.
  • Formatives Feedback. Die Simulation reagiert sofort auf jede Aktion, erklärendes Feedback verknüpft Ergebnisse mit dem zugrunde liegenden Konzept, und Nachbesprechungen und Musterlösungen folgen auf den eigenen Versuch.

Wie funktioniert die Pipeline der Learning Interactives?

Die Erzeugung verläuft in vier Phasen, und die ersten beiden liefern nur Text. Eine Simulation wird vollständig in Worten geplant und ihre gestuften Ziele werden geprüft, bevor überhaupt Oberflächencode entsteht. So beginnt der fehleranfälligste Schritt, das Schreiben der Oberfläche, mit einer geprüften Spezifikation.

Im Beispiel des Berichts zu elektrischen Schaltkreisen führt eine Anfrage für die Oberstufe zu Lernzielen über RC-Zeitkonstanten, LC-Resonanz, p-n-Übergänge und Photonik sowie zu einem Entwurf, in dem Lernende jede Stufe eines Signalpfads auf einem Mikrochip so einstellen, dass er eine Zielfrequenz ohne Verzerrung überträgt.

  • Simulationsidee. Aus einer Anfrage mit Fach, Klassenstufe, Thema und zusätzlichen Vorgaben schreibt Gemini Lernziele und anschließend einen ausführlichen Entwurf mit den Objekten, ihren Beziehungen, den anzuzeigenden Diagrammen, den visuellen Merkmalen und allen Reglern und Schaltflächen.
  • Gestufte Ziele. Gemini formuliert fünf Ziele nacheinander, jedes auf Grundlage der vorherigen. Eine Prüfung stellt sicher, dass jedes Ziel konkret, klar, schwieriger als das letzte und kein zu großer Sprung ist; nicht bestandene Ziele werden neu erzeugt. Laut Bericht kostet diese Phase kaum Rechenzeit.
  • Erzeugung der Oberfläche. Gemini schreibt die Simulation in HTML und JavaScript. Prüfmodule bewerten dann sowohl den Code als auch die in Chrome dargestellte Seite, und das Modell überarbeitet sie in wiederholten Runden.
  • Anleitung. Zum Schluss erstellt das System eine Einführungstour, Hinweise und eine Lösung für jedes Level sowie Feedback für gelungene und fehlerhafte Versuche.

Erzeugen, prüfen, reparieren: die Verfeinerungsschleife

Die Autoren berichten, dass ein einziger Prompt selbst mit geprüfter Idee und geprüften Zielen nur in 3,5 % der Fälle ein Learning Interactive lieferte, das ihre pädagogischen Anforderungen erfüllte. Ihre Lösung ist eine Generate-then-Refine-Schleife: Prüfmodule testen jeden Entwurf, das Modell behebt die markierten Mängel, und der Zyklus beginnt von vorn.

Die Prüfmodule lassen sich in vier Gruppen einteilen: visuell, Lösung, Telemetrie und Mechanik. Der Beitrag gibt einen Eindruck von ihren Fragen. Decken die Level die Lernziele ab, und werden sie zunehmend schwieriger? Funktionieren die Schaltflächen, und lässt sich jedes Level tatsächlich lösen? Ist etwas auf dem Bildschirm überflüssig oder ablenkend? Manche Prüfungen arbeiten als Agenten: Ein Prüfer für Lösbarkeit öffnet Chrome und spielt die Simulation so, wie Lernende es tun würden, einschließlich gezielter Störversuche wie Regler am Anschlag.

Mit dieser Schleife stieg der Anteil der Simulationen, die alle Prüfungen bestanden, laut Bericht von 3,5 % nach der ersten Erzeugung auf 69,3 % nach 10 Runden. Innerhalb einzelner Prüfgruppen verlief der Fortschritt nicht gleichmäßig, weil die Korrektur eines Teils einen anderen stören kann. Der Beitrag benennt die Kosten offen: Die Schleife verlangsamt die Erzeugung und sorgt dafür, dass die Qualitätskriterien enger eingehalten werden.

Wie bewerteten Lehrkräfte die Learning Interactives?

In der Usability-Studie der Autoren bewerteten 12 Lehrkräfte aus den USA jede erhaltene Simulation bei der Bedienbarkeit mit 7 oder mehr, im Mittel mit über 8,1, so der Bericht. Der Beitrag fasst dieselbe Studie als durchschnittliche Qualitätsbewertung von 8 von 10 zusammen.

Die Gruppe bestand aus sechs Männern und sechs Frauen: vier unterrichteten Mathematik, je zwei Biologie, Physik und Umweltwissenschaften und je eine Person Astronomie und Chemie. Jede Lehrkraft reichte drei Anfragen ein, insgesamt 36, und gab die meisten erzeugten Lernziele unverändert frei. Für jede Anfrage erzeugte das Team fünf Kandidaten, aus denen interne Gutachter den besten auswählten; bei 3 der 36 Anfragen galt kein Kandidat als gut genug, um ihn zu versenden.

Die Lehrkräfte schätzten, eine Simulation auf die eigene Klasse zuschneiden zu können. Eine Lehrkraft für Naturwissenschaften an einer High School, im Beitrag zitiert, sagte sinngemäß: „Ich konnte noch nie eine der Simulationen differenzieren, weil man einfach bekommt, was man bekommt.“ Andere sagten, die gestuften Hinweise und Musterlösungen ähnelten der Einzelbetreuung, die sie selbst leisten. Zu den Verbesserungswünschen gehörten die Ausrichtung an Bildungsstandards und Feedback zu falschen Versuchen, das laut Bericht inzwischen ergänzt wurde.

Wie bewerteten Fachgutachter die Simulationen?

Für eine größere Prüfung, die die Autoren als unvoreingenommen bezeichnen, wählten pädagogische Fachleute 40 MINT-Anfragen aus, von der oberen Grundschule bis zum Grundstudium. Das Team unternahm pro Anfrage fünf Erzeugungsversuche, und jedes Interactive, das alle Prüfungen bestand, ging an zwei Gutachter, die das jeweilige Fach unterrichten. Die Autoren berichten eine Annahmequote von 86 %, wobei die meisten angenommenen Simulationen als gut oder ausgezeichnet bewertet wurden.

Die Gutachter entschieden zunächst über die Annahme und bewerteten die Simulation dann anhand von Bewertungsrastern zu den Lernzielen (Faktentreue, Lehrplanbezug, Erfüllung der SMART-Kriterien, Klarheit und Progression) und zur Nutzer- und Lernerfahrung (Stimmigkeit, kognitive Belastung, Metakognition, Bedienbarkeit und Barrierefreiheit sowie Ästhetik). Die Skala reichte von nicht bestanden (0) über bestanden (1) und gut (2) bis ausgezeichnet (3). Laut Beitrag waren die Gutachter MINT-Lehrkräfte im Vereinigten Königreich.

Die Ergebnisse unterschieden sich je nach Fach. Physik und Chemie kamen im Mittel am nächsten an ausgezeichnet heran. Biologie schnitt schlechter ab, vor allem bei Ästhetik und Nutzererfahrung, weil viele biologische Themen, etwa die Phasen des Zellzyklus, eher das Merken von Details als das Verändern von Gleichungen verlangen, sodass die Simulationen eher einer Lehrbuchabfolge glichen.

Grenzen und offene Fragen

Die bisherigen Belege betreffen Urteile von Lehrkräften, nicht Lernergebnisse. Die Autoren nennen die Arbeit einen ersten Schritt und sehen die größte Lücke in der Evaluation mit echten Lehrkräften an echten Schulen, einschließlich der Frage, ob Lernende tatsächlich mehr lernen.

Analyse: Der Bericht beschreibt die Pipeline nur in groben Zügen. Er veröffentlicht weder die Prompts noch die Umsetzung der Prüfmodule oder eine konkrete Gemini-Modellversion, daher lassen sich die Werte von 3,5 % und 69,3 % allein anhand der Quellen nicht unabhängig nachvollziehen.

  • Kleine Stichproben. An der Usability-Studie nahmen 12 Lehrkräfte in den USA teil, und die Fachbewertung umfasste 40 Anfragen mit je zwei Gutachtern.
  • Unvollkommene Erzeugung. Nach 10 Verfeinerungsrunden bestanden 69,3 % der Simulationen alle Prüfungen, ein beträchtlicher Teil also nicht, und die Schleife verlängert die Erzeugungszeit.
  • Ungleiche Fächer. Themen, die auf Auswendiglernen beruhen, wie weite Teile der Biologie, lassen sich weniger natürlich in Simulationen übertragen, die Lernende selbst verändern können.
  • Umfang. Die öffentliche Bibliothek umfasst über 30 Interactives auf Englisch für MINT-Fächer, vor allem für die Sekundarstufen I und II, und die Ausrichtung an Standards war in der Studie noch ein Wunsch der Lehrkräfte.

Was können Teams, die generierte Oberflächen bauen, daraus lernen?

Die übertragbare Lehre liegt in der Methode, nicht im Fach. Wenn ein Modell funktionierende Oberflächen erzeugen soll, legen die Ergebnisse des Berichts nahe, dass die Struktur um das Modell ebenso zählt wie das Modell selbst: zuerst in Text planen, Zwischenergebnisse an ausdrücklichen Kriterien prüfen, das dargestellte Ergebnis durch Benutzung testen und eine fachkundige Person als letzte Freigabeinstanz behalten.

Analyse: Diese Muster gelten für generierte Software in vielen Bereichen, von internen Werkzeugen über Schulungsmaterial bis zu Erklärangeboten für Kundinnen und Kunden. Die Studie zeigt auch, warum Erfolgsquoten aus einem einzigen Durchlauf täuschen: Der Sprung von 3,5 % auf 69,3 % stammt aus der Prüfschleife, nicht aus einem anderen Modell. Teams mit einem ähnlichen Ansatz sollten längere Erzeugungszeiten einplanen, messen, was bei Nutzern ankommt, statt was das Modell zuerst liefert, und Ergebnisse mit den Menschen bestätigen, denen das Werkzeug dienen soll.

Bibliothek, Pilotprogramm und Verfügbarkeit

Google Research hat eine öffentliche Bibliothek mit über 30 Learning Interactives auf Englisch veröffentlicht, mit Themen aus Physik, Chemie, Biologie, Mathematik, Geowissenschaften und Informatik, alle von KI erzeugt und von Lehrkräften geprüft. Als Beispiele nennt der Beitrag die keplerschen Gesetze der Planetenbewegung, Datenvisualisierung und den schiefen Wurf.

Schulen, die Google Workspace for Education nutzen, können sich für das Google for Education Pilot Program anmelden, über das Lehrkräfte maßgeschneiderte MINT-Interactives für ihren Lehrplan, ihre Lernziele und ihre Klassenstufe anfragen können. Neue Interactives gehen zur Prüfung an die anfragende Lehrkraft zurück und werden erst nach ihrer Freigabe in die Bibliothek aufgenommen. Das Team plant außerdem Nutzerforschung und Feldstudien zu Lernzuwachs und Engagement. Eine Veröffentlichung von Code erwähnen die Quellen nicht.

Fragen und Antworten

Was sind Learning Interactives?

Learning Interactives sind KI-generierte, browserbasierte MINT-Simulationen, die auf den Lernzielen einer Lehrkraft aufbauen. Jede gliedert ein Thema in Level mit steigendem Schwierigkeitsgrad und ergänzt Lerngerüste: eine Einführung, eine Werkzeugkiste mit Formeln und Theorie, gestufte Hinweise, Feedback zu Versuchen und Musterlösungen. Google Research erzeugt sie mit Gemini über eine mehrstufige Generative-UI-Pipeline, und Lehrkräfte geben die Lernziele frei und prüfen die fertigen Interactives, bevor sie in der öffentlichen Bibliothek erscheinen.

Worin unterscheidet sich Generative UI von einer Chatbot-Antwort?

Ein Chatbot liefert meist Text in einer festen Oberfläche. Bei Generative UI schreibt das Modell die Oberfläche selbst, als funktionierenden Code mit Bedienelementen, Visualisierungen und Verhalten, die zur Anfrage passen. Frühere Arbeiten von Google Research zeigten, dass gut instruierte Modelle das für sehr unterschiedliche Prompts leisten. Der Bericht zu Learning Interactives ergänzt pädagogische Struktur und automatische Prüfungen, weil generische Ergebnisse bei Lerneinheiten mit mehreren Phasen oft nicht ausreichen.

Wie zuverlässig sind KI-generierte Lernsimulationen?

Die Autoren haben die Qualität gemessen, statt sie zu behaupten. Automatische Prüfmodule suchen nach visuellen, lösungsbezogenen, Telemetrie- und Mechanikfehlern, und laut Bericht bestanden 69,3 % der Simulationen nach 10 Verfeinerungsrunden alle Prüfungen, nach einer Runde waren es erst 3,5 %. Fachgutachter aus der Lehrerschaft bewerteten danach unter anderem die Faktentreue und nahmen 86 % der geprüften Interactives an. Lehrkräfte prüfen jedes Interactive, bevor es in die öffentliche Bibliothek gelangt.

Verbessern Learning Interactives das Lernen?

Das ist bisher nicht belegt. Die veröffentlichten Auswertungen messen Urteile von Lehrkräften: Bewertungen der Bedienbarkeit durch 12 Lehrkräfte aus den USA und Rubrik-Bewertungen von Fachgutachtern. Die Autoren halten fest, dass die Evaluation an echten Schulen, einschließlich des Lernerfolgs der Schülerinnen und Schüler, der wichtigste offene Punkt ist, und planen Feldstudien sowie ein Pilotprojekt über das Google for Education Pilot Program, um Lernzuwachs und Engagement zu messen.

Können Lehrkräfte Learning Interactives schon heute nutzen?

Lehrkräfte können die öffentliche Bibliothek mit über 30 von Lehrkräften geprüften Interactives auf Englisch nutzen, überwiegend für MINT-Themen der Sekundarstufe. Eigene Anfragen laufen derzeit über das Google for Education Pilot Program, dem Schulen mit Google Workspace for Education beitreten können. Lehrkräfte im Pilotprogramm fordern Interactives für ihren eigenen Lehrplan an und prüfen jedes, bevor es in die Bibliothek aufgenommen wird.

Quellen

  1. Kovshov, A., Choudhury, A., Iurchenko, A., Keeling, A., Hassidim, A., Shasha Evron, A., Çakmakli, A., Akrong, D., Olanubi, F., Elidan, G., Li, I., Lerer, I., Chou, K., Hackmon, L., Gordon, M., Kerem, N., Efron, N., Singh, P., Levitt, R., . . . Lev, Y. (2026). Harnessing generative UI for education: Tailored learning interactives. arXiv:2609.20738. https://arxiv.org/abs/2609.20738 (externe Website)
  2. Leviathan, Y., Valevski, D., Kalman, M., Lumen, D., Segalis, E., Molad, E., Pasternak, S., Natchu, V., Nygaard, V., Venkatachary, S., Manyika, J., & Matias, Y. (2026). Generative UI: LLMs are effective UI generators. arXiv:2604.09577. https://arxiv.org/abs/2604.09577 (externe Website)
  3. Chi, M. T. H., & Wylie, R. (2014). The ICAP framework: Linking cognitive engagement to active learning outcomes. Educational Psychologist, 49(4), 219-243. https://doi.org/10.1080/00461520.2014.965823 (externe Website)
  4. Kirschner, P. A., Sweller, J., & Clark, R. E. (2006). Why minimal guidance during instruction does not work: An analysis of the failure of constructivist, discovery, problem-based, experiential, and inquiry-based teaching. Educational Psychologist, 41(2), 75-86. https://doi.org/10.1207/s15326985ep4102_1 (externe Website)
  5. Koedinger, K. R., Kim, J., Jia, J. Z., McLaughlin, E. A., & Bier, N. L. (2015). Learning is not a spectator sport: Doing is better than watching for learning from a MOOC. In Proceedings of the Second (2015) ACM Conference on Learning @ Scale (pp. 111-120). ACM. https://doi.org/10.1145/2724660.2724681 (externe Website)
  6. Jose, B., Cherian, J., Verghis, A. M., Varghise, S. M., S, M., & Joseph, S. (2025). The cognitive paradox of AI in education: Between enhancement and erosion. Frontiers in Psychology, 16, 1550621. https://doi.org/10.3389/fpsyg.2025.1550621 (externe Website)

Originalbeitrag

Elidan, G., & Haramaty, Y. (2026, 17 September). The future of practice: Enabling teachers to create learning interactives with generative UI. Google Research Blog. https://research.google/blog/the-future-of-practice-enabling-teachers-to-create-learning-interactives-with-generative-ui/ (externe Website)

Dies ist eine unabhängige Zusammenfassung veröffentlichter Forschung durch Bibha. Bibha ist weder mit den Autorinnen und Autoren noch mit Google verbunden.

Alle Beiträge aus News und Forschung