Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenKI-WissenKapitel 09von 14 im Pfad

Weltmodelle

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Ein Sprachmodell sagt das nächste Token voraus. Ein Weltmodell sagt die nächste Lage voraus: wie eine Umgebung aussieht, nachdem etwas darin passiert ist.

Das klingt nach einem kleinen Unterschied und ist ein großer. Wer vorhersagen kann, was auf eine Handlung folgt, kann Handlungen durchspielen, bevor er sie ausführt.

Ein Modell, das die nächste Lage vorhersagt

Die knappste Bestimmung stammt von einem Hersteller und nennt beide Hälften:

world models, which are AI systems that can use their understanding of the world to simulate aspects of it, enabling agents to predict both how an environment will evolve and how their actions will affect it. (externe Seite, deepmind.google)

Zwei Vorhersagen also. Die eine betrifft den Lauf der Dinge ohne Zutun: Ein geworfener Ball fällt. Die andere betrifft die eigene Wirkung: Wenn ich jetzt die Hand ausstrecke, fange ich ihn.

Der Begriff in dieser Bedeutung stammt aus einer Arbeit von 2018:

Our world model can be trained quickly in an unsupervised manner to learn a compressed spatial and temporal representation of the environment. (externe Seite, arxiv.org)

Verdichtet werden Raum und Zeit. Das Modell merkt sich also, wie die Umgebung aussieht und wie sie sich bewegt, in einer Form, die klein genug zum Rechnen ist.

Warum Vorhersagen billiger ist als Ausprobieren

Ein Agent, der in der echten Welt lernt, zahlt für jeden Versuch. Ein Roboterarm, der greifen lernt, braucht Millionen Versuche, und jeder kostet Zeit, Verschleiß und gelegentlich ein zerbrochenes Glas.

Ein Agent, der in seinem eigenen Modell lernt, zahlt nur Rechenzeit. Er kann tausend Varianten in einer Sekunde durchspielen, und ein Fehler darin bleibt folgenlos.

Genau das war der Nachweis von 2018, und die Autoren haben ihn zugespitzt formuliert:

We can even train our agent entirely inside of its own hallucinated dream generated by its world model, and transfer this policy back into the actual environment. (externe Seite, arxiv.org)

Das Wort für die Erfindung des Modells ist dasselbe, das bei Sprachmodellen den Fehler bezeichnet. Hier ist sie der Zweck.

Der Traum als Übungsplatz

Wie weit das reicht, hat eine begutachtete Arbeit von 2025 gezeigt. Sie ist im Bestand dieser Seite die Ausnahme: begutachtet, frei zugänglich, mit einem Nachweis, den man nachrechnen kann.

Here we present the third generation of Dreamer, a general algorithm that outperforms specialized methods across over 150 diverse tasks, with a single configuration. (externe Seite, nature.com)

Die Bauform in einem Satz:

Dreamer learns a model of the environment and improves its behaviour by imagining future scenarios. (externe Seite, nature.com)

Der Nachweis, den die Arbeit selbst herausstellt, ist ein Videospiel. In Minecraft einen Diamanten zu finden, verlangt eine lange Kette von Schritten, und Belohnung gibt es erst ganz am Ende:

the first algorithm to accomplish all 12 milestones leading up to the diamond, from sparse rewards without human data or curricula. (externe Seite, nature.com)

Zwölf Zwischenschritte ohne Anleitung und ohne menschliche Vorlagen. Das ist die Aufgabenform, an der Verfahren aus Kapitel 02 sonst scheitern.

Wo die Videomodelle hineinspielen

Ein zweiter Weg zu Weltmodellen kommt von der Bildseite. Wer ein Modell darauf trainiert, Video fortzusetzen, bringt ihm bei, wie Dinge sich bewegen, und das ist eine Form von Weltwissen.

OpenAI hat den eigenen Videogenerator ausdrücklich so eingeordnet:

Our results suggest that scaling video generation models is a promising path towards building general purpose simulators of the physical world. (externe Seite, openai.com)

Der Unterschied zum Bildmodell aus Grundkurs, Kapitel 14 liegt in der Zeitachse. Ein Bild hat keine Folge, ein Video schon, und aus der Folge ergibt sich die Frage, was als Nächstes passiert.

Ein drittes Verfahren geht noch einen Schritt weiter und lässt sich begehen:

Given a text prompt, Genie 3 can generate dynamic worlds that you can navigate in real time at 24 frames per second, retaining consistency for a few minutes at a resolution of 720p. (externe Seite, deepmind.google)

Die Angaben stammen vom Hersteller, eine unabhängige Messung dazu liegt nicht vor.

Was ein Sprachmodell davon hat und was nicht

Die Frage, ob in einem Sprachmodell ein Weltmodell steckt, ist offen und wird in der Forschung ernsthaft gestritten. Sicher ist zweierlei.

Ein Sprachmodell hat Text über die Welt gesehen und daraus vieles gelernt, was sich wie Weltwissen verhält. Es weiß, dass ein losgelassenes Glas fällt, weil das in Millionen Sätzen steht.

Und es hat keine Umgebung, in der es Handlungen durchspielen könnte. Was es an Vorhersage leistet, leistet es in Sprache. Was das für Agenten bedeutet, steht in Agenten und Harness, Kapitel 01.

Woran Sie ein Weltmodell festmachen

Fragen Sie nach der Handlung. Ein Weltmodell sagt vorher, was eine Handlung bewirkt. Ein Videogenerator ohne Eingriffsmöglichkeit sagt nur, wie es weitergeht.

Fragen Sie nach der Dauer. Über wie viele Sekunden bleibt die Umgebung sich treu? Das ist die Kennzahl, an der sich diese Systeme heute unterscheiden.

Achten Sie darauf, wo geübt wird. Im Modell zu lernen ist billig und richtig nur so weit, wie das Modell stimmt.

Und trennen Sie Vorhersage von Physik. Ein Modell, das gelernt hat, wie Dinge aussehen, hat keine Bewegungsgleichungen gelernt.

Quellen

6 Einträge, davon 2 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    World Models (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Ha und Schmidhuber geben dem Begriff am 27.03.2018 seine heutige Bedeutung: ein Modell der Umgebung, das ein Agent in sich führt und in dem er üben kann, ohne die Umgebung selbst anzufassen. Der Kurztext nennt beide Hälften, die verdichtete Darstellung von Raum und Zeit und den Umstand, dass die im Modell gelernte Handlungsvorschrift danach in der echten Umgebung arbeitet.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Mastering diverse control tasks through world models (externe Seite, nature.com)

    nature.comgeprüft 24.09.2026

    Hafner, Pasukonis, Ba und Lillicrap zeigen am 02.04.2025 in Nature, dass ein einziges Verfahren mit unveränderten Einstellungen über 150 Aufgaben aus acht Gebieten löst. Die Arbeit ist begutachtet und frei zugänglich, was sie von den meisten Belegen dieses Gebiets unterscheidet. Der Nachweis, den sie selbst herausstellt, ist der Diamant in Minecraft ohne menschliche Vorlagen.

  • Ankündigung des Herstellerserreichbar

    Genie 3: A new frontier for world models (externe Seite, deepmind.google)

    deepmind.googlegeprüft 24.09.2026

    Die Ankündigung vom 05.08.2025 enthält die knappste Definition des Begriffs, die ein Hersteller gibt, und daneben eine Liste eigener Grenzen: Handlungsraum, mehrere Agenten, echte Orte, Schrift im Bild, Dauer. Die Angaben zu Bildrate, Auflösung und Dauer stammen vom Hersteller, eine unabhängige Messung dazu liegt nicht vor. Genie 3 war zum Zeitpunkt der Ankündigung eine Vorschau für einen kleinen Kreis.

  • Ankündigung des Herstellerserreichbar

    Video generation models as world simulators (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    Der technische Bericht vom 15.02.2024, in dem OpenAI ein Videomodell ausdrücklich als Weg zu einem Simulator der physischen Welt beschreibt. Er nennt die Bauform (Diffusion über Raum-Zeit-Stücke statt über Text-Token) und zählt die Fähigkeiten auf, die dabei ohne eigenen Bauteil entstanden sind. Der Bericht sagt selbst, dass Modell- und Umsetzungsdetails fehlen, und er nennt die Grenzen beim Namen.

  • Originalarbeiterreichbar

    V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Assran und Mitautoren zeigen am 11.06.2025 den dritten Weg zu einem Weltmodell: aus einer Million Stunden Netzvideo, ergänzt um weniger als 62 Stunden Robotermaterial. Spielumgebungen und erzeugtes Video kommen dabei nicht vor. Das Ergebnis steuert Greifarme in zwei fremden Laboren ohne Training vor Ort. Die Zahlen stammen von den Autoren, eine unabhängige Wiederholung liegt nicht vor.

  • Originalarbeiterreichbar

    Mental World Modeling (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Preprint von Hao Fei und Yiran Zhao mit Definition von MWM und den acht getesteten Modellen.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.