GrundlagenKI-WissenKapitel 13von 14 im Pfad
Video, Musik und 3D
Grundkurs, Kapitel 14 endet beim Einzelbild. Kapitel 09 nimmt das Video dort auf, wo es zum Übungsplatz für einen Agenten wird. Dazwischen liegt der Fall, um den es hier geht: Video, Ton und Raum als Ergebnis, das jemand ansehen oder anhören will.
Vorweg eine Auskunft über dieses Kapitel: Es empfiehlt kein Werkzeug. Die genannten Angaben stammen von den Herstellern, unabhängige Messungen dazu liegen nicht vor, und eine Empfehlung ohne eigene Erfahrung wäre auf dieser Seite fehl am Platz.
Die Zeitachse ist das Neue
Ein Bild hat keine Reihenfolge. Ein Video hat eine, und daraus folgt die Anforderung, die es beim Einzelbild nicht gibt: Was im ersten Bild zu sehen ist, muss im dreißigsten noch dasselbe sein.
Wie ein Videomodell gebaut ist, sagt OpenAI in einem Satz, der die Verwandtschaft zum Sprachmodell zeigt:
Whereas LLMs have text tokens, Sora has visual patches. (externe Seite, openai.com)
Zerlegt wird also in Stücke, so wie Text in Grundkurs, Kapitel 03 zerlegt wird. Der Unterschied liegt darin, dass ein solches Stück eine Fläche über eine Zeitspanne bezeichnet. Die Zahl dieser Stücke wächst mit der Dauer.
Wie lang ein Clip ist, und warum das die wichtigste Angabe ist
Beim Bildmodell war die Auflösung der Maßstab. Hier ist es die Dauer.
Ein offenes Modell von Ende 2023 erzeugte 14 and 25 frames at customizable frame rates between 3 and 30 frames per second (externe Seite, stability.ai), also wenige Sekunden. Derselbe Anbieter schrieb dazu, die Fassung sei not intended for real-world or commercial applications at this stage (externe Seite, stability.ai).
Drei Jahre später liegen die Angaben bei bis zu dreißig Sekunden aus einem Auftrag (Beleg (externe Seite, alibabacloud.com)). Wer den Fortschritt dieses Gebiets messen will, vergleicht diese beiden Zahlen.
Der Ton kommt jetzt mit
Bis vor kurzem waren Bild und Ton getrennte Läufe. Inzwischen entsteht beides im selben Vorgang:
Damit fällt an dieser Stelle die Grenze zu Kapitel 08 weg. Eine Stimme im Video kommt aus demselben Modell wie das Bild dazu, und die Kennzeichnungsfrage aus Conversational AI, Kapitel 09 trifft sie genauso.
Musik entsteht anders
Bild, Video und Raum entstehen über Diffusion, also über das schrittweise Entrauschen, das Grundkurs, Kapitel 14 erklärt. Musik fällt aus dieser Reihe.
Ein Sprachmodell also, nur dass seine Token verdichtete Musik bezeichnen statt Wortteile. Der zweite Punkt jener Arbeit ist die Vereinfachung: Das Verfahren eliminates the need for cascading several models (externe Seite, arxiv.org), also für mehrere hintereinandergeschaltete Modelle.
3D hat kein Netz voller 3D-Daten
Bei Bildern gab es Milliarden Beispiele mit Beschriftung. Für den Raum fehlt dieses Material, und die Arbeit, die das Gebiet eröffnet hat, sagt es im ersten Absatz:
Beides fehlte. Der Ausweg war ein Umweg über das, was es gab:
Ein Bildmodell beurteilt also Ansichten eines räumlichen Modells, bis sie von allen Seiten überzeugen. Das ist der eine Weg. Der andere geht von Fotos aus und rechnet daraus eine Szene, und beide führen zu Ergebnissen, die gleich aussehen.
Woran Sie ein bewegtes Ergebnis festmachen
Fragen Sie nach der Dauer, bevor Sie nach der Auflösung fragen. Die Sekundenzahl entscheidet, wofür ein Modell reicht.
Rechnen Sie mit Anläufen. Ein Fehlversuch beim Bild kostet Sekunden, beim Video Minuten und Geld.
Prüfen Sie, ob der Ton dazugehört. Eine erzeugte Stimme im Video fällt unter dieselben Kennzeichnungspflichten wie eine einzeln erzeugte.
Klären Sie die Rechte vor dem ersten Einsatz. Wem ein Ergebnis gehört und ob es überhaupt geschützt ist, sind zwei getrennte Fragen.
Der Überblick nennt die Zeitachse als das Unterscheidende. Diese Ebene sagt, was daran hängt: an Aufwand, an Material und an den Verfahren für den Raum.
Raum-Zeit-Stücke statt Bildpunkte
Ein Videomodell zerlegt seinen Gegenstand in Stücke, die eine Fläche über eine Zeitspanne bezeichnen. Das Entrauschen selbst läuft dabei wie beim Einzelbild, und wie es funktioniert, steht in Grundkurs, Kapitel 14.
Die Folge dieser Bauform ist eine Rechnung. Die Zahl der Stücke wächst mit der Fläche und mit der Dauer, also mit zwei Größen gleichzeitig. Ein doppelt so langer Clip in doppelter Auflösung kostet das Vierfache an Stücken, und der Rechenaufwand steigt darüber hinaus, weil jedes Stück mit den anderen verrechnet wird.
Daran hängt eine Eigenschaft, die im Umgang zählt: Die Länge legt der Bau des Modells fest. Beim Aufruf lässt sie sich nicht einstellen. Ein Modell für acht Sekunden erzeugt keine dreißig, auch wenn man dreißig verlangt. Was Anbieter stattdessen anbieten, ist das Verlängern eines vorhandenen Clips, und dabei setzt ein zweiter Lauf am letzten Bild des ersten an. Die Beständigkeit über die Naht hinweg ist genau die Schwäche aus dem nächsten Abschnitt.
Was zeitliche Beständigkeit kostet
Die Anforderung, dass ein Gegenstand über hundert Bilder derselbe bleibt, ist das eigentliche Problem dieses Gebiets. Sichtbar wird sie an vier Stellen: Gesichter wandern, Gegenstände verschwinden und tauchen wieder auf, Hände verändern ihre Zahl, und Schrift zerfällt.
Der letzte Punkt ist der am besten dokumentierte, und ein Hersteller sagt ihn über die eigene Arbeit:
Grundkurs, Kapitel 14 nennt Schrift im Bild bereits als Schwäche. Bei bewegten Bildern kommt hinzu, dass sie in jedem Einzelbild dieselbe sein muss.
Rechenzeit wächst mit der Zeitachse
Ein Bild ist in Sekunden da, ein Clip braucht Minuten. Für die Arbeitsweise folgt daraus eine Verschiebung: Beim Bild bessert man nach, beim Video formuliert man vorher genauer, weil jeder Anlauf teurer ist.
Am anderen Ende steht die Frage, ab wann eine Reaktion noch als Reaktion durchgeht:
Dieselbe Schwelle steht in Conversational AI, Kapitel 03 für gesprochene Sprache. Sie beschreibt die Wahrnehmung des Zuschauers, und die Modelle müssen sich danach richten.
Woher das Material kommt
Grundkurs, Kapitel 14 lässt die Frage offen, woher die Trainingsbilder stammen. Bei Video gibt es dazu inzwischen eine offene Zahl:
we download 80M videos with a total duration of 10 million hours (externe Seite, arxiv.org)
Zehn Millionen Stunden sind gut elfhundert Jahre Material. Der Datensatz ist für die Forschung freigegeben, und schon diese Einschränkung sagt etwas: Was für ein Produkt benutzt werden darf, ist damit nicht beantwortet.
Musik als Tokenfolge
Der Weg über Token hat eine Folge, die man kennt, wenn man Grundkurs, Kapitel 02 gelesen hat: Das Modell setzt fort, Stück für Stück, und jede Fortsetzung hängt an einer Ziehung. Zwei Läufe mit demselben Auftrag ergeben deshalb zwei verschiedene Stücke, aus demselben Grund wie in Grundkurs, Kapitel 12.
Der Unterschied zum Sprachmodell liegt im Gegenstand der Token. Sie bezeichnen verdichtete Musik, also mehrere gleichzeitige Spuren, und das Verfahren muss diese Spuren gemeinsam fortsetzen. Ein Instrument allein zu ändern, ohne die übrigen anzufassen, ist in dieser Bauform nicht vorgesehen.
Der zweite Punkt der Arbeit ist die Vereinfachung des Aufbaus. Frühere Systeme setzten mehrere Modelle hintereinander, eines für die grobe Struktur und weitere für die Verfeinerung, und jede Stufe brachte eigene Fehler mit. Das neue Verfahren eliminates the need for cascading several models (externe Seite, arxiv.org).
Was daraus für den Umgang folgt, ist dieselbe Einsicht wie bei Text: Ein zweiter Lauf ergibt ein anderes Stück, und wer ein Ergebnis behalten will, speichert es. Eine Wiederholung derselben Eingabe ist keine Sicherung.
Drei Verfahren für den Raum
Zwei rekonstruieren, eines erfindet.
NeRF, seit 2020. Aus wenigen Fotos wird eine Szene, aus der sich neue Blickwinkel berechnen lassen: We present a method that achieves state-of-the-art results for synthesizing novel views of complex scenes by optimizing an underlying continuous volumetric scene function using a sparse set of input views. (externe Seite, arxiv.org) Abgelegt wird dabei eine Funktion in den Gewichten eines kleinen Netzes. Ein Gitternetz entsteht dabei an keiner Stelle.
Gaussian Splatting, seit 2023. Dasselbe Ziel, in Echtzeit. Die Arbeit nennt beide Zahlen, die den Sprung beschreiben. Vorher galt: For unbounded and complete scenes (rather than isolated objects) and 1080p resolution rendering, no current method can achieve real-time display rates. (externe Seite, repo-sam.inria.fr) Danach: allow high-quality real-time (≥ 100 fps) novel-view synthesis at 1080p resolution. (externe Seite, repo-sam.inria.fr)
DreamFusion, seit 2022. Der erfindende Weg über ein Bildmodell, weil beschriftete 3D-Daten fehlen. Das Ergebnis ist eine Szene, die es nie gab.
Für die Praxis zählt an dieser Aufzählung vor allem, was am Ende herauskommt. Alle drei liefern etwas, das sich ansehen lässt, und keines davon liefert ein Modell mit Kanten und Flächen, wie es ein Konstruktionsprogramm erwartet. Wer ein erzeugtes Ergebnis in eine Fertigung geben will, hat einen weiteren Arbeitsschritt vor sich, und der ist nicht Teil dieser Verfahren.
Was daraus für die Praxis folgt
Die Dauer ist der Kostentreiber, und sie wirkt zusammen mit der Auflösung.
Beständigkeit über die Zeit ist die Schwäche, an der sich Modelle unterscheiden. Schrift im bewegten Bild ist der härteste Fall.
Musik folgt anderen Regeln als Bild. Wer die Diffusionslogik überträgt, liegt daneben.
Bei 3D entscheidet die Frage nach der Herkunft. Rekonstruiert aus Fotos oder erfunden aus einem Satz sind zwei verschiedene Dinge, auch wenn die Datei dieselbe ist.
Ein Clip ist keine Szene
Die Grenze dieser Modelle liegt selten bei der Sekundenzahl. Sie liegt beim Schnitt.
Ein Film besteht aus Einstellungen, die aufeinander bezogen sind: dieselbe Person in zwei Kameraeinstellungen, dieselbe Beleuchtung nach einem Ortswechsel, ein Gegenstand, der in Bild drei liegt, wo ihn Bild eins hingelegt hat. Nichts davon steht im Modell. Es steht im Kopf desjenigen, der die Clips zusammensetzt.
Praktisch heißt das: Ein Modell liefert Bausteine. Alles, was einen Film zusammenhält, passiert danach und außerhalb. Wer eine Produktionszeit schätzt, schätzt deshalb an der falschen Stelle, wenn er die Erzeugungsdauer je Clip hochrechnet.
Dasselbe gilt für die Naht zwischen zwei Läufen. Verlängern setzt am letzten Bild an, und die Fehler summieren sich über die Kette.
Wem gehört, was herauskommt
Zwei Fragen, die ständig zusammenfallen und getrennt zu beantworten sind.
Die erste ist der Vertrag. Ein Anbieter für Musikerzeugung schreibt es deutlicher als die meisten: If you make music with the Basic (free) plan, Suno is the owner of the songs. (externe Seite, help.suno.com) Im bezahlten Tarif dreht sich das um: If you make songs while subscribed to the Pro or Premier plan, you own the songs. (externe Seite, help.suno.com)
Die zweite ist das Urheberrecht, und die Antwort darauf hängt an keinem Tarif:
Die Begründung steht einen Absatz weiter und trifft jedes Medium, um das es in diesem Kapitel geht:
Und für alle, die ihre Arbeit im Auftrag sehen: Writing the prompt does not constitute the creation of the song. (externe Seite, help.suno.com)
Beides zusammen ergibt eine Lage, die viele überrascht. Ein Stück kann Ihnen gehören und trotzdem für jeden frei benutzbar sein, weil es keinen Schutz genießt. Die Auskunft stammt von einem Anbieter und ist auf die Vereinigten Staaten bezogen; die Seite verweist für den eigenen Fall ausdrücklich auf die zuständige Stelle.
Am Eingang steht dieselbe Frage noch einmal. Der offene Videodatensatz aus der Ebene davor ist für die Forschung freigegeben, und was in einem Produkt verwendet werden darf, ist damit offen.
Rekonstruktion und Erfindung sehen gleich aus
Eine aus Fotos gerechnete Szene und eine aus einem Satz erfundene liegen im selben Format vor. Die Datei sagt nicht, welche von beiden sie ist.
Das ist mehr als eine Feinheit. Bei der Rekonstruktion gilt, was in Kapitel 05 über Messen steht: Das Ergebnis behauptet, so ausgesehen zu haben. Bei der Erfindung behauptet es gar nichts, und beide Behauptungen stehen in derselben Datei ohne Unterschied.
Wer räumliche Ergebnisse weitergibt, vermerkt deshalb die Herkunft daneben. Aus dem Format geht sie nicht hervor, und ein späterer Betrachter kann sie nicht rekonstruieren.
Die Angaben in diesem Kapitel sind Herstellerangaben
Jede Zahl hier stammt von dem Haus, das das Modell verkauft. Cliplängen, Auflösungen, Bildraten und die Aussage über die Tonspur sind Ankündigungen ohne unabhängige Nachmessung.
Zwei Angaben fallen aus diesem Muster, und sie sind es wert, benannt zu werden. Die Zahlen zum räumlichen Rendern stammen aus einer begutachteten Arbeit. Und die deutlichste Aussage über eine Schwäche kommt vom Hersteller selbst (Stable, legible text remains one of the hardest problems in video generation (externe Seite, runway.com)), was sie glaubwürdiger macht als eine Werbeaussage.
Deshalb steht in diesem Kapitel keine Empfehlung. Was hier fehlt, ist eine eigene Messung, und ohne die wäre jede Aussage über das bessere Werkzeug eine Weitergabe fremder Werbung.
Was daraus nicht folgt
Aus einer längeren Cliplänge folgt kein besseres Ergebnis. Die Dauer sagt, wie viel am Stück entsteht. Über Beständigkeit, Bildqualität und Brauchbarkeit sagt sie nichts.
Aus der Ähnlichkeit zum Sprachmodell folgt kein Verständnis von Physik. Was ein Videomodell über Bewegung gelernt hat, reicht für Ansehnlichkeit. Wo die Grenze zur Vorhersage liegt, steht in Kapitel 09.
Aus dem Eigentum folgt kein Schutz. Ein Stück kann Ihnen gehören und trotzdem gemeinfrei sein.
Aus einem räumlichen Ergebnis folgt kein Bauteil. Was diese Verfahren liefern, lässt sich ansehen. Eine Konstruktion mit Kanten und Maßen ist ein eigener Arbeitsschritt danach.
Aus dem Fehlen einer Empfehlung folgt keine Ablehnung. Diese Werkzeuge arbeiten, und dieses Kapitel hat sie nur nicht gemessen.
Quellen
11 Einträge, davon 1 Schlüsselarbeitalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Ben Mildenhall und Mitautoren zeigen 2020, wie sich aus einer Handvoll Fotos eine Szene so ablegen lässt, dass sich daraus neue Blickwinkel berechnen lassen. Gespeichert wird dabei eine Funktion in den Gewichten eines kleinen Netzes; ein Gitternetz oder eine Oberfläche entsteht an keiner Stelle. Diese Arbeit ist der Ausgangspunkt der Rekonstruktionsseite der 3D-Erzeugung, und sie erklärt, warum ein solches Ergebnis kein CAD-Modell ist.
Ankündigung des Herstellerserreichbar
Video generation models as world simulators (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
Der technische Bericht vom 15.02.2024, in dem OpenAI ein Videomodell ausdrücklich als Weg zu einem Simulator der physischen Welt beschreibt. Er nennt die Bauform (Diffusion über Raum-Zeit-Stücke statt über Text-Token) und zählt die Fähigkeiten auf, die dabei ohne eigenen Bauteil entstanden sind. Der Bericht sagt selbst, dass Modell- und Umsetzungsdetails fehlen, und er nennt die Grenzen beim Namen.
Ankündigung des Herstellerserreichbar
Introducing Stable Video Diffusion (externe Seite, stability.ai)
stability.aigeprüft 24.09.2026
Die Ankündigung eines offenen Videomodells vom November 2023, und sie ist vor allem als Maßstab nützlich: 14 bis 25 Bilder je Clip, also wenige Sekunden. Wer den Fortschritt dieses Gebiets messen will, hat hier den Ausgangswert. Der Anbieter schreibt außerdem selbst, dass die Fassung für den produktiven Einsatz nicht gedacht ist. Die frühere Adresse unter news leitet mit 301 hierher; im Register steht das Ziel.
Dokumentationerreichbar
Veo (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Die Modellseite von Google DeepMind zu Veo. Die Angabe, die für ein Kapitel über Medienerzeugung zählt, ist die Tonspur: Geräusche, Umgebungsklang und Dialog entstehen im selben Lauf wie das Bild. Damit fällt die Trennung zwischen Bilderzeugung und Sprachsynthese an dieser Stelle weg. Herstellerangaben ohne Versionsvermerk, die Seite wird überschrieben.
Originalarbeiterreichbar
Simple and Controllable Music Generation (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Jade Copet und Mitautoren stellen im Juni 2023 MusicGen vor, das Verfahren hinter der Musikerzeugung aus einem Textauftrag. Es fällt aus der Reihe der übrigen Medienmodelle: Wo Bild und Video über Diffusion entstehen, arbeitet dieses Modell wie ein Sprachmodell über Token, nur dass die Token verdichtete Musik bezeichnen statt Wortteile. Der zweite Punkt der Arbeit ist die Vereinfachung, denn frühere Systeme brauchten mehrere hintereinandergeschaltete Modelle.
Originalarbeiterreichbar
DreamFusion: Text-to-3D using 2D Diffusion (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Ben Poole und Mitautoren beschreiben 2022 den Umweg, über den ein Textauftrag zu einem räumlichen Ergebnis wird. Der Grund für den Umweg steht im ersten Satz der Arbeit und ist die wichtigste Auskunft über dieses Gebiet: Große beschriftete 3D-Datensätze gibt es nicht, also wird ein vorhandenes Bildmodell als Ersatz benutzt. Damit trennt diese Arbeit die erfindende Seite der 3D-Erzeugung von der rekonstruierenden.
Ankündigung des Herstellerserreichbar
Wan3.0: 30-Second AI Video Generation from Any Input (externe Seite, alibabacloud.com)
alibabacloud.comgeprüft 24.09.2026
Alibabas eigene Ankündigung von Wan3.0 mit technischen Angaben zu Länge, Auflösung, Eingabeformaten und Preisen.
Ankündigung des Herstellerserreichbar
Introducing Solaris (externe Seite, runway.com)
runway.comgeprüft 24.09.2026
Runways eigener Forschungsbeitrag beschreibt Funktionsweise, Anwendungsbeispiele und aktuelle Grenzen von Solaris.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Das Paper nennt Umfang, Erhebungsmethode und Benchmark-Ergebnisse des Datensatzes, Grundlage aller Zahlen im Text.
Originalarbeiterreichbar
3D Gaussian Splatting for Real-Time Radiance Field Rendering (externe Seite, repo-sam.inria.fr)
repo-sam.inria.frgeprüft 24.09.2026
Bernhard Kerbl und Mitautoren am Inria lösen 2023 das Tempoproblem der Szenenrekonstruktion. Ihre Arbeit nennt beide Zahlen, die den Sprung beschreiben: Vorher erreichte kein Verfahren bei voller Auflösung Echtzeit, danach sind es hundert Bilder in der Sekunde. Erschienen in den ACM Transactions on Graphics, also begutachtet.
Dokumentationerreichbar
Do I have the copyrights to songs I made? (externe Seite, help.suno.com)
help.suno.comgeprüft 24.09.2026
Die Hilfeseite eines Anbieters für Musikerzeugung, und sie trennt zwei Fragen, die im Gespräch ständig zusammenfallen. Die erste ist der Vertrag: Im kostenlosen Tarif gehören die Stücke dem Anbieter, im bezahlten dem Nutzer. Die zweite ist das Urheberrecht, und dort steht die unbequemere Auskunft: Was vollständig maschinell entstanden ist, kann in den Vereinigten Staaten schutzlos bleiben, weil kein Mensch es geschrieben hat. Es ist eine Anbieterauskunft, deutlicher formuliert als die meisten, und ein Rechtsgutachten ersetzt sie nicht.