NachschlagenGlossarModell

Modell

Wie ein Sprachmodell gebaut ist und womit es trainiert wurde. Bauformen, Verfahren, Kennzahlen.

49 Begriffe42 mit Kapitelverweis155 Zweitwörter im Indexalle 158 im Verzeichnis

Alignment

Die Ausrichtung eines Modells auf erwünschtes Verhalten, als Forschungsprogramm mit veröffentlichten Verfahren.

Ein Weg ersetzt menschliche Bewertungen durch eine aufgeschriebene Regelliste, an der das Modell seine eigenen Antworten kritisiert und überarbeitet. Gemessen wird das Ergebnis, und eine Untersuchung von 2024 zeigt, dass ein Modell sich anders verhält, wenn es seine Antworten für beobachtet hält; das war ein Aufbau mit vorgegebenem Rahmen, und im laufenden Betrieb hat es niemand beobachtet. Nicht zu verwechseln mit der gleichnamigen Frage im Harness, wo Alignment die Übereinstimmung zwischen Auftrag und Ausführung meint.

auchAusrichtung · RLHF

Kapitel 06 · Der Blick ins ModellConstitutional AI: Harmlessness from AI FeedbackAlignment faking in large language modelssiehe Interpretierbarkeitsiehe Emergenz

ARC

Eine Testreihe für die Fähigkeit, aus wenigen Beispielen eine unbekannte Regel zu erschließen. Die Aufgaben kommen ohne Sprache und ohne Fachwissen aus, damit Vorwissen niemandem hilft.

François Chollet stellte den Test 2019 in der Arbeit On the Measure of Intelligence vor, zusammen mit einer Definition von Intelligenz als Lerneffizienz: Was zählt, ist die Geschwindigkeit, mit der ein System aus Erfahrung eine neue Fähigkeit gewinnt. In der Arbeit heißt er Abstraction and Reasoning Corpus, kurz ARC. Die ARC Prize Foundation, die ihn heute betreibt, schreibt ARC-AGI und löst die Abkürzung als Abstraction and Reasoning Corpus for Artificial General Intelligence auf. Der Zuschnitt der Aufgaben folgt einem Grundsatz, der ihn von den üblichen Messreihen abhebt: Easy for Humans, Hard for AI. Zugelassen ist nur, was ein Mensch sehr früh mitbringt, also Formen, Anzahlen, Symmetrie und Abgrenzung. Sprache bleibt draußen, weil ein auf Text trainiertes Modell damit einen Vorsprung hätte, den der Test gerade nicht messen will. Drei Fassungen gibt es. Die dritte erschien am 25.03.2026 und misst etwas anderes als ihre Vorgänger: Der Agent bekommt eine Spielumgebung ohne Anleitung, ohne Regeln und ohne genanntes Ziel und muss selbst herausfinden, was Gewinnen bedeutet. Menschen lösen das vollständig, die besten Modelle lagen zum Start bei 0,51 Prozent.

auchARC-AGI · Abstraction and Reasoning Corpus

Beitrag · Dasselbe Modell, dreifacher WertOn the Measure of IntelligenceARC-AGI Series, Benchmarks for General IntelligenceAnnouncing ARC-AGI-3siehe ARC-AGI-3siehe Benchmarksiehe Harness

ARC-AGI-3

Ein Testverfahren aus einfachen Spielen ohne Tools, das die Zahl der genutzten Aktionen mit einem menschlichen Maßstab vergleicht, nicht die Zahl gelöster Aufgaben.

Die Testumgebung stellt bewusst keine Tools und keine Sonderausstattung bereit: Je schlichter der Rahmen, desto sichtbarer werden die Schwächen eines Modells, und desto eher lassen sich verschiedene Modelle vergleichen. Ein Wert wie 38,3 Prozent ist deshalb keine Lösungsquote, sondern der Vergleich der gebrauchten Aktionen mit einem menschlichen Maßstab, den OpenAI mit 48 Prozent angibt. Wie stark eine solche Zahl von der Umgebung um das Modell abhängt, zeigte OpenAI im Juli 2026 an einem eigenen Beispiel: Zwei geänderte Einstellungen am Harness verdreifachten den Wert für GPT-5.6 Sol, ohne dass sich am Modell etwas änderte.

auchARC-AGI-3-Test

Beitrag · Dasselbe Modell, dreifacher WertHow two API settings improved GPT-5.6 performance on ARC-AGI-329.07.2026 · Zwei Einstellungen am Harness verdreifachen die ARC-AGI-3-Werte von GPT-5.6 Solsiehe ARCsiehe Benchmarksiehe Harnesssiehe Agent

Benchmark

Ein fester Satz Aufgaben, mit dem Modelle verglichen werden. Die Zahl gilt für diese Aufgaben, nicht für die eigene Arbeit.

Fast jede Ankündigung eines Modells nennt Balken, in denen es vorn liegt. Damit eine solche Zahl etwas wert ist, gehören drei Angaben dazu: wer gemessen hat, welche Aufgaben gemessen wurden und ob diese Aufgaben im Training vorkamen. Bei Herstellerangaben ist die erste Frage schon beantwortet. Für eine Entscheidung zählt am Ende ein eigener Vergleich an den eigenen Aufgaben, weil keine Aufgabensammlung der Welt zu der Mischung passt, die in einem Betrieb anfällt.

auchBenchmarks · Auswertung · Bewertungslauf · Evaluation · Eval

2024 · Die Spitze wechselt zum ersten Mal21.09.2026 · Ein physikalisches Optimierungsverfahren wählt beim Pruning großer Sprachmodelle die zu entfernenden Blöcke29.07.2026 · Zwei Einstellungen am Harness verdreifachen die ARC-AGI-3-Werte von GPT-5.6 Solsiehe Harnesssiehe Sprachmodellsiehe Halluzinationsiehe Tokenmaxxingsiehe Enthaltungsiehe ARCsiehe ARC-AGI-3

CLIP

Contrastive Language-Image Pre-training. Ein Bild- und ein Textnetz, gemeinsam trainiert auf einen geteilten Raum für Bild und Text.

OpenAI stellte CLIP im Februar 2021 vor. Trainiert wurde mit 400 Millionen Bild-Text-Paaren aus dem Netz, mit der Aufgabe vorherzusagen, welche Bildunterschrift zu welchem Bild gehört. Im Original heißt es: „CLIP learns a multi-modal embedding space by jointly training an image encoder and text encoder“. Ein gemeinsamer Raum für zwei Medienarten war damit schon 2021 belegt, lange vor den heutigen multimodalen Modellen. Neu an einem Modell wie Gemini Embedding 2 ist 2026 die Breite: Text, Bild, Ton und Video in einem einzigen Raum, CLIP kannte nur zwei.

auchContrastive Language-Image Pre-training · Contrastive Language-Image Pretraining

Kapitel 04 · Embedding, Bedeutung als ZahlenreiheLearning Transferable Visual Models From Natural Language SupervisionGemini Embedding 2: A Native Multimodal Embedding Model from Gemini2021 · CLIP, ein gemeinsamer Raum für Bild und Textsiehe Embeddingsiehe Vektorraumsiehe Contrastive Learningsiehe Multimodal

Contrastive Learning

Das Trainingsziel von Embedding-Modellen: Zusammengehörige Textpaare sollen im Vektorraum nah beieinander landen, unzusammengehörige weit auseinander.

Hier liegt der Unterschied zum Sprachmodell, das auf die Vorhersage des nächsten Token trainiert wird. Einem Embedding-Modell legt man stattdessen Millionen Paare vor, etwa Frage und passende Antwort oder Titel und Artikel, und straft es, wenn der Abstand im Raum nicht stimmt. Daher rühren die praktischen Eigenschaften: Ein solches Modell ist klein, im Betrieb billig und muss nichts formulieren, nur einordnen. Dasselbe Verfahren legt beim multimodalen Training Text, Bild, Ton und Video in einen gemeinsamen Raum.

auchKontrastives Lernen · Kontrastives Training · Contrastive Loss · Embedding-Training

Kapitel 04 · Embedding, Bedeutung als ZahlenreiheGemini Embedding 2: A Native Multimodal Embedding Model from Geminisiehe Embeddingsiehe Vektorraumsiehe Pre-Training

Diarisierung

Auseinanderhalten, wer von mehreren Anwesenden gerade spricht.

Eine Abschrift hält fest, was gesagt wurde. Wer es gesagt hat, steht dort nur, wenn ein eigenes Verfahren die Stimmen trennt und den Abschnitten zuordnet. Praktisch wird das, sobald ein Gerät in einem Raum mit mehreren Menschen steht oder eine Aufnahme aus einer Besprechung stammt.

auchSprechertrennung · Speaker Diarization

siehe Spracherkennung

Diffusion

Das Verfahren hinter Stable Diffusion und seiner Linie: Ein Netz lernt, Rauschen schrittweise zu entfernen.

Trainiert wird über die leichte Richtung. Ein Bild wird Schritt für Schritt in Rauschen verwandelt, und gelernt wird der Rückweg. Wer den beherrscht, kann bei einem beliebigen Zufallsmuster anfangen; der eingegebene Text lenkt dabei, wohin die Schritte führen. Seit Dezember 2021 läuft die Rechnung in einem verdichteten Zwischenraum, in den ein zweites Netz das Bild übersetzt, und erst das brachte das Verfahren auf eine einzelne Grafikkarte. Seit März 2025 steht ein zweites Verfahren daneben: OpenAIs Bilderzeugung sitzt im Sprachmodell selbst und baut ein Bild Stück für Stück auf, wie einen Text; die Modellkarte grenzt das ausdrücklich vom Diffusionsmodell DALL·E ab.

auchDiffusionsmodell · Latent Diffusion · Entrauschen

Kapitel 14 · Ein Bild, das es vorher nicht gabDeep Unsupervised Learning using Nonequilibrium ThermodynamicsDenoising Diffusion Probabilistic ModelsHigh-Resolution Image Synthesis with Latent Diffusion ModelsAddendum to GPT-4o System Card: 4o image generation2025 · Bilder entstehen wie Textsiehe Multimodalsiehe Sampling

Distillation

Ein großes Modell erzeugt Antworten, ein kleines lernt sie nachzumachen. Am Ende steht ein kleineres Modell für eine Aufgabe.

Der Gedanke stammt aus einer Arbeit von 2015 über das Übertragen von Können aus mehreren Modellen in ein einzelnes. DistilBERT bezifferte ihn 2019 an einem Sprachmodell: 40 Prozent kleiner, 60 Prozent schneller, 97 Prozent des Sprachverständnisses. Anbieter führen das Verfahren heute als buchbaren Vorgang, bei dem das große Modell die Trainingsdaten selbst erzeugt und seine Aufrufe dabei berechnet werden.

auchDestillation · Knowledge Distillation · Modelldestillation · Lehrer-Schüler

Kapitel 02 · Ein Modell auf eigene Daten abstimmenDistilling the Knowledge in a Neural NetworkDistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighterAWS, Customize a model with distillation in Amazon Bedrocksiehe Fine-Tuningsiehe Low-Rank Adaptationsiehe Gewichte

Elo

Eine Rangzahl aus paarweisen Vergleichen. Ursprünglich für Schach gedacht, heute auch für Sprachmodelle und Agenten.

Der Name kommt von Arpad E. Elo, der das Verfahren 1967 in der Zeitschrift Chess Life für den US-amerikanischen Schachverband beschrieb. Elo ist der Nachname des Erfinders. Häufig steht dafür großgeschrieben ELO, korrekt ist die Schreibweise mit einem einzigen Großbuchstaben. 2024 übernahm die Plattform Chatbot Arena das Verfahren für Sprachmodelle, ersetzte es im selben Jahr aber durch Bradley-Terry-Koeffizienten, weil sich diese statistisch genauer schätzen lassen. Der Name Elo-Wert blieb trotzdem im Sprachgebrauch. Seit 2026 führt derselbe Betreiber, inzwischen unter dem Namen Arena Intelligence, eine eigene Rangliste für Agenten: Gemessen wird, wie zuverlässig ein Modell Tools einsetzt, ob es eine Aufgabe löst und wie gut es sich lenken lässt. Am 11.08.2026 standen dort 47 Modelle aus 1.746.922 Sitzungen. Wie bei jeder Rangliste gilt der Wert nur innerhalb dieser einen Vergleichsgruppe.

auchELO · Elo-Wert · Elo-Rating · Elo-Zahl

Chatbot Arena: An Open Platform for Evaluating LLMs by Human PreferenceAgent Arena, Rangliste von Arena Intelligencesiehe Benchmarksiehe Agent

Emergenz

Eine Fähigkeit, die kleine Modelle nicht zeigen und größere schon; ob der Sprung echt ist, wird begutachtet gestritten.

Die Bestimmung von 2022 hat zwei Teile, und der zweite ist die eigentliche Behauptung: Solche Fähigkeiten lassen sich aus dem Verhalten kleinerer Modelle nicht hochrechnen. Ein Jahr später kam die begutachtete Gegenthese, wonach der Sprung an der gewählten Kennzahl hängen kann. Wer eine mehrstellige Rechnung nur als richtig oder falsch zählt, sieht lange nichts und dann plötzlich etwas; wer Teilerfolge zählt, sieht eine glatte Kurve. Der Streit betrifft die Form der Kurve, und beide Arbeiten stehen begutachtet nebeneinander.

auchEmergente Fähigkeit · Emergent Ability

Kapitel 06 · Der Blick ins ModellKapitel 05 · Geschwindigkeit der EntwicklungEmergent Abilities of Large Language ModelsAre Emergent Abilities of Large Language Models a Mirage?siehe Interpretierbarkeitsiehe Benchmark

Fine-Tuning

Nachtraining eines fertigen Modells auf ein engeres Ziel, etwa auf hilfreiche Antworten in Gesprächsform.

Verglichen mit dem Pre-Training ein kleiner Eingriff, der das Verhalten trotzdem stark verändert. ChatGPT entstand aus einem Modell der GPT-3.5-Serie, das ein Fine-Tuning durchlaufen hat. Wer heute von einem Chatmodell spricht, meint fast immer ein Modell nach dem Fine-Tuning und selten das rohe Ergebnis des Pre-Trainings.

auchFeinjustierung · Feinabstimmung · Finetuning · Nachtraining · RLHF

Kapitel 02 · Ein Modell auf eigene Daten abstimmenIntroducing ChatGPTTraining language models to follow instructions with human feedback2022 · RLHF, Nachtraining mit menschlicher Rückmeldung2021 · LoRA, Anpassen ohne die Gewichte anzufassen30.07.2026 · Die EU schreibt sieben KI-Gigafabriken aussiehe Pre-Trainingsiehe GPTsiehe Reinforcement Learning from Human Feedbacksiehe Low-Rank Adaptationsiehe Distillation

Gewichte

Die gelernten Zahlen im Inneren eines Modells. Sie sind das Ergebnis des Trainings.

Ein Modell besteht aus Architektur und Gewichten. Die Architektur ist der Bauplan, die Gewichte sind das Gelernte. Offene Modelle geben die Gewichte frei, geschlossene nicht. Die Parameterzahl ist dabei der weitere Begriff: Sie zählt alle gelernten Zahlen, also auch die Tabelle für das Vokabular. Bei Gemma 3 270M stecken 170 der 270 Millionen Parameter dort und nur 100 Millionen in den Rechenschichten. Für sich genommen sagt die Zahl wenig über die Qualität. Ein drittes Mal begegnet das Wort Parameter beim Sampling, wo es Einstellungen wie Temperatur oder Top-K meint, also nichts Gelerntes.

auchWeights · Parameter · Parameterzahl

Kapitel 08 · Was ein Modell weiß, und woherKapitel 03 · Neuronale Netze und Deep LearningGoogle, Introducing Gemma 3 270Msiehe Modellkernsiehe Pre-Trainingsiehe Offene Gewichtesiehe Mixture of Expertssiehe Trainingsdaten

GPT

Generative Pre-trained Transformer. Eine Bauart von Sprachmodellen, oft als Name für einzelne Modelle verwendet.

Generative heißt, es erzeugt Text. Pre-trained heißt, es wurde erst auf sehr viel unbeschriftetem Text vortrainiert und danach für einzelne Aufgaben nachjustiert. Transformer ist die Bauform. GPT ist damit weder ein Produkt noch ein Hersteller, sondern eine Beschreibung.

auchGPT-3 · GPT-4 · GPT-4o · Generative Pre-trained Transformer

Kapitel 01 · Was ein Sprachmodell istImproving Language Understanding by Generative Pre-Training2018 · GPT-1siehe Transformersiehe Pre-Trainingsiehe Sprachmodell

Group Relative Policy OptimizationGRPO

Ein Verfahren des Reinforcement Learning, das je Aufgabe mehrere Antworten erzeugt und sie gegeneinander wertet, statt jede einzeln gegen ein eigenes Wertmodell.

GRPO stammt aus der DeepSeekMath-Arbeit vom Februar 2024 und ist eine Variante von PPO, dem bis dahin üblichen Verfahren. Für jede Aufgabe zieht es eine Gruppe von Antworten, etwa acht, lässt sie bewerten und lernt aus dem Abstand jeder Antwort zum Durchschnitt ihrer Gruppe. Das zweite Modell, das bei PPO den Wert einer Antwort schätzt, entfällt, und damit ein großer Teil des Speicherbedarfs. DeepSeek R1 erwarb auf diesem Weg seine Zwischenschritte, und in der Bibliothek TRL ist GRPO der Trainer für Aufgaben mit prüfbarem Ergebnis.

auchGRPO · PPO · Proximal Policy Optimization

Kapitel 02 · Maschinelles LernenDeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language ModelsDeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learningsiehe Reinforcement Learningsiehe Reinforcement Learning from Human Feedbacksiehe Reasoning-Modellsiehe Low-Rank Adaptationsiehe Transformer Reinforcement Learning

Kalibrierung

Wie gut die ausgedrückte Sicherheit eines Modells zu seiner tatsächlichen Trefferquote passt.

Ein gut kalibriertes Modell liegt bei Aussagen, die es mit neunzig Prozent Sicherheit trifft, auch in neun von zehn Fällen richtig. Daraus folgt eine unbequeme Kante: Für Tatsachen, deren Wahrheit sich aus den Trainingsdaten nicht ermitteln lässt, muss ein ehrlich kalibriertes Modell mit einer bestimmten Rate danebenliegen. Diese Untergrenze hängt weder an der Architektur noch an der Datenqualität.

auchkalibriert · Calibration · Sicherheitsschätzung

Kapitel 07 · Halluzinationen erkennenCalibrated Language Models Must Hallucinatesiehe Halluzinationsiehe Enthaltungsiehe Benchmark

Knowledge Cutoff

Der Zeitpunkt, bis zu dem ein Modell beim Training gelesen hat. Alles Spätere muss ihm mitgegeben werden.

Anthropic führt dafür zwei verschiedene Daten: bis wann das Wissen verlässlich ist, und wie weit die Trainingsdaten reichen. Zwischen beiden können Monate liegen. Google schränkt zusätzlich ein, dass der Stichtag je Themengebiet verschieden ausfällt. Das Modell selbst kennt ihn nicht, es bekommt ihn in der Systemanweisung mitgeteilt.

auchWissensstichtag · Stichtag · Trainingsstand · Cutoff · Wissensstand

Kapitel 08 · Was ein Modell weiß, und woherAnthropic, Models overviewAnthropic, System PromptsGoogle DeepMind, Gemini 3.6 Flash Model Cardsiehe Trainingsdatensiehe Gewichtesiehe RAGsiehe Halluzination

Low-Rank AdaptationLoRA

Anpassung eines Modells über eine kleine Zusatzdatei, während die Gewichte selbst eingefroren bleiben.

Trainiert werden kleine Zusatzmatrizen neben den unveränderten Gewichten. Die Arbeit von 2021 beziffert den Rückgang der trainierbaren Parameter mit dem Faktor 10.000 und den des Speicherbedarfs mit dem Faktor 3, bei gleicher Antwortzeit im Betrieb. QLoRA verband das 2023 mit der Quantisierung und brachte damit die Anpassung eines Modells mit 65 Milliarden Parametern auf eine einzelne Grafikkarte. Fast alles, was Anbieter heute als Abstimmung anbieten, arbeitet darunter so. Der Rang gibt an, wie breit die Zusatzmatrizen sind; Rang 1 ist die kleinste Fassung, und für Reinforcement Learning kommt sie nach einer Messung von Thinking Machines aus dem Jahr 2025 dem vollen Fine-Tuning gleich, weil die Bewertung je Versuch nur wenige Bit Information liefert.

auchLoRA · Adapter · QLoRA · PEFT · Rang

Kapitel 02 · Ein Modell auf eigene Daten abstimmenLoRA: Low-Rank Adaptation of Large Language ModelsQLoRA: Efficient Finetuning of Quantized LLMsParameter-Efficient Transfer Learning for NLPLoRA Without Regret2021 · LoRA, Anpassen ohne die Gewichte anzufassensiehe Fine-Tuningsiehe Gewichtesiehe Quantisierung

Massive Multitask Language UnderstandingMMLU

Ein Wissenstest aus Multiple-Choice-Fragen in 57 Fächern, von Grundschulmathematik bis Recht. Jahrelang die Zahl, die jede Modellankündigung nannte, bis die Spitzenmodelle darin dicht beieinanderlagen.

Hendrycks und Mitautoren veröffentlichten den Test am 07.09.2020. Jede Frage hat vier Antwortmöglichkeiten, die Fächer reichen von Grundschulmathematik über US-Geschichte und Informatik bis zu Recht, und wer hoch punkten will, braucht breites Weltwissen und die Fähigkeit, es auf eine Aufgabe anzuwenden. Zum Start lag das größte GPT-3 knapp 20 Prozentpunkte über dem Raten und auf keinem der 57 Gebiete auf Expertenniveau. In den Jahren danach wurde MMLU zur Standardangabe jeder Modellankündigung, und genau das machte ihn unbrauchbar: Sobald die Spitzenmodelle dicht beieinanderliegen, unterscheidet der Test sie kaum noch. Die Nachfolgefassung MMLU-Pro von 2024 erhöht die Zahl der Antwortmöglichkeiten von vier auf zehn und streicht triviale Fragen; die Genauigkeit derselben Modelle fällt darin nach Angabe der Autoren um 16 bis 33 Prozent. Ein MMLU-Wert in einer Ankündigung sagt deshalb zuerst etwas darüber, welche Fassung gemessen wurde und wie verbraucht sie ist.

auchMMLU · MMLU-Pro · Wissenstest

Kapitel 04 · Was eine Benchmarkzahl sagtMeasuring Massive Multitask Language UnderstandingMMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark21.09.2026 · Ein physikalisches Optimierungsverfahren wählt beim Pruning großer Sprachmodelle die zu entfernenden Blöckesiehe Benchmarksiehe ARCsiehe Elo

Mixture of ExpertsMoE

Ein Aufbau, bei dem je Anfrage nur ein Teil des Modells rechnet. Das Modell bleibt groß, der Aufwand je Antwort wird kleiner.

Das Netz enthält viele Teilnetze, und eine vorgeschaltete Auswahl entscheidet für jedes Token, welche davon zum Einsatz kommen. Für den Betrieb bedeutet das: Der Speicher muss das ganze Modell fassen, gerechnet wird nur mit einem Bruchteil. Kimi K3 zeigt beide Zahlen nebeneinander, 2,8 Billionen Gewichte insgesamt und 104 Milliarden je Token. Die Parameterzahl solcher Modelle sagt deshalb nichts über den Aufwand einer einzelnen Antwort.

auchMoE · Expertenmodell · Sparse Model

Kimi K3, Modellkarte auf Hugging Face2026 · Offene Gewichte in der Drei-Billionen-Klasse2023 · Mistral 7B, die europäische Antwortsiehe Gewichtesiehe Inferenzsiehe Quantisierung

Modellkarte

Das Begleitdokument, in dem ein Anbieter beschreibt, was sein Modell ist und was er daran gemessen hat.

Zwei Wörter für zwei Sachen, und die Anbieter benutzen beide. Der ältere stammt aus einer Arbeit von 2018 und meint ein kurzes Dokument, das ein veröffentlichtes Modell begleitet: Aufbau, Grenzen, Leistung, aufgeschlüsselt nach Gruppen. System Card ist Jahre jünger und stammt von den Häusern, die ihre Modelle selbst betreiben. Wo die Grenze verläuft, zeigt OpenAI an sich selbst: Die offenen Gewichte gpt-oss bekamen eine Model Card, das eigene GPT-6 Astra eine System Card. Wer beides gleichsetzt, überspringt die Schicht, in der der Betrieb stattfindet. Verbindlich ist keine der Formen. Der Verhaltenskodex zur KI-Verordnung sieht ein Formular für die Modelldokumentation vor, alles Weitere entscheidet das Haus: Am 06.09.2026 führten drei von fünfzehn geprüften Anbietern ein eigenes Verzeichnis, in dem je Karte ein Datum steht.

auchModel Card · System Card · Systemkarte · Modelldokumentation

Kapitel 08 · Was ein Modell weiß, und woherKapitel 07 · Die Systemkarte lesenModel Cards for Model ReportingOpenAI, gpt-oss-120b und gpt-oss-20b Model CardAnthropic, Model system cardsThe General-Purpose AI Code of Practicesiehe Trainingsdatensiehe Benchmarksiehe Offene Gewichtesiehe Modell mit allgemeinem Verwendungszweck

Multi-Token PredictionMTP

Zusätzliche Ausgabeköpfe auf demselben Modellrumpf, die schon beim Training mehrere zukünftige Token statt nur des nächsten vorhersagen.

Gloeckle und Mitautoren von Meta AI schlugen das Verfahren im April 2024 vor: mehrere unabhängige Köpfe sitzen auf einem gemeinsamen Rumpf und sagen je einen der folgenden Token voraus, was die Dateneffizienz beim Training verbessert. DeepSeek-V3 übernahm den Ansatz im Dezember 2024 und fand eine zweite Verwendung dafür: Bei der Inferenz lassen sich dieselben Köpfe als Entwurf für das Speculative Decoding wiederverwenden, mit einer gemessenen Trefferquote von 85 bis 90 Prozent für den zweiten vorhergesagten Token. Ein eigenes zweites Modell wird dafür nicht mehr gebraucht. Der Kopf muss dafür in der Modelldatei liegen: Er entsteht beim Training und geht beim Umwandeln in ein Ausführungsformat entweder mit oder verloren. Die verbreiteten GGUF-Fassungen der großen offenen Modelle hatten ihn im August 2026 überwiegend nicht, gemessen an vier Dateien eines eigenen Bestands. Ollama nutzt einen solchen Kopf seit August 2026 automatisch, wenn Qwen3.5 über die MLX-Engine auf einer Apple-GPU läuft; über llama.cpp braucht es eine eigens gebaute Datei und den Schalter draft-mtp.

auchMTP · MTP-Kopf · MTP-Modul

Beitrag · Elf Wege, ein lokales Modell schneller zu machenBetter & Faster Large Language Models via Multi-token Predictionllama.cpp, Dokumentation zum Speculative DecodingDeepSeek-V3 Technical ReportOllama v0.32.6siehe Speculative Decodingsiehe Sprachmodellsiehe MLX

Multimodal

Ein Modell, das nicht nur Text verarbeitet, sondern auch Bild, Ton oder Video.

Zwei Bauformen werden oft verwechselt: mehrere hintereinandergeschaltete Modelle, von denen eines Bilder beschreibt und ein zweites den Text verarbeitet, oder ein einziges Modell, das alle Formen gemeinsam gelernt hat. Nur das Zweite ist im engeren Sinn multimodal.

auchMultimodalität · Vision

Kapitel 13 · Was ein Modell auf einem Bild erkenntVisionGPT-4Hello GPT-4o2025 · Bilder entstehen wie Text2024 · GPT-4o, ein Netz für alle Medien2023 · GPT-4siehe Sprachmodellsiehe Vektorraumsiehe Deepfake

Neural Radiance Field

Ein Verfahren, das aus wenigen Fotos eine Szene ablegt, aus der sich neue Blickwinkel berechnen lassen.

Gespeichert wird eine Funktion in den Gewichten eines kleinen Netzes, aus der sich für jeden Punkt und jede Blickrichtung Farbe und Dichte ergeben. Ein Gitternetz oder eine Oberfläche entsteht dabei an keiner Stelle, weshalb das Ergebnis kein Konstruktionsmodell ist. Gaussian Splatting löst dieselbe Aufgabe seit 2023 in Echtzeit, mit über hundert Bildern je Sekunde bei voller Auflösung. Beide rekonstruieren aus Aufnahmen; der erfindende Weg über ein Bildmodell führt zum selben Dateiformat, und die Datei sagt nicht, welcher von beiden es war.

auchNeRF · Gaussian Splatting · Radiance Field

Kapitel 13 · Video, Musik und 3DNeRF: Representing Scenes as Neural Radiance Fields for View Synthesis3D Gaussian Splatting for Real-Time Radiance Field RenderingDreamFusion: Text-to-3D using 2D Diffusionsiehe Diffusionsiehe Text-zu-Video

Offene Gewichte

Die gelernten Zahlen eines Modells stehen zum Herunterladen bereit. Über die Lizenz und über die Trainingsdaten sagt das nichts.

Wer die Gewichte hat, kann ein Modell auf eigener Hardware betreiben, ohne dass eine Anfrage das Haus verlässt. Mit offener Software ist das trotzdem nicht dasselbe: Die Trainingsdaten liegen fast nie bei, der Trainingslauf lässt sich nicht wiederholen, und manche Lizenz beschränkt die Nutzung nach Nutzerzahl oder Zweck. Die Bezeichnung Open Source ist für solche Modelle deshalb meistens falsch. Die zweite Grenze ist die Hardware: Ein Modell der Spitzenklasse braucht mehr Speicher, als in einem Rechner steckt.

auchOpen Weights · offenes Modell · Open-Weight-Modell · frei verfügbare Gewichte

Kapitel 01 · Wo Modelle betrieben werdenLLaMA: Open and Efficient Foundation Language ModelsKimi K3 License2026 · Offene Gewichte in der Drei-Billionen-Klasse2025 · Offene Gewichte mit Zwischenschritten2023 · Mistral 7B, die europäische Antwortund 2 weitere in der KI-Geschichte27.07.2026 · Anthropic legt seine Haltung zu offenen Gewichten darsiehe Gewichtesiehe Quantisierungsiehe Laufzeitumgebung

Pre-Training

Der erste und teuerste Schritt: Ein Modell lernt aus sehr viel Text, das jeweils nächste Token vorherzusagen.

Hier entsteht das meiste von dem, was ein Modell kann. Das Pre-Training findet einmal statt, dauert Wochen bis Monate und kostet den überwiegenden Teil der Rechenzeit. Alles danach justiert nur noch nach.

auchVortraining · Pretraining · Training

Kapitel 02 · Maschinelles LernenImproving Language Understanding by Generative Pre-Training2018 · GPT-1siehe Fine-Tuningsiehe Gewichtesiehe Contrastive Learningsiehe Reinforcement Learning from Human Feedback

QLoRA

LoRA-Fine-Tuning eines quantisierten Modells: Die eingefrorenen Basisgewichte liegen grob gespeichert, nur die kleinen Zusatzmatrizen rechnen in voller Genauigkeit.

Dettmers und Mitautoren verbanden das 2023 mit der Quantisierung: Ein Modell mit 65 Milliarden Parametern lässt sich damit auf einer einzelnen Grafikkarte mit 48 Gigabyte feinjustieren, bei erhaltener Leistung gegenüber der vollen 16-Bit-Justierung. Vorher war eine solche Anpassung eine Sache für Rechenzentren.

Kapitel 02 · Ein Modell auf eigene Daten abstimmenQLoRA: Efficient Finetuning of Quantized LLMssiehe Low-Rank Adaptationsiehe Quantisierung

Quantisierung

Die Gewichte werden gröber gespeichert, meist mit 4 statt 16 Bit. Das Modell schrumpft und läuft auf gewöhnlicher Hardware.

Ein Gewicht ist eine Zahl. Wird sie mit 4 statt mit 16 Bit gespeichert, braucht das Modell etwa ein Viertel des Platzes, und eines mit sieben Milliarden Parametern passt in den Arbeitsspeicher eines Laptops. Bezahlt wird das mit Genauigkeit, bei starker Kürzung deutlich. Ohne dieses Verfahren gäbe es keine lokale Nutzung auf gewöhnlichen Rechnern; mit ihm wurde sie ab März 2023 Alltag.

auchQuantization · 4-Bit-Quantisierung · quantisiert

Kapitel 01 · Wo Modelle betrieben werdenllama.cpp, die README am Tag der Veröffentlichung2023 · llama.cpp, das Modell läuft auf dem eigenen Rechnersiehe Gewichtesiehe Inferenzsiehe Modellkernsiehe Offene Gewichte

Reasoning-Modell

Ein Modell, das vor der Antwort sichtbare oder unsichtbare Zwischenschritte erzeugt und dafür mehr Rechenzeit verbraucht.

Der Zugewinn entsteht zur Antwortzeit, nicht beim Training. Ob dieses Verhalten im Modell trainiert ist oder von der Umgebung erzwungen wird, lässt sich von außen nicht sicher unterscheiden. Damit verwischt die saubere Trennung zwischen Modell und System.

auchReasoning · Denkschritte · Schlussfolgern

Kapitel 01 · Was ein Sprachmodell istLearning to reason with LLMsDeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement LearningWhat's new in Claude Opus 52024 · Reasoning, Rechenzeit zur Antwortzeit2016 · AlphaGo schlägt einen Profisiehe Inferenzsiehe Modellkernsiehe Reinforcement Learningsiehe Chain-of-Thought

Reinforcement LearningRL

Training über Belohnung statt über vorgegebene Lösungen: Das Modell probiert, bekommt eine Bewertung und richtet sich danach.

Beim üblichen Training steht die richtige Antwort daneben. Beim Reinforcement Learning gibt es nur eine Bewertung des Ergebnisses, und das Modell muss selbst herausfinden, was zu ihr geführt hat. Woher die Bewertung kommt, unterscheidet die Verfahren. Bei RLHF stammt sie von Menschen, aus deren Urteilen ein Belohnungsmodell gebaut wird. Bei Aufgaben mit prüfbarem Ergebnis, etwa Rechnen oder Programmieren, kann eine automatische Prüfung sie liefern. Auf diesem Weg erwarb DeepSeek R1 seine Zwischenschritte, ohne dass jemand sie vorgegeben hätte. Das Modell, das dabei trainiert wird, heißt in diesem Verfahren Policy, ein einzelner Versuch samt seiner Bewertung ein Rollout; GRPO wertet mehrere Rollouts zu derselben Aufgabe gegeneinander.

auchBestärkendes Lernen · Belohnungsmodell · Reward Model · Policy · Rollout

Kapitel 02 · Maschinelles LernenTraining language models to follow instructions with human feedbackDeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning2025 · Offene Gewichte mit Zwischenschrittensiehe Reinforcement Learning from Human Feedbacksiehe Reasoning-Modellsiehe Fine-Tuningsiehe Group Relative Policy Optimization

Reinforcement Learning from Human FeedbackRLHF

Nachtraining mit menschlicher Rückmeldung. Der Schritt, der aus einem Textfortsetzer einen Assistenten macht.

Ein vortrainiertes Modell setzt Text fort, das ist alles. Damit daraus ein Assistent wird, bewerten Menschen Antworten, aus diesen Bewertungen entsteht ein Belohnungsmodell, und gegen dieses wird das Sprachmodell weitertrainiert. Die Wirkung ist größer als jede Vergrößerung: Ein nachtrainiertes Modell mit 1,3 Milliarden Parametern wurde in der Arbeit von 2022 hilfreicher eingeschätzt als ein untrainiertes mit 175 Milliarden. Damit entsteht eine Abhängigkeit von denen, die bewertet haben, denn deren Vorstellung von einer guten Antwort steckt danach im Modell.

auchRLHF · Reinforcement Learning aus menschlicher Rückmeldung · Nachtraining · Alignment

Kapitel 01 · Was ein Sprachmodell istKapitel 02 · Ein Modell auf eigene Daten abstimmenTraining language models to follow instructions with human feedback2022 · RLHF, Nachtraining mit menschlicher Rückmeldungsiehe Pre-Trainingsiehe Fine-Tuningsiehe Sprachmodellsiehe Reasoning-Modellsiehe Reinforcement Learning

Sampling

Der Schritt, der aus der Rangliste des Modells ein einzelnes Token zieht.

Ein Sprachmodell endet bei einer Bewertung über sein ganzes Vokabular. Welches Token daraus wird, entscheidet das Programm davor, und dafür gibt es mehrere Verfahren: Top-K schneidet nach Anzahl, Top-P nach aufsummiertem Anteil, Min-P gemessen am besten Eintrag. Welche davon zur Verfügung stehen, ist eine Eigenschaft des Zugangs. Dasselbe Modell hat hinter zwei Zugängen verschiedene Regler.

auchTop-K · Top-P · Min-P · Nucleus Sampling · Ziehung

Kapitel 12 · Wie zufällig die Antwort istsiehe Temperatursiehe Inferenz

Selbstüberwachtes Lernen

Das Verfahren erzeugt seine Zielantwort aus den Daten selbst, indem es einen Teil davon verdeckt.

Man verdeckt ein Stück Text und lässt das Verfahren erraten, was dort stand. Die Lösung liegt bereits vor, denn sie ist der verdeckte Teil. Damit entstehen aus jedem Satz Aufgaben mit bekannter Antwort, ohne dass jemand Etiketten vergibt. Formal gehört das Verfahren zum unüberwachten Lernen, vom Ablauf her arbeitet es wie überwachtes. Es ist die Grundlage jedes heutigen Sprachmodells, und aus der Wahl dessen, was verdeckt wird, folgen zwei Modellfamilien: Schreiber und Leser.

auchSelf-Supervised Learning · self-supervised · Selbstüberwachung

Kapitel 02 · Maschinelles LernenBERT: Pre-training of Deep Bidirectional Transformers for Language UnderstandingVerordnung (EU) 2024/1689 über künstliche Intelligenzsiehe Überwachtes Lernensiehe Pre-Trainingsiehe Transformer

Small Language ModelSLM

Ein Sprachmodell, das auf ein gewöhnliches Gerät passt und einem einzelnen Nutzer schnell genug antwortet. Eine feste Parametergrenze gehört nicht dazu.

Eine Grenze in Parametern hat sich nie durchgesetzt, weil jede Zahl mit der nächsten Hardware-Generation veraltet. Belcak und Mitautoren bei NVIDIA setzen deshalb am Gerät an: Klein ist, was auf ein gewöhnliches Endgerät passt und einem einzelnen Nutzer schnell genug antwortet. Als Faustzahl für 2025 nennen sie 10 Milliarden Parameter. Bei Modellen mit Mixture-of-Experts-Aufbau sind zwei Zahlen zu unterscheiden, die gesamte und die aktive. Für den Platzbedarf zählt die erste, für die Antwortzeit die zweite. Zur Herkunft sagt die Bezeichnung nichts: Ein kleines Modell kann aus einem großen abgeleitet sein, was der Regelfall ist, oder von Grund auf für ein Fachgebiet und dessen Sprache trainiert worden sein.

auchSLM · kleines Sprachmodell · kleine Sprachmodelle · Kleinmodell

Kapitel 10 · Small Language ModelsSmall Language Models are the Future of Agentic AIMistral 7Bsiehe Sprachmodellsiehe Gewichtesiehe Mixture of Expertssiehe Quantisierungsiehe On-Device

Speech-to-TextSTT

So heißt Spracherkennung in Produkten und Programmierschnittstellen. Derselbe Vorgang, nur der Name kommt aus der Praxis statt aus der Forschung.

ASR und STT bezeichnen denselben Vorgang, nur mit unterschiedlicher Herkunft. Automatic Speech Recognition stammt aus der Forschung und beschreibt die Aufgabe, Speech-to-Text ist die Bezeichnung, unter der Cloud-Anbieter ihre Schnittstellen dafür anbieten. In einem Sprachsystem markiert STT die Eingangsseite. Am Ausgang, dort wo aus Text wieder Ton wird, steht das Gegenstück Text-to-Speech.

auchSpeech to Text · STT

Kapitel 01 · Was Conversational AI istsiehe Spracherkennungsiehe Sprachsynthese

SpracherkennungASR

Macht aus Ton Text. Ein eigenes Modell, das vor dem Sprachmodell sitzt oder in ihm steckt.

Bis 2022 kamen die besten Werte aus einem System, das auf den jeweiligen Datenbestand eingestellt war. Seither reicht dafür ein Modell, das auf sehr großen Mengen ungeordneter Aufnahmen trainiert wurde. Zwei Eigenschaften prägen den Umgang damit: Seltene Wörter wie Eigennamen und Abkürzungen gehen häufiger verloren als gewöhnliche, weil das Modell nach Wahrscheinlichkeit auswählt, und bei Stille geben manche Modelle Text aus, den niemand gesagt hat.

auchAutomatic Speech Recognition · ASR · Transkription

Kapitel 02 · Sprache und AudioKapitel 07 · SpracherkennungBeitrag · Warum ich eine eigene Diktier-App gebaut habeRobust Speech Recognition via Large-Scale Weak SupervisionNVIDIA, Modellkarte Parakeet TDT 0.6B v32022 · Spracherkennung mit offenen Gewichtensiehe Speech-to-Textsiehe Wortfehlerratesiehe Halluzinationsiehe Token

SprachsyntheseTTS

Macht aus Text Ton. Das Gegenstück zur Spracherkennung, am anderen Ende des Gesprächs.

Die Ausgabe kommt stückweise, damit die Antwort anfangen kann, bevor der letzte Satz erzeugt ist. Geführt wird sie heute über eine Anweisung in Prosa: Tempo, Betonung, Gefühlslage und Akzent stehen als Satz daneben. Für ein Gespräch zählt vor allem, dass die Ausgabe an jeder Stelle abbrechbar bleibt, weil sonst weitergeredet wird, nachdem jemand unterbrochen hat.

auchText-to-Speech · TTS · Sprachausgabe

Kapitel 01 · Was Conversational AI istKapitel 08 · SprachsyntheseOpenAI, Text to speechsiehe Spracherkennungsiehe Barge-in

Stimmklon

Eine synthetische Stimme, die einer vorhandenen nachgebildet ist.

Die Anbieter machen die Zustimmung des Sprechers zur technischen Voraussetzung. Einer verlangt eine Tonaufnahme mit vorgegebenem Wortlaut, bei der jede Abweichung den Vorgang scheitern lässt; ein anderer erlaubt nur die eigene Stimme und prüft sie nach. Beides sind Entscheidungen des jeweiligen Anbieters, die er jederzeit anders treffen kann.

auchVoice Cloning · Stimmnachbildung · Voice Clone

Kapitel 09 · Was die Stimme noch beweistElevenLabs, Professional voice cloningOpenAI, Text to speechsiehe Sprachsynthesesiehe Deepfake

Text-zu-Video

Ein Modell, das aus einer Beschreibung einen Clip erzeugt, meist über Diffusion in Raum-Zeit-Stücken.

Zerlegt wird in Stücke, die eine Fläche über eine Zeitspanne bezeichnen, vergleichbar den Token eines Sprachmodells. Ihre Zahl wächst mit Fläche und Dauer gleichzeitig, weshalb längere Clips überproportional kosten. Die Cliplänge ist beim Bau des Modells festgelegt und beim Aufruf keine Einstellung; 2023 lagen offene Modelle bei 14 bis 25 Bildern, 2026 nennen Anbieter bis zu dreißig Sekunden. Neuere Modelle erzeugen die Tonspur im selben Lauf, womit die Trennung zur Sprachsynthese an dieser Stelle wegfällt.

auchText-to-Video · Videomodell · Videoerzeugung

Kapitel 13 · Video, Musik und 3DVideo generation models as world simulatorsIntroducing Stable Video DiffusionVeosiehe Diffusionsiehe Zeitliche Beständigkeitsiehe Weltmodell

Trainingsdaten

Das Material, aus dem die Gewichte eines Modells entstanden sind.

Wie genau die Anbieter das benennen, geht weit auseinander. Googles Modellkarte zählt sieben Herkünfte einzeln auf, OpenAIs System Card fasst drei in einem Satz zusammen. Bei Anthropic wechselt die Formulierung von Modell zu Modell: Zwischen Sonnet 4.5 und Sonnet 5 verschwand die Nennung eingewilligter Nutzerdaten, maschinell erzeugte Daten kamen hinzu, und beim jüngsten Modell stehen Nutzerdaten wieder in der Aufzählung.

auchTraining Data · Trainingskorpus · Trainingsmaterial

Kapitel 08 · Was ein Modell weiß, und woherKapitel 02 · Maschinelles LernenAnthropic's Transparency HubGoogle DeepMind, Gemini 3 Pro Model CardGPT-5 System Cardsiehe Modellkartesiehe Knowledge Cutoffsiehe Gewichtesiehe Pre-Training

Transformer Reinforcement LearningTRL

Die Bibliothek von Hugging Face für das Nachtraining von Sprachmodellen: SFT, DPO, GRPO und ein asynchroner Trainer, der Training und Generierung trennt.

TRL setzt auf die Transformers-Bibliothek auf und bündelt die Verfahren, mit denen aus einem vortrainierten Modell ein Assistent wird: überwachtes Fine-Tuning, Präferenzverfahren wie DPO, Belohnungsmodelle und Reinforcement Learning mit GRPO. Der asynchrone GRPO-Trainer lässt die Antworten von vLLM erzeugen, während das Training weiterläuft, und schickt seit Version 1.14 wahlweise nur den LoRA-Adapter dorthin statt des ganzen Modells. Wer LoRA-Adapter für eigene Aufgaben trainiert, landet in der Regel bei dieser Bibliothek oder bei einem Werkzeug, das sie im Inneren benutzt.

auchTRL · AsyncGRPOTrainer · GRPOTrainer · SFTTrainer

Kapitel 02 · Ein Modell auf eigene Daten abstimmenTRL, Transformer Reinforcement LearningAsync GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCLsiehe Fine-Tuningsiehe Low-Rank Adaptationsiehe Group Relative Policy Optimizationsiehe Reinforcement Learningsiehe vLLM

Überwachtes Lernen

Lernen aus Beispielen, zu denen die richtige Antwort dabeisteht. Die Antwort stammt von einem Menschen.

Jedes Trainingsbeispiel kommt mit einem Etikett: zu jedem Bild die Bezeichnung, zu jeder Mail die Einstufung. Das Verfahren stellt seine inneren Werte so ein, dass seine Ausgabe diesen Etiketten näherkommt. Der Aufwand steckt in den Etiketten, denn sie kosten Menschenarbeit. Genau dieser Deckel war der Grund, warum die Wende bei den Sprachmodellen über ein anderes Verfahren kam.

auchSupervised Learning · supervised · überwachtes Training

Kapitel 02 · Maschinelles LernenImageNet Large Scale Visual Recognition ChallengeVerordnung (EU) 2024/1689 über künstliche Intelligenzsiehe Selbstüberwachtes Lernensiehe Reinforcement Learningsiehe Trainingsdaten

Unüberwachtes Lernen

Lernen ohne vorgegebene Antwort. Das Verfahren sucht Struktur, die bereits in den Daten liegt.

Ohne Etiketten bleibt einem Verfahren nur, was die Daten selbst hergeben: Häufungen ähnlicher Fälle, wiederkehrende Muster, Achsen mit besonders viel Streuung. Die KI-Verordnung führt das Verfahren neben dem überwachten und dem bestärkenden Lernen als eine der Methoden auf, mit denen Modelle mit allgemeinem Verwendungszweck trainiert werden.

auchUnsupervised Learning · unsupervised

Kapitel 02 · Maschinelles LernenVerordnung (EU) 2024/1689 über künstliche Intelligenzsiehe Überwachtes Lernensiehe Selbstüberwachtes Lernen

Verlustfunktion

Die Funktion, die den Abstand zwischen der Ausgabe eines Verfahrens und der gewünschten Antwort als eine Zahl misst.

Das Training verkleinert diese eine Zahl, und damit legt die Verlustfunktion fest, was überhaupt als Fehler zählt. Zwei Verfahren mit derselben Bauform und verschiedenen Verlustfunktionen lernen verschiedene Dinge. Sie wird beim Entwurf gewählt. Aus den Daten folgt sie an keiner Stelle. Ein gefallener Wert sagt, dass das Verfahren dem gewählten Maß näherkommt, und über die Güte im Feld sagt er für sich genommen nichts.

auchLoss Function · Loss · Zielfunktion · Kostenfunktion

Kapitel 02 · Maschinelles Lernensiehe Backpropagationsiehe Gewichtesiehe Benchmark

VLA-ModellVLA

Vision-Language-Action. Ein Modell, das aus Kamerabild und Anweisung Steuerbefehle für einen Roboter macht.

Gebaut wird es aus einem vorhandenen Bild-Sprach-Modell, dem ein Bewegungsausgang angehängt wird. Der Umweg über ein Modell aus dem Netz bringt Weltwissen mit, das sich aus Roboterdaten allein nicht gewinnen ließe: wie eine Tasse aussieht, wozu ein Henkel da ist. Die Modelle bleiben klein, weil bis zu hundert Entscheidungen je Sekunde anfallen und Größe Zeit kostet. Google DeepMind, Physical Intelligence und NVIDIA bauen jeweils eigene Familien davon.

auchVision-Language-Action · Vision-Language-Action-Modell · Robotermodell · Bewegungsmodell

Kapitel 14 · Physical AIGoogle DeepMind, Gemini Roboticsπ0: A Vision-Language-Action Flow Model for General Robot Controlsiehe Physical AIsiehe Multimodalsiehe Weltmodellsiehe Small Language Model

Voice Activity DetectionVAD

Das Bauteil, das entscheidet, wann jemand zu Ende geredet hat.

Im Chatfenster übernimmt diese Aufgabe die Enter-Taste, im Gespräch ein Programm. Zwei Bauarten stehen nebeneinander: Die eine schneidet nach Stille und braucht dafür eine Dauer und eine Lautstärkeschwelle, die andere zieht die gesprochenen Wörter heran und prüft, ob der angefangene Satz vollständig ist. Beides sind Einstellungen, und sie entscheiden darüber, ob ein System ins Wort fällt oder nach jedem Satz schweigt.

auchSprachaktivitätserkennung · VAD · Endpointing

Kapitel 02 · Sprache und AudioKapitel 03 · Wenn das Gespräch nicht in Runden läuftOpenAI, Voice activity detection (VAD)siehe Barge-insiehe Spracherkennung

Weltmodell

Ein Modell, das vorhersagt, wie sich eine Umgebung entwickelt und was die eigene Handlung daran ändert.

Der Nutzen liegt im Üben: Wer die Folgen einer Handlung vorhersagen kann, spielt sie durch, statt sie auszuführen, und ein Fehler kostet dann Rechenzeit statt Material. Der Begriff bezeichnet heute drei verschiedene Sachen, und beim Lesen lohnt die Rückfrage, welche gemeint ist: das verdichtete Umgebungsmodell eines lernenden Agenten, ein Videomodell mit Zeitachse, oder eine erzeugte Umgebung, die sich begehen lässt. Allen dreien gemeinsam ist, dass sie die Wahrscheinlichkeit von Folgen gelernt haben. Bewegungsgleichungen stehen darin nirgends.

auchWorld Model · Umgebungsmodell

Kapitel 09 · WeltmodelleWorld ModelsMastering diverse control tasks through world modelsGenie 3: A new frontier for world modelssiehe Reinforcement Learningsiehe Diffusionsiehe Multimodal

WortfehlerrateWER

Das übliche Maß für Spracherkennung: die Zahl der Ersetzungen, Löschungen und Einfügungen, mit denen aus der Abschrift die Sollfassung würde, geteilt durch die Wörter der Sollfassung.

Die Zahl behandelt alle Wörter gleich. Ein falsch erkanntes „und“ wiegt darin so viel wie ein falsch geschriebener Nachname, obwohl der Schaden ein anderer ist. Deshalb lohnt eine zweite Messung über die Wörter, auf die es ankommt: An einer eigenen Referenzaufnahme lag die Gesamtrate bei 10,68 Prozent und die Rate auf den markierten Fachbegriffen bei 25,00 Prozent (eigene Messung, 19.04.2026). Weil Einfügungen mitzählen, kann die Rate über 100 Prozent steigen.

auchWord Error Rate · WER

Kapitel 02 · Sprache und AudioBeitrag · Warum ich eine eigene Diktier-App gebaut habesiehe Spracherkennungsiehe Benchmark

Zeitliche Beständigkeit

Die Anforderung, dass ein Gegenstand über alle Bilder eines Clips derselbe bleibt.

Sie ist der Unterschied zwischen Bild- und Videoerzeugung. Ein Einzelbild hat keine Reihenfolge, ein Clip hat eine, und was im ersten Bild zu sehen ist, muss im hundertsten noch stimmen. Sichtbar wird die Schwäche an wandernden Gesichtern, verschwindenden Gegenständen und vor allem an Schrift, die ein Hersteller selbst als eines der härtesten Probleme dieses Gebiets bezeichnet. Beim Verlängern eines Clips setzt ein zweiter Lauf am letzten Bild des ersten an, und die Abweichungen summieren sich über die Kette.

auchtemporale Konsistenz · temporal consistency · Frame-Konsistenz

Kapitel 13 · Video, Musik und 3DIntroducing SolarisVideo generation models as world simulatorssiehe Diffusionsiehe Weltmodell

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.