GrundlagenKI-WissenKapitel 02von 14 im Pfad
Maschinelles Lernen
Ein Programm für die Umsatzsteuer folgt Regeln, die jemand aufgeschrieben hat. Ein Programm, das Katzen auf Fotos findet, folgt keiner solchen Regel, denn niemand kann aufschreiben, woran eine Katze zu erkennen ist. Es hat viele Bilder gesehen und sein Verhalten daraus gezogen.
Das ist maschinelles Lernen: die Familie der Verfahren, bei denen das Verhalten aus Beispielen entsteht. Die KI-Verordnung beschreibt sie als Ansätze,
Welche anderen Familien es daneben gibt, steht in Kapitel 01.
Zwei Phasen, und dazwischen liegt Zeit
Ein solches Verfahren läuft in zwei getrennten Vorgängen, und wer die verwechselt, kommt bei fast jeder Frage zum falschen Schluss.
Das Training. Das Verfahren sieht die Beispiele und stellt dabei innere Werte ein. Das ist der teure Teil, und bei großen Modellen läuft er über Wochen auf sehr viel Hardware. Was das kostet und woran es hängt, steht in Beurteilen und Einordnen, Kapitel 05.
Die Benutzung. Die Werte stehen fest, und das Verfahren wendet sie auf einen neuen Fall an. Das ist der billige Teil, und er läuft in Millisekunden.
Aus dieser Trennung folgt fast alles, was an Sprachmodellen zunächst rätselhaft wirkt. Warum ein Modell den gestrigen Wechselkurs nicht kennt, steht in Grundkurs, Kapitel 08. Warum ein Gespräch nach seinem Ende spurlos verschwindet, steht in Grundkurs, Kapitel 02.
Drei Arten, aus Daten zu lernen
Auch hier gibt es eine amtliche Aufzählung. Die KI-Verordnung nennt die drei Verfahren beim Namen:
Sie unterscheiden sich in einer einzigen Frage: Woher kommt die Bewertung, an der sich das Verfahren ausrichtet?
Überwachtes Lernen. Zu jedem Beispiel liegt die richtige Antwort bei. Ein Mensch hat sie hingeschrieben, und bei dem Bestand, an dem sich die Bilderkennung jahrelang gemessen hat, war genau das die Arbeit:
Der Wettbewerb dahinter lief über Hunderte von Kategorien und Millionen von Bildern (externe Seite, arxiv.org).
Unüberwachtes Lernen. Es gibt keine hingeschriebene Antwort. Das Verfahren sucht Struktur in den Daten selbst, etwa Gruppen ähnlicher Fälle. Der Sonderfall davon, aus dem die Sprachmodelle entstanden sind, steht in Tiefe 2.
Bestärkendes Lernen. Es gibt keine richtige Antwort je Beispiel, nur eine Rückmeldung darüber, ob das Ergebnis gut war. Das Verfahren probiert und bekommt am Ende eine Wertung. AlphaGo hat auf diesem Weg gegen sich selbst gespielt, und die Arbeit nennt beide Wege in einem Satz:
Neun Jahre später steht dasselbe Verfahren hinter den nachdenkenden Sprachmodellen. DeepSeek beschreibt es so:
Die Rückmeldung kommt dort aus einer automatischen Prüfung: Eine Rechenaufgabe lässt sich nachrechnen, ein Programm lässt sich ausführen.
Die Daten sind die Arbeit
Beim überwachten Lernen steckt der Aufwand in den Etiketten. Millionen Bilder mussten von Menschen benannt werden, bevor ein Verfahren daraus etwas lernen konnte. Die Arbeit zum ImageNet-Wettbewerb widmet dem einen eigenen Abschnitt:
Das ist der Grund, warum die Wende bei den Sprachmodellen an einer anderen Stelle kam. Text im Netz liegt bereits da, und er lässt sich ohne menschliche Etiketten zum Lernen benutzen. Wie das geht, steht in Tiefe 2.
Warum ein Modell danebenliegt
Ein gelerntes Verfahren beantwortet Fälle, die es nie gesehen hat. Das gelingt, solange die neuen Fälle den alten ähneln. Drei Muster von Fehlschlägen kommen immer wieder vor.
Auswendiglernen. Das Verfahren merkt sich die Beispiele, statt die dahinterliegende Regelmäßigkeit zu finden. Auf den Trainingsdaten sieht es großartig aus und auf neuen Fällen schlecht.
Verschobene Lage. Die neuen Fälle sehen anders aus als die alten. Ein Verfahren, das an Fotos aus Europa gelernt hat, liegt bei Aufnahmen aus einer anderen Weltgegend daneben.
Die falsche Regelmäßigkeit. Das Verfahren findet etwas, das in den Daten mit der Antwort einhergeht und mit der Sache nichts zu tun hat. Wenn auf allen Bildern mit Wölfen Schnee liegt, lernt es Schnee.
Was daraus für die Beurteilung von Messwerten folgt, steht in Beurteilen und Einordnen, Kapitel 04.
Woran Sie ein Lernverfahren erkennen
Fragen Sie nach der Bewertung. Wer hat gesagt, was richtig ist, und woher stammt diese Angabe? An dieser Frage hängt die Verlässlichkeit des ganzen Ergebnisses.
Fragen Sie nach dem Zeitpunkt. Die inneren Werte stammen aus dem Training. Alles, was danach passiert ist, kennt das Verfahren nur, wenn es ihm jemand mitgibt.
Fragen Sie nach den Beispielen. Ein Verfahren kann nur die Fälle, die seinen Beispielen ähneln. Der eigene Anwendungsfall ist selten der, für den gemessen wurde.
Rechnen Sie mit Fehlern als Regelfall. Ein gelerntes Verfahren liefert eine Wahrscheinlichkeit. Eine Zusage steckt darin an keiner Stelle. Wie sich damit arbeiten lässt, steht in Grundkurs, Kapitel 07.
Die Einteilung in überwachtes, unüberwachtes und bestärkendes Lernen steht in jedem Lehrbuch und wird meistens an den Beispielen erklärt. Nützlicher ist das Kriterium dahinter, und es lautet: Woher kommt das Signal, an dem sich das Verfahren ausrichtet?
Das Kriterium ist die Herkunft der Bewertung
Überwacht. Die Bewertung liegt je Beispiel vor und stammt von einem Menschen. Zu jedem Bild steht die Bezeichnung dabei, zu jeder Mail die Angabe Werbung oder keine Werbung.
Unüberwacht. Es gibt keine Bewertung. Das Verfahren sucht Struktur, die schon in den Daten liegt, etwa Häufungen ähnlicher Fälle.
Bestärkend. Die Bewertung kommt erst nach einer Folge von Entscheidungen und sagt nur, wie gut das Ergebnis war. Welcher Schritt daran Anteil hatte, steht nicht dabei.
Der letzte Punkt ist die eigentliche Schwierigkeit dieser Familie. Bei einer gewonnenen Partie über zweihundert Züge ist unklar, welcher Zug den Sieg gebracht hat. Verfahren des bestärkenden Lernens beschäftigen sich vor allem mit dieser Zuordnung.
Der Sonderfall, aus dem die Sprachmodelle entstanden
Bei ImageNet steckte der Aufwand in den Etiketten, und die Arbeit dazu benennt das als eigene Aufgabe:
Millionen Bilder, jedes von Menschen benannt. Auf diesem Weg lässt sich das Verfahren nur so weit skalieren, wie jemand die Etiketten bezahlt.
Bei Text funktioniert ein Kniff, der diesen Deckel wegnimmt. Man verdeckt ein Stück des Textes und lässt das Verfahren erraten, was dort stand. Die Antwort liegt bereits vor, denn sie ist der verdeckte Teil selbst. Aus jedem Satz aus dem Netz werden so Aufgaben mit bekannter Lösung, ohne dass jemand etwas hinschreibt.
Dafür hat sich der Ausdruck selbstüberwachtes Lernen eingebürgert. Formal gehört das Verfahren zum unüberwachten Lernen, weil keine fremde Bewertung hinzukommt; vom Ablauf her arbeitet es wie überwachtes Lernen, weil es zu jedem Beispiel eine Zielantwort hat. Der Ausdruck steht inzwischen im Gesetzestext: Die KI-Verordnung beschreibt Modelle mit allgemeinem Verwendungszweck als solche, die mit einer großen Datenmenge und mit Selbstüberwachung trainiert wurden, und nennt dazu eine Größe von mindestens einer Milliarde Parametern (externe Seite, eur-lex.europa.eu).
Zwei Wege, dasselbe zu verdecken, ergeben zwei Modellfamilien. Ein Modell, das immer das nächste Stück errät, wird zum Textschreiber; das steht in Grundkurs, Kapitel 02. Ein Modell, das Lücken mitten im Satz füllt, wird zum Leser. BERT ist der bekannteste Vertreter der zweiten Bauart:
Ein großer Teil der Modelle, die heute die Suche in eigenen Dokumenten möglich machen, ist so gebaut; das bekannteste davon steht in Grundkurs, Kapitel 04.
Warum darauf noch eine zweite Stufe folgt
Ein Modell, das nur den nächsten Textbaustein errät, beantwortet keine Fragen, es setzt Texte fort. Für die Verwandlung in etwas Benutzbares braucht es einen zweiten Durchgang mit menschlicher Bewertung. Dieser Durchgang und seine Verfahren stehen in Beurteilen und Einordnen, Kapitel 02.
Wichtig für die Einordnung hier ist, welche Größe man vergleicht. An Datenmenge gemessen fällt die zweite Stufe gegen die erste kaum ins Gewicht, und das Weltwissen stammt aus dem ersten Durchgang. An Wirkung gemessen sieht es anders aus: Beurteilen und Einordnen, Kapitel 02 führt eine Messung des Anbieters vor, in der ein kleineres Modell mit dieser Behandlung ein sehr viel größeres ohne sie schlägt.
Drei Stufen des bestärkenden Lernens
Die Familie unterscheidet sich in einer einzigen Größe, und das ist die Quelle der Belohnung.
Das Spiel bewertet sich selbst. Bei AlphaGo sagt das Regelwerk am Ende, wer gewonnen hat. Das Verfahren kann beliebig oft gegen sich selbst spielen und braucht dafür niemanden:
Der erste Teil des Satzes zeigt zugleich, dass die Lernarten sich mischen lassen. Erst menschliche Partien, dann Spiele gegen sich selbst.
Ein Mensch bewertet. Bei Sprachmodellen gibt es keine Regel, die eine gute Antwort erkennt. Also bewerten Menschen Antwortpaare, und aus diesen Bewertungen wird ein Modell gebaut, das die Belohnung liefert. Das Verfahren und seine Kosten stehen in Beurteilen und Einordnen, Kapitel 02.
Eine Prüfung bewertet. Bei Aufgaben mit nachprüfbarem Ergebnis geht es wieder ohne Menschen. Eine Rechnung stimmt oder stimmt nicht, ein Programm läuft durch die Tests oder fällt durch. DeepSeek hat gezeigt, dass das genügt:
Die Arbeit vergleicht das Ergebnis ausdrücklich mit dem älteren Weg und meldet, dass es diesen übertrifft: surpassing its counterparts trained via conventional supervised learning on human demonstrations (externe Seite, arxiv.org). Damit steht der Aufwand an menschlicher Arbeit dort, wo er sich lohnt, und die Menge an Übung ist nur noch eine Frage der Rechenzeit.
Der Preis dieser Stufe steht in der Bedingung: Sie greift nur, wo sich ein Ergebnis maschinell prüfen lässt. Bei einer guten Zusammenfassung greift sie nicht.
Was ein Modell zwischen zwei Fällen gemeinsam hat
Alle drei Lernarten laufen auf dieselbe Sache hinaus: Das Verfahren stellt innere Werte so ein, dass ein Maß für den Fehler kleiner wird. Was dieses Maß misst, unterscheidet die Arten, das Vorgehen unterscheidet sie nicht.
Diese Einstellung der Werte hat 2024 den Physik-Nobelpreis bekommen, und die Begründung ordnet das ganze Feld ein:
Wie diese Netze gebaut sind und wie das Einstellen der Werte abläuft, steht in Kapitel 03.
Was daraus für die Praxis folgt
Etiketten sind der Engpass, wo es welche braucht. Ein eigenes überwachtes Modell scheitert selten am Verfahren und meistens an der Frage, wer die Beispiele benennt.
Selbstüberwachung ist der Grund für die Größe der Sprachmodelle. Sobald Trainingsaufgaben ohne menschliche Arbeit entstehen, fällt der Deckel weg, den das Etikettieren gesetzt hat. Andere Grenzen bleiben, von der Datenmenge über die Speicherbandbreite bis zum Strom, und sie stehen in Beurteilen und Einordnen, Kapitel 05.
Bestärkendes Lernen setzt eine messbare Belohnung voraus. Wo niemand sagen kann, was ein gutes Ergebnis ist, gibt es nichts zu verstärken. Diese Frage kommt vor der Wahl des Verfahrens.
Die Lernart steht selten allein. Die üblichen Systeme setzen mehrere hintereinander, und die Reihenfolge ist ein Teil des Entwurfs.
Alle Lernarten laufen auf dieselbe Rechnung hinaus. Was sie unterscheidet, ist die Größe, die kleiner werden soll.
Training ist eine Suche nach dem kleinsten Fehler
Am Anfang stehen die inneren Werte eines Verfahrens auf Zufallszahlen. Es bekommt ein Beispiel, gibt eine Antwort aus, und eine Funktion misst, wie weit diese Antwort von der gewünschten entfernt liegt. Diese Funktion heißt Verlustfunktion, und ihr Wert ist eine einzige Zahl.
Danach wird für jeden inneren Wert bestimmt, in welche Richtung er sich ändern müsste, damit diese Zahl fällt. Jeder Wert bewegt sich ein kleines Stück in diese Richtung. Dann kommt das nächste Beispiel. Das wiederholt sich milliardenfach.
Drei Dinge sind daran bemerkenswert.
Es gibt keinen Beweis, dass das Ergebnis das beste ist. Das Verfahren findet eine Stelle, an der sich der Fehler in keiner Richtung mehr deutlich verbessern lässt. Ob es woanders eine bessere gäbe, bleibt offen.
Die Verlustfunktion ist eine Entwurfsentscheidung. Sie legt fest, was als Fehler zählt. Zwei Verfahren mit derselben Bauform und verschiedenen Verlustfunktionen lernen verschiedene Dinge.
Der Weg dorthin ist teuer, das Ergebnis ist billig. Die Richtungssuche läuft über alle inneren Werte und über alle Beispiele. Beim Benutzen entfällt sie vollständig.
Wie diese Richtungssuche in einem geschichteten Netz abläuft, steht in Kapitel 03.
Was das Wort Lernen verdeckt
Der Ausdruck stammt aus einer Zeit, in der die Anleihe bei der Biologie das Programm des Fachs war. Er beschreibt den Vorgang schief, und zwar an drei Stellen.
Es gibt kein Verstehen des Gelernten. Das Verfahren stellt Zahlen ein. Ob dabei etwas entsteht, das dem Verstehen eines Menschen ähnelt, ist eine offene Frage. Das Verfahren setzt es an keiner Stelle voraus.
Es gibt kein Weiterlernen im Betrieb. Nach dem Training stehen die Werte fest. Was ein Sprachmodell im Gespräch aufnimmt, steht im Kontext und verschwindet mit ihm, siehe Grundkurs, Kapitel 02.
Es gibt keine Reihenfolge wie beim Menschen. Das Verfahren sieht seine Beispiele in zufälliger Ordnung und oft mehrfach. Der Aufbau vom Einfachen zum Schweren, der beim Unterricht selbstverständlich ist, kommt hier nur vor, wenn ihn jemand eigens einbaut.
Für die Fremdwahrnehmung des Fachs ist der Ausdruck trotzdem folgenreich. Er legt eine Erwartung an Einsicht nahe, die das Verfahren nirgends einlöst.
Warum der Physik-Nobelpreis 2024 hierher ging
Die Auszeichnung für John Hopfield und Geoffrey Hinton wirkt auf den ersten Blick wie eine Verlegenheitslösung, denn einen Nobelpreis für Informatik gibt es nicht. Die Begründung des Komitees benennt jedoch einen sachlichen Grund: Die ausgezeichneten Arbeiten haben ihr Werkzeug aus der Physik geholt.
Hopfields Netz beschreibt einen Zustand über seine Energie, in Anlehnung an die Beschreibung magnetischer Materialien, und das Wiedererkennen eines Musters wird darin zu einem Abstieg auf niedrigere Energie. Hinton baute darauf auf und nahm sein Werkzeug an derselben Stelle:
Sein Verfahren kann laut Bekanntgabe selbständig Eigenschaften in Daten finden und damit etwa bestimmte Elemente in Bildern erkennen (externe Seite, nobelprize.org).
Das ist die Beschreibung des unüberwachten Lernens, und die Bekanntgabe zieht die Linie von dort bis heute: Hinton has built upon this work, helping initiate the current explosive development of machine learning (externe Seite, nobelprize.org).
Für die Einordnung des Fachs zählt der Satz, mit dem die Bekanntgabe anfängt:
Das Nobelkomitee benennt damit dieselbe Verengung, die dieses Kapitel und Kapitel 01 auseinandernehmen.
Vier Verfahren, die in der Dreiteilung keinen Platz haben
Die Einteilung in überwacht, unüberwacht und bestärkend ist eine Ordnung nach der Herkunft der Bewertung. Sie deckt die heutige Praxis nur noch teilweise.
Selbstüberwachtes Lernen erzeugt seine Zielantwort aus den Daten selbst. Formal unüberwacht, praktisch überwacht, und die Grundlage jedes Sprachmodells.
Kontrastives Lernen bewertet keine einzelne Antwort, es misst Abstände zwischen Paaren. CLIP lernt so eine gemeinsame Darstellung für Bild und Text, indem es voraussagt, welche Bildunterschrift zu welchem Bild gehört (externe Seite, arxiv.org). Die Bewertung entsteht aus der Zusammenstellung der Paare. Das Verfahren steht ausführlich in Grundkurs, Kapitel 04.
Präferenzlernen bekommt zwei Antworten und die Angabe, welche von beiden besser ist. Eine als richtig gekennzeichnete Antwort gibt es dort nicht. Daraus wird erst eine Bewertungsfunktion gebaut und dann damit trainiert. Das Verfahren steht in Beurteilen und Einordnen, Kapitel 02.
Halbüberwachtes Lernen benutzt wenige benannte und viele unbenannte Beispiele. Es entstand genau aus dem Engpass, den die ImageNet-Arbeit beschreibt: Etiketten kosten Menschenarbeit, unbenannte Daten liegen herum.
Die Verfahren mischen sich außerdem in Ketten. Ein heutiges Sprachmodell durchläuft selbstüberwachtes Vortraining, überwachtes Nachjustieren und Präferenzlernen, und bei den nachdenkenden Modellen kommt bestärkendes Lernen mit maschineller Prüfung dazu.
Was daraus nicht folgt
Aus einem gefallenen Fehlerwert folgt keine Güte im Feld. Die Verlustfunktion misst, was jemand als Fehler festgelegt hat, und sie misst es an den Daten, mit denen gemessen wurde. Die ImageNet-Arbeit stellt der erreichten Genauigkeit deshalb ausdrücklich die menschliche gegenüber (externe Seite, arxiv.org): Eine Fehlerzahl braucht einen Maßstab neben sich. Wie eine solche Zahl zu lesen ist, steht in Beurteilen und Einordnen, Kapitel 04.
Aus bestärkendem Lernen folgt keine Selbständigkeit. Das Verfahren optimiert auf eine Belohnung, die jemand definiert hat. Bei AlphaGo war das der Sieg in Spielen gegen sich selbst (externe Seite, nature.com), bei DeepSeek die maschinelle Prüfbarkeit einer Lösung (externe Seite, arxiv.org). Wo eine solche Definition fehlt, hilft das Verfahren nicht.
Aus der Menge der Daten folgt keine Verallgemeinerung. Mehr Beispiele derselben Art verschieben die Grenze nicht, an der ein Verfahren scheitert. Sie verschieben nur, wie sicher es innerhalb dieser Grenze antwortet.
Aus der Selbstüberwachung folgt keine Freiheit von menschlicher Arbeit. Sie verlagert diese Arbeit. Statt Etiketten zu vergeben, wird ausgewählt, aufbereitet und gefiltert, und diese Auswahl bestimmt das Ergebnis mit.
Quellen
7 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Originalarbeiterreichbar
Verordnung (EU) 2024/1689 über künstliche Intelligenz (externe Seite, eur-lex.europa.eu)
eur-lex.europa.eugeprüft 24.09.2026
Der Rechtstext selbst, veröffentlicht am 12.07.2024 und in Kraft getreten am 01.08.2024. Er ordnet Anwendungen nach Risiko und legt die Pflichten je Stufe fest. Die Anwendbarkeit beginnt gestaffelt, nicht mit dem Inkrafttreten. Die Adresse zeigt seit dem 29.07.2026 auf die deutsche Fassung: Die Zitate unten stehen im Text so, wie er hier zitiert wird, und die Fassung ohne Sprachangabe liefert die englische.
Originalarbeiterreichbar
ImageNet Large Scale Visual Recognition Challenge (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Russakovsky und elf Mitautoren beschreiben am 01.09.2014 den Wettbewerb, an dem sich die Bilderkennung von 2010 an gemessen hat, und vor allem die Arbeit dahinter: das Beschaffen der Etiketten für Millionen von Bildern. Der Beleg dafür, was überwachtes Lernen im Maßstab wirklich kostet: Die Etiketten stammen von Menschen, die sie einzeln vergeben haben.
Originalarbeiterreichbar
Mastering the game of Go with deep neural networks and tree search (externe Seite, nature.com)
nature.comgeprüft 24.09.2026
Die Arbeit hinter AlphaGo. Sie beschreibt, wie zwei Netze die Suche im Spielbaum lenken, und meldet den ersten Sieg eines Programms gegen einen Profispieler auf vollem Brett ohne Vorgabe. Zwei Monate später folgte das öffentliche Spiel gegen Lee Sedol.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
DeepSeek beschreibt am 22.01.2025 ein Modell mit offenen Gewichten, das Zwischenschritte über Reinforcement Learning erwirbt. Damit ist der zweite Skalierungspfad, mehr Rechenzeit zur Antwortzeit, nicht mehr auf geschlossene Anbieter beschränkt.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Die Gegenrichtung zu GPT, aus demselben Baustein gebaut. BERT liest einen Satz von beiden Seiten und erzeugt daraus eine Darstellung, statt Text fortzusetzen. Ein großer Teil der Embedding-Modelle, die heute eine Suche in eigenen Dokumenten möglich machen, ist so gebaut.
Originalarbeiterreichbar
The Nobel Prize in Physics 2024, press release (externe Seite, nobelprize.org)
nobelprize.orggeprüft 24.09.2026
Die Bekanntgabe vom 08.10.2024 für John Hopfield und Geoffrey Hinton, für Arbeiten, die das maschinelle Lernen mit künstlichen neuronalen Netzen ermöglichten. Einen Tag später ging der Chemiepreis unter anderem an Demis Hassabis und John Jumper für AlphaFold.
Originalarbeiterreichbar
Learning Transferable Visual Models From Natural Language Supervision (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
CLIP, eingereicht am 26.02.2021. Der Beleg dafür, dass Bild und Text lange vor den heutigen multimodalen Modellen in einem gemeinsamen Raum lagen: Ein Bild- und ein Textnetz werden gleichzeitig darauf trainiert, dass zusammengehörige Paare denselben Platz bekommen. Abschnitt 2.3 sagt es wörtlich: „CLIP learns a multi-modal embedding space by jointly training an image encoder and text encoder to maximize the cosine similarity of the image and text embeddings“. Diese Stelle steht im Volltext und ist deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.