Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenKI-WissenKapitel 02von 14 im Pfad

Maschinelles Lernen

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Ein Programm für die Umsatzsteuer folgt Regeln, die jemand aufgeschrieben hat. Ein Programm, das Katzen auf Fotos findet, folgt keiner solchen Regel, denn niemand kann aufschreiben, woran eine Katze zu erkennen ist. Es hat viele Bilder gesehen und sein Verhalten daraus gezogen.

Das ist maschinelles Lernen: die Familie der Verfahren, bei denen das Verhalten aus Beispielen entsteht. Die KI-Verordnung beschreibt sie als Ansätze,

wobei aus Daten gelernt wird, wie bestimmte Ziele erreicht werden können (externe Seite, eur-lex.europa.eu)

Welche anderen Familien es daneben gibt, steht in Kapitel 01.

Zwei Phasen, und dazwischen liegt Zeit

Ein solches Verfahren läuft in zwei getrennten Vorgängen, und wer die verwechselt, kommt bei fast jeder Frage zum falschen Schluss.

Das Training. Das Verfahren sieht die Beispiele und stellt dabei innere Werte ein. Das ist der teure Teil, und bei großen Modellen läuft er über Wochen auf sehr viel Hardware. Was das kostet und woran es hängt, steht in Beurteilen und Einordnen, Kapitel 05.

Die Benutzung. Die Werte stehen fest, und das Verfahren wendet sie auf einen neuen Fall an. Das ist der billige Teil, und er läuft in Millisekunden.

Aus dieser Trennung folgt fast alles, was an Sprachmodellen zunächst rätselhaft wirkt. Warum ein Modell den gestrigen Wechselkurs nicht kennt, steht in Grundkurs, Kapitel 08. Warum ein Gespräch nach seinem Ende spurlos verschwindet, steht in Grundkurs, Kapitel 02.

Drei Arten, aus Daten zu lernen

Auch hier gibt es eine amtliche Aufzählung. Die KI-Verordnung nennt die drei Verfahren beim Namen:

Diese Modelle werden in der Regel mit großen Datenmengen durch verschiedene Methoden, etwa überwachtes, unüberwachtes und bestärkendes Lernen, trainiert. (externe Seite, eur-lex.europa.eu)

Sie unterscheiden sich in einer einzigen Frage: Woher kommt die Bewertung, an der sich das Verfahren ausrichtet?

Überwachtes Lernen. Zu jedem Beispiel liegt die richtige Antwort bei. Ein Mensch hat sie hingeschrieben, und bei dem Bestand, an dem sich die Bilderkennung jahrelang gemessen hat, war genau das die Arbeit:

We discuss the challenges of collecting large-scale ground truth annotation (externe Seite, arxiv.org)

Der Wettbewerb dahinter lief über Hunderte von Kategorien und Millionen von Bildern (externe Seite, arxiv.org).

Unüberwachtes Lernen. Es gibt keine hingeschriebene Antwort. Das Verfahren sucht Struktur in den Daten selbst, etwa Gruppen ähnlicher Fälle. Der Sonderfall davon, aus dem die Sprachmodelle entstanden sind, steht in Tiefe 2.

Bestärkendes Lernen. Es gibt keine richtige Antwort je Beispiel, nur eine Rückmeldung darüber, ob das Ergebnis gut war. Das Verfahren probiert und bekommt am Ende eine Wertung. AlphaGo hat auf diesem Weg gegen sich selbst gespielt, und die Arbeit nennt beide Wege in einem Satz:

These deep neural networks are trained by a novel combination of supervised learning from human expert games, and reinforcement learning from games of self-play. (externe Seite, nature.com)

Neun Jahre später steht dasselbe Verfahren hinter den nachdenkenden Sprachmodellen. DeepSeek beschreibt es so:

Here we show that the reasoning abilities of LLMs can be incentivized through pure reinforcement learning (RL), obviating the need for human-labeled reasoning trajectories. (externe Seite, arxiv.org)

Die Rückmeldung kommt dort aus einer automatischen Prüfung: Eine Rechenaufgabe lässt sich nachrechnen, ein Programm lässt sich ausführen.

Die Daten sind die Arbeit

Beim überwachten Lernen steckt der Aufwand in den Etiketten. Millionen Bilder mussten von Menschen benannt werden, bevor ein Verfahren daraus etwas lernen konnte. Die Arbeit zum ImageNet-Wettbewerb widmet dem einen eigenen Abschnitt:

We discuss the challenges of collecting large-scale ground truth annotation (externe Seite, arxiv.org)

Das ist der Grund, warum die Wende bei den Sprachmodellen an einer anderen Stelle kam. Text im Netz liegt bereits da, und er lässt sich ohne menschliche Etiketten zum Lernen benutzen. Wie das geht, steht in Tiefe 2.

Warum ein Modell danebenliegt

Ein gelerntes Verfahren beantwortet Fälle, die es nie gesehen hat. Das gelingt, solange die neuen Fälle den alten ähneln. Drei Muster von Fehlschlägen kommen immer wieder vor.

Auswendiglernen. Das Verfahren merkt sich die Beispiele, statt die dahinterliegende Regelmäßigkeit zu finden. Auf den Trainingsdaten sieht es großartig aus und auf neuen Fällen schlecht.

Verschobene Lage. Die neuen Fälle sehen anders aus als die alten. Ein Verfahren, das an Fotos aus Europa gelernt hat, liegt bei Aufnahmen aus einer anderen Weltgegend daneben.

Die falsche Regelmäßigkeit. Das Verfahren findet etwas, das in den Daten mit der Antwort einhergeht und mit der Sache nichts zu tun hat. Wenn auf allen Bildern mit Wölfen Schnee liegt, lernt es Schnee.

Was daraus für die Beurteilung von Messwerten folgt, steht in Beurteilen und Einordnen, Kapitel 04.

Woran Sie ein Lernverfahren erkennen

Fragen Sie nach der Bewertung. Wer hat gesagt, was richtig ist, und woher stammt diese Angabe? An dieser Frage hängt die Verlässlichkeit des ganzen Ergebnisses.

Fragen Sie nach dem Zeitpunkt. Die inneren Werte stammen aus dem Training. Alles, was danach passiert ist, kennt das Verfahren nur, wenn es ihm jemand mitgibt.

Fragen Sie nach den Beispielen. Ein Verfahren kann nur die Fälle, die seinen Beispielen ähneln. Der eigene Anwendungsfall ist selten der, für den gemessen wurde.

Rechnen Sie mit Fehlern als Regelfall. Ein gelerntes Verfahren liefert eine Wahrscheinlichkeit. Eine Zusage steckt darin an keiner Stelle. Wie sich damit arbeiten lässt, steht in Grundkurs, Kapitel 07.

Quellen

7 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Originalarbeiterreichbar

    Verordnung (EU) 2024/1689 über künstliche Intelligenz (externe Seite, eur-lex.europa.eu)

    eur-lex.europa.eugeprüft 24.09.2026

    Der Rechtstext selbst, veröffentlicht am 12.07.2024 und in Kraft getreten am 01.08.2024. Er ordnet Anwendungen nach Risiko und legt die Pflichten je Stufe fest. Die Anwendbarkeit beginnt gestaffelt, nicht mit dem Inkrafttreten. Die Adresse zeigt seit dem 29.07.2026 auf die deutsche Fassung: Die Zitate unten stehen im Text so, wie er hier zitiert wird, und die Fassung ohne Sprachangabe liefert die englische.

  • Originalarbeiterreichbar

    ImageNet Large Scale Visual Recognition Challenge (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Russakovsky und elf Mitautoren beschreiben am 01.09.2014 den Wettbewerb, an dem sich die Bilderkennung von 2010 an gemessen hat, und vor allem die Arbeit dahinter: das Beschaffen der Etiketten für Millionen von Bildern. Der Beleg dafür, was überwachtes Lernen im Maßstab wirklich kostet: Die Etiketten stammen von Menschen, die sie einzeln vergeben haben.

  • Originalarbeiterreichbar

    Mastering the game of Go with deep neural networks and tree search (externe Seite, nature.com)

    nature.comgeprüft 24.09.2026

    Die Arbeit hinter AlphaGo. Sie beschreibt, wie zwei Netze die Suche im Spielbaum lenken, und meldet den ersten Sieg eines Programms gegen einen Profispieler auf vollem Brett ohne Vorgabe. Zwei Monate später folgte das öffentliche Spiel gegen Lee Sedol.

  • Originalarbeiterreichbar

    DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    DeepSeek beschreibt am 22.01.2025 ein Modell mit offenen Gewichten, das Zwischenschritte über Reinforcement Learning erwirbt. Damit ist der zweite Skalierungspfad, mehr Rechenzeit zur Antwortzeit, nicht mehr auf geschlossene Anbieter beschränkt.

  • Originalarbeiterreichbar

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Gegenrichtung zu GPT, aus demselben Baustein gebaut. BERT liest einen Satz von beiden Seiten und erzeugt daraus eine Darstellung, statt Text fortzusetzen. Ein großer Teil der Embedding-Modelle, die heute eine Suche in eigenen Dokumenten möglich machen, ist so gebaut.

  • Originalarbeiterreichbar

    The Nobel Prize in Physics 2024, press release (externe Seite, nobelprize.org)

    nobelprize.orggeprüft 24.09.2026

    Die Bekanntgabe vom 08.10.2024 für John Hopfield und Geoffrey Hinton, für Arbeiten, die das maschinelle Lernen mit künstlichen neuronalen Netzen ermöglichten. Einen Tag später ging der Chemiepreis unter anderem an Demis Hassabis und John Jumper für AlphaFold.

  • Originalarbeiterreichbar

    Learning Transferable Visual Models From Natural Language Supervision (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    CLIP, eingereicht am 26.02.2021. Der Beleg dafür, dass Bild und Text lange vor den heutigen multimodalen Modellen in einem gemeinsamen Raum lagen: Ein Bild- und ein Textnetz werden gleichzeitig darauf trainiert, dass zusammengehörige Paare denselben Platz bekommen. Abschnitt 2.3 sagt es wörtlich: „CLIP learns a multi-modal embedding space by jointly training an image encoder and text encoder to maximize the cosine similarity of the image and text embeddings“. Diese Stelle steht im Volltext und ist deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.