GrundlagenKI-WissenKapitel 06von 14 im Pfad
NLP vor den Sprachmodellen
Grundkurs, Kapitel 03 sagt, dass die heutige Zerlegung eines Textes Grenzen zieht, die quer zu allem liegen, was ein Linguist ziehen würde. Wie ein Linguist zerlegt hat, sagt es nicht. Grundkurs, Kapitel 04 beginnt damit, dass jedes Token eine Reihe von Zahlen bekommt, und sagt nicht, wie Text davor zu Zahlen wurde.
Dazwischen liegen dreißig Jahre. Dieses Kapitel handelt von ihnen.
Vom Gesprächssystem als Produkt handelt es dabei nicht. Wie ein Chatbot vor den Sprachmodellen aufgebaut war, mit Absichtsliste und vorformulierten Antworten, steht in Conversational AI, Kapitel 01. Hier geht es um die Verfahren darunter.
Ein Programm, das Verständnis vortäuschte
Am Anfang steht ein Programm, das bis heute erklärt, warum Menschen Maschinen Verstehen zuschreiben. Eine Arbeit von 2025, die den Originalausdruck im Nachlass wiederfand, ordnet es so ein:
Das Programm arbeitete mit Wortmustern. Es suchte in der Eingabe nach Schlüsselwörtern, wählte dazu eine vorbereitete Satzschablone und setzte Teile der Eingabe hinein. Aus „Ich habe Angst vor meinem Vater“ wurde damit „Erzählen Sie mir mehr über Ihren Vater“. Eine Darstellung von Bedeutung gab es nirgends im Programm.
Der Fund, auf dem die Arbeit von 2025 beruht, zeigt zugleich, wie wenig davon lange gesichert war:
Wichtig für alles Folgende ist die Beobachtung, die Weizenbaum an seinen Benutzern machte. Sie führten Gespräche mit einem Programm, das nichts verstand, und sie schrieben ihm trotzdem Verständnis zu. Warum ein solches Programm damals als Schritt zu einer denkenden Maschine gelesen wurde, steht in Kapitel 11.
Regeln, die jemand aufgeschrieben hat
Nach ELIZA folgte die Zeit der Regelwerke. Ein Verfahren bekam eine Grammatik, ein Wörterbuch und eine Liste von Umformungen, alles von Hand geschrieben. Damit ließen sich Sätze zerlegen, Wortarten bestimmen und einfache Fragen beantworten.
Dass diese Arbeit schwerer ist, als sie klingt, sagt heute noch die Dokumentation der gebräuchlichsten Programmbibliothek für dieses Fach:
Schon das Zerlegen also. Für jede weitere Sprache begann die Arbeit von vorn, und ein Regelwerk, das Zeitungstexte beherrschte, scheiterte an gesprochener Sprache.
Aus Wörtern werden Zahlen, durch Zählen
Ab den 1990er Jahren übernahm eine andere Herangehensweise. Statt Regeln aufzuschreiben, wurden Häufigkeiten gezählt. Der Übergang von Text zu Zahlen, der jedem heutigen Verfahren zugrunde liegt, sieht in seiner ältesten Form so aus:
Der einfachste Fall zählt für jedes Wort des Wortschatzes, wie oft es im Text vorkommt. Ein Dokument wird damit zu einer sehr langen Zahlenreihe, in der fast überall eine Null steht. Was dabei verlorengeht, benennt dieselbe Seite ausdrücklich:
Die Reihenfolge fällt also weg. „Der Hund beißt den Mann“ und „Der Mann beißt den Hund“ ergeben dieselbe Zahlenreihe. Das ist die Grenze dieser ganzen Epoche, und sie ist an dieser einen Stelle eingebaut.
Warum das häufigste Wort das nutzloseste ist
Beim reinen Zählen gewinnen die Wörter, die überall stehen. Die Dokumentation erklärt, warum das die Rechnung verdirbt:
Die Antwort darauf ist eine Gewichtung: Ein Wort wiegt umso mehr, je seltener es über alle Dokumente hinweg ist. Ein Wort wie „und“ kommt überall vor und unterscheidet nichts, ein Fachbegriff kommt in fünf von tausend Dokumenten vor und unterscheidet viel.
Diese Gewichtung ist die Grundlage der Volltextsuche, und sie arbeitet bis heute. In der Suche über eine Wissensbasis steht sie neben dem Vergleich von Zahlenreihen, siehe Agenten und Harness, Kapitel 03.
Die Vorarbeiten am Wort
Vor dem Zählen lagen mehrere Schritte, die jede Anwendung selbst erledigen musste. Sie haben eigene Namen, und sie stecken heute in der Zerlegung eines Sprachmodells oder fallen ganz weg.
Zerlegen. Den Text in Wörter schneiden. Was daraus geworden ist, steht in Grundkurs, Kapitel 03.
Grundform bilden. „Ging“, „gegangen“ und „geht“ auf „gehen“ zurückführen, damit die Zählung sie zusammenfasst. Die Dokumentation beschreibt den zugrunde liegenden Vorgang so:
Wortart bestimmen. Für jedes Wort festlegen, ob es Substantiv, Verb oder Adjektiv ist. In Tiefe 3 steht, warum gerade dieser Schritt der Kette gefährlich wurde.
Eigennamen finden. Personen, Orte und Firmen aus dem Fließtext ziehen. Diese Aufgabe gibt es weiterhin als eigenes Werkzeug:
Woran Sie ein Verfahren dieser Art erkennen
Zählt es Wörter? Dann kennt es keine Reihenfolge, und Verneinungen fallen durch.
Braucht es je Aufgabe eigenes Material? Übersetzen, Zusammenfassen und Einordnen waren getrennte Verfahren mit getrennten Datensammlungen.
Nennt es die Wortart oder die Grundform? Dann läuft dahinter eine Kette von Schritten, und jeder davon kann fehlgehen.
Alle drei Merkmale beschreiben eine Welt, in der ein System aus vielen austauschbaren Teilen bestand. Was daraus wurde, steht in Tiefe 2.
Tiefe 1 hat die Bausteine genannt. Hier stehen ihre Grenzen, und die eine Stelle, an der die Epoche zu Ende ging.
Wie weit der Kontext eines Verfahrens reichte
Die Verfahren dieser Zeit sahen nie den ganzen Text an. Sie sahen ein Fenster an, meistens wenige Wörter breit. Der Fachausdruck dafür ist n-Gramm, und das Lehrbuch zur gebräuchlichsten Programmbibliothek beschreibt ihn am Beispiel der Wortartbestimmung:
Bei n gleich drei sieht ein solches Verfahren also das aktuelle Wort und die Etiketten der zwei davor. Alles weiter zurück liegt außerhalb.
Diese Grenze war hart und wurde bewusst gesetzt:
Der Grund für die Enge ist eine Rechnung. Bei einem Wortschatz von zehntausend Wörtern gibt es hundert Millionen mögliche Wortpaare und eine Billion mögliche Dreiergruppen. Die allermeisten davon kommen in keinem noch so großen Textbestand vor, und ein Verfahren, das Häufigkeiten zählt, hat für sie keine Zahl. Jedes Wort mehr an Reichweite multipliziert den Bedarf an Material mit der Größe des Wortschatzes.
Was ein heutiges Modell an dieser Stelle anders macht, steht in Grundkurs, Kapitel 02.
Übersetzen durch Zählen
Die maschinelle Übersetzung war die Aufgabe, an der sich diese Epoche gemessen hat, und sie kam ohne Grammatikregeln aus. Die Verfahren zählten, welche Wortgruppen in zweisprachigen Textsammlungen einander gegenüberstanden, und setzten die Übersetzung daraus zusammen.
Wie gut das war, steht in der Arbeit, die es 2014 ablöste, als Vergleichswert:
Der neue Weg lag knapp darüber:
the translations produced by the LSTM achieve a BLEU score of 34.8 on the entire test set (externe Seite, arxiv.org) Die Zahl ist der Punkt: Nach zwanzig Jahren Arbeit an Wortgruppenstatistik holte ein Verfahren ohne jede sprachliche Vorgabe im ersten Anlauf denselben Wert.
Wichtig ist dabei, was diese Zahlen messen. BLEU vergleicht die maschinelle Übersetzung mit einer menschlichen, indem es übereinstimmende Wortgruppen zählt. Es ist damit selbst ein Verfahren aus dieser Epoche und misst die Nähe zu einer Vorlage statt der Verständlichkeit.
Die Gewichtung, die bis heute arbeitet
Die Frage, wie schwer ein einzelnes Wort wiegen soll, hat das Fach zwei Jahrzehnte beschäftigt. Ein Bericht von 1987 fasst den Stand zusammen und benennt, woran alles hängt:
Was er dazu liefert, beschreibt er selbst zurückhaltend:
Aus dieser Arbeit stammt die Gewichtung, die heute TF-IDF heißt und in jeder Volltextsuche steckt. Sie ist der Teil dieser Epoche, der die Sprachmodelle überlebt hat, und in der Suche über eine Wissensbasis arbeitet sie neben dem Vergleich von Zahlenreihen; siehe Agenten und Harness, Kapitel 03.
Was das Zählen nie hinbekommen hat
Zwei Sachen liegen außerhalb dessen, was eine Zählung leisten kann, und beide stehen in den Dokumentationen der heutigen Programmbibliotheken.
Die erste ist die Reihenfolge:
Für ein Verfahren, das Wörter zählt, sind beide Sätze identisch. Die zweite Sache folgt daraus und ist im Betrieb teurer: die Verneinung. „Der Vertrag wurde gekündigt“ und „Der Vertrag wurde nicht gekündigt“ unterscheiden sich in einem einzigen Wort, das für sich genommen in fast jedem Dokument vorkommt und deshalb kaum Gewicht bekommt. Genau dieses Beispiel führt Grundkurs, Kapitel 04 für die heutigen Verfahren weiter, wo dieselbe Schwäche in abgeschwächter Form fortbesteht.
Ein Ausweg der damaligen Zeit bestand darin, Wortpaare statt einzelner Wörter zu zählen. Damit wandert die Reihenfolge in kleinem Umfang zurück in die Rechnung, und die Zahl der möglichen Merkmale wächst um den Faktor des Wortschatzes.
Der Bruch liegt bei der Darstellung
Der Übergang zu den heutigen Verfahren lässt sich an einer Stelle festmachen, und es ist weder die Rechenleistung noch die Datenmenge. Es ist die Frage, was ein Wort für das Verfahren überhaupt ist.
Beim Zählen ist ein Wort eine Spalte. „Hund“ und „Katze“ stehen in zwei verschiedenen Spalten und haben miteinander so viel zu tun wie „Hund“ und „Buchhaltung“, nämlich nichts. Jede Ähnlichkeit zwischen Wörtern musste in einem Wörterbuch stehen, das jemand gepflegt hat.
Ab 2013 bekam jedes Wort stattdessen eine Reihe von Zahlen, die aus seiner Umgebung im Text gelernt wurde. Ähnliche Wörter landen dort nahe beieinander, ohne dass jemand die Ähnlichkeit eingetragen hätte. Wie das gerechnet wird, steht in Grundkurs, Kapitel 04.
Damit fielen zwei Sachen zugleich weg: das gepflegte Wörterbuch und die Notwendigkeit, für jede Aufgabe von vorn anzufangen.
Die Kette und das eine Modell
Bis dahin war ein Sprachsystem eine Kette: zerlegen, Grundformen bilden, Wortarten bestimmen, Satzbau zerlegen, Eigennamen finden, und erst dann die eigentliche Aufgabe. Jeder Schritt hatte eigenes Trainingsmaterial und eigene Fehlerquoten. Das Lehrbuch beschreibt die Anordnung so:
Diese Kette verschwand mit einem Ansatz, der ausdrücklich auf Annahmen über die Sprache verzichtet:
Das dabei benutzte Netz war ein rekurrentes, und einer seiner beiden Erfinder hat 2024 selbst beschrieben, wie weit diese Bauform getragen hat:
Und wo sie den Anschluss verlor:
Die Zwischenstufe zwischen Kette und Transformer dauerte damit etwa drei Jahre. Was danach kam, steht in Kapitel 03.
Was daraus für die Praxis folgt
Drei Beobachtungen aus dieser Epoche gelten weiter.
Eine Kette multipliziert ihre Fehler. Wer heute mehrere Modellaufrufe hintereinanderschaltet, baut dieselbe Anordnung neu; die Rechnung dazu steht in Grundkurs, Kapitel 09.
Das Zählen von Wörtern ist billig und robust. Es braucht kein Training, keine Grafikkarte und liefert nachvollziehbare Ergebnisse. Für eine Suche über zehntausend Dokumente ist es oft die richtige Wahl.
Eine Kennzahl aus dieser Zeit misst die Nähe zu einer Vorlage. BLEU und verwandte Maße vergleichen mit einer menschlichen Musterlösung und sagen wenig darüber, ob ein Text brauchbar ist.
Die Epoche endete nicht daran, dass ihre Verfahren zu ungenau gewesen wären. Sie endete an einer Eigenschaft ihres Aufbaus, und die lässt sich an einem einzigen Arbeitsschritt zeigen.
Eine Zwischenstufe entscheidet, und die Entscheidung bleibt
Die Wortartbestimmung ist eine Einordnung wie jede andere. Das Lehrbuch sagt das ausdrücklich und nennt zugleich, worauf sie sich stützt:
Entscheidend ist die Form des Ergebnisses. Am Ende dieses Schrittes steht ein Etikett, also ein einzelner Wert aus einer festen Liste. Die Alternativen, die das Verfahren erwogen hat, sind danach verschwunden, samt der Sicherheit, mit der es sich entschieden hat.
Der nächste Schritt in der Kette sieht nur noch das Etikett. Ein Satz wie „Die Leiter fiel um“ ist an dieser Stelle mehrdeutig, und wer sich auf die falsche Lesart festgelegt hat, kann sie später nicht zurücknehmen. Der Satzbau-Zerleger dahinter bekommt keine Gelegenheit, die Entscheidung zu überstimmen, weil er den ursprünglichen Satz gar nicht mehr sieht.
Dieselbe Figur steht am Anfang und am Ende der gesprochenen Sprache: Im klassischen Erkenner legt sich das akustische Modell auf einen Laut fest (Kapitel 07), und in der Sprachausgabe schreibt ein Mel-Spektrogramm die Betonung fest, bevor irgendetwas klingt (Kapitel 08).
Genau das ist der Unterschied zu einem heutigen Modell, in dem die Mehrdeutigkeit bis zum Ende als Verteilung mitläuft. Dass sich Fehler entlang einer Kette vervielfachen, ist dabei die schwächere Aussage und in Grundkurs, Kapitel 09 durchgerechnet. Die stärkere ist die hier: Die Information, die eine spätere Korrektur ermöglicht hätte, existiert nach dem Schritt nicht mehr.
Das Zählen ist nicht verschwunden
Die Gewichtung eines Wortes nach seiner Seltenheit arbeitet bis heute in jeder Volltextsuche. In der Suche über eine Wissensbasis steht sie ausdrücklich neben dem Vergleich von Zahlenreihen, und die Kombination aus beidem gilt als der bessere Weg; die Messungen dazu stehen in Agenten und Harness, Kapitel 03.
Der Grund für dieses Nebeneinander liegt in einer Stärke, die dem gelernten Vergleich fehlt. Ein gezähltes Wort ist ein gefundenes Wort. Wer nach einer Artikelnummer, einem Eigennamen oder einer selten benutzten Fachbezeichnung sucht, will genau diese Zeichenfolge finden, und ein Verfahren, das Ähnlichkeiten lernt, liefert dann ähnliche statt gleicher Treffer.
Die Vorarbeiten aus Tiefe 1 gibt es ebenfalls weiterhin, allerdings als eigenständige Werkzeuge statt als Pflichtstufen einer Kette. Die Eigennamenerkennung ist der Fall, der am häufigsten überlebt hat, und die Dokumentation nennt, was ein solches Werkzeug ohne eigenes Training kennt:
Für das Anonymisieren großer Textbestände ist das nach wie vor der günstigere Weg, weil er ohne Modellaufruf je Dokument auskommt.
Warum das rekurrente Netz die Kette nicht auflöste
Die Bauform, die 2014 die Übersetzung übernahm, stammt aus den 1990er Jahren. Ihr Erfinder beschreibt den Kern so:
Der Aufbau der Übersetzungsarbeit von 2014 bestand aus zwei solchen Netzen:
Der Engpass steckt in der Mitte dieses Satzes. Der ganze Ausgangssatz muss in einen Vektor fester Länge passen, bevor die Übersetzung beginnt, und diese Länge ist dieselbe für einen Satz mit fünf Wörtern und einen mit fünfzig.
Erstaunlicherweise fiel das weniger ins Gewicht als erwartet:
Additionally, the LSTM did not have difficulty on long sentences. (externe Seite, arxiv.org)
Der Satz steht im Abstract, weil das Gegenteil erwartet worden war. Behoben wurde der Engpass trotzdem, und zwar im selben Jahr durch einen Zusatz, der dem zweiten Netz erlaubt, sich die passende Stelle im Ausgangssatz selbst zu suchen. Dieser Zusatz ist die Aufmerksamkeit, drei Jahre bevor sie allein genügte; die Geschichte steht in Kapitel 03.
Was die rekurrente Bauform in der Sache nicht auflöste, ist ihre serielle Arbeitsweise. Sie liest ein Element nach dem anderen, womit sich das Training schlecht auf viele Rechenwerke verteilen lässt. Genau daran verlor sie den Anschluss:
Was mit den Fächern verlorenging
Die alte Kette hatte eine Eigenschaft, die selten genannt wird: Jeder ihrer Schritte war einzeln messbar. Für die Wortartbestimmung gab es Datensätze mit hinterlegten Etiketten, für die Eigennamenerkennung ebenfalls, und die Ergebnisse waren über Jahre hinweg vergleichbar.
Ein heutiges Sprachmodell erledigt dieselben Aufgaben nebenbei und ohne sie zu benennen. Damit fällt die Zwischenmessung weg, und übrig bleibt die Bewertung des Gesamtergebnisses. Welche Schwierigkeiten das mit sich bringt, steht in Beurteilen und Einordnen, Kapitel 04.
Der praktische Verlust zeigt sich bei der Fehlersuche. Wenn eine Kette ein falsches Ergebnis liefert, lässt sich der Schritt finden, an dem es kippte. Bei einem einzelnen Modellaufruf gibt es diesen Ort nicht, und die Antwort auf die Frage nach dem Grund ist selbst wieder eine erzeugte Ausgabe.
Ein Teil des Fachs hat darauf mit einer Rückkehr reagiert: Wer heute eine Aufgabe in Teilschritte zerlegt und jeden einzeln prüfbar macht, baut die alte Kette mit neuen Bausteinen. Der Unterschied liegt darin, dass die Zwischenergebnisse in Prosa vorliegen statt als Etikett aus einer festen Liste.
Was daraus nicht folgt
Die alten Verfahren waren deshalb keine Sackgasse. Die Gewichtung nach Seltenheit, die Eigennamenerkennung und die Zerlegung in Wörter arbeiten weiter, teils als eigenständige Werkzeuge, teils in den Sprachmodellen selbst.
Der Bruch lag nicht an der Rechenleistung allein. Er lag an der Darstellung: Ein Wort wurde von einer Spalte in einer Zähltabelle zu einer gelernten Zahlenreihe. Die Rechenleistung machte diesen Schritt bezahlbar.
Eine Kette bleibt ein brauchbares Muster. Gescheitert ist diese eine an Zwischenstufen, die eine Entscheidung erzwingen und die Alternativen wegwerfen. Wer diese Eigenschaft vermeidet, kann weiterhin in Schritten arbeiten.
Quellen
7 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Lane, Hay, Schwarz, Berry und Shrager berichten 2025, wie sie einen Originalausdruck von ELIZA in Joseph Weizenbaums Nachlass am MIT fanden und das Programm auf einem nachgebauten Rechner jener Zeit wieder zum Laufen brachten. Diese Quelle steht hier auch stellvertretend für Weizenbaums Arbeit von 1966: Deren Verlagsseite weist jeden Abruf ab, ein Zitat daraus wäre also dauerhaft ungeprüft.
Dokumentationerreichbar
scikit-learn, Feature extraction (externe Seite, scikit-learn.org)
scikit-learn.orggeprüft 24.09.2026
Die Dokumentation beschreibt im Wortlaut, wie aus einer Sammlung von Texten Zahlenreihen werden: zerlegen, zählen, gewichten. Sie benennt dabei die Eigenschaft, an der dieses Verfahren seine Grenze hat, nämlich dass die Stellung der Wörter im Text vollständig entfällt.
Dokumentationerreichbar
spaCy, Linguistic Features (externe Seite, spacy.io)
spacy.iogeprüft 24.09.2026
Die Dokumentation der heute gebräuchlichsten Programmbibliothek für Sprachverarbeitung. Sie beschreibt die Arbeitsschritte, die vor den Sprachmodellen jede Anwendung selbst erledigen musste: zerlegen, Grundformen bilden, Wortarten bestimmen, Eigennamen finden.
Dokumentationerreichbar
nltk.orggeprüft 24.09.2026
Das Lehrbuch zur Programmbibliothek NLTK, das die klassische Verarbeitungskette Schritt für Schritt vorführt. Kapitel 5 ordnet die Wortartenbestimmung als zweiten Schritt hinter der Zerlegung ein und beschreibt sie als Einordnung, deren Entscheidung an jeder Stelle vom Umfeld abhängt.
Originalarbeiterreichbar
Sequence to Sequence Learning with Neural Networks (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Sutskever, Vinyals und Le zeigen 2014, dass sich eine Wortfolge ohne jede Grammatikregel in eine andere übersetzen lässt, indem ein Netz sie in einen Vektor fester Länge presst und ein zweites daraus wieder Text macht. Die Arbeit nennt den Vergleichswert des damals üblichen statistischen Verfahrens und ist damit der Beleg für beide Epochen in einem Satz.
Originalarbeiterreichbar
Term Weighting Approaches in Automatic Text Retrieval (externe Seite, ecommons.cornell.edu)
ecommons.cornell.edugeprüft 24.09.2026
Gerard Salton und Chris Buckley fassen 1987 zwanzig Jahre Arbeit an der Frage zusammen, wie schwer ein einzelnes Wort in einem Text wiegen soll. Der Bericht ist die Herkunft der Gewichtung, die heute als TF-IDF bekannt ist. Im Abstract fehlt einmal ein Leerzeichen zwischen zwei Wörtern, der erste Satz ist deshalb nicht zitierfähig.
Originalarbeiterreichbar
xLSTM: Extended Long Short-Term Memory (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Sepp Hochreiter, einer der beiden Urheber des LSTM von 1997, ordnet 2024 die eigene Bauform selbst ein: was sie leistete, wofür sie stand und woran sie den Anschluss verlor. Diese Quelle steht hier auch für die Arbeit von 1997, deren Verlagsseite jeden Abruf abweist.