Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenGrundkursKapitel 03von 16 im Pfad

Token, die Bausteine der Sprache

Tiefe 1: Überblick · Lesezeit 6 Min. · Stand

Ein Sprachmodell liest keine Wörter. Es liest Token. Das klingt nach einer Kleinigkeit für Fachleute, erklärt aber eine ganze Reihe von Dingen, über die Anwender sonst stolpern: warum ein deutscher Text mehr kostet als der gleiche englische, warum ein Modell Buchstaben nicht zuverlässig zählen kann, und warum irgendwann mitten in einem langen Gespräch der Anfang verloren geht.

Probieren Sie es aus

Die folgenden Beispiele sind nicht geschätzt. Sie wurden mit dem echten Vokabular zerlegt, das die GPT-4o-Familie verwendet.

Zum Ausprobieren

Dieses Element zum Ausprobieren braucht JavaScript. Der Text davor und danach erklärt dieselbe Sache ohne Mitmachen.

Ein paar Dinge fallen sofort auf.

Beim Alltagssatz passt fast jedes Wort in genau ein Token. So sieht der Normalfall aus, und deshalb kommt man mit der groben Faustregel „ein Token ist ungefähr ein Wort“ im Englischen ziemlich weit.

Beim Fachbegriff kippt das. „Künstliche Intelligenz“ braucht sechs Token, „artificial intelligence“ zwei. Beides ist derselbe Begriff, aber das Vokabular kennt die englische Schreibweise als Ganzes und die deutsche nicht.

Beim langen Wort wird es deutlich. Ein deutsches Kompositum zerfällt in Bruchstücke, die für sich genommen nichts bedeuten. Das Modell setzt daraus trotzdem einen Sinn zusammen, es hat nur mehr Arbeit damit.

Warum das im Alltag zählt

Deutsch kann teurer werden. Abgerechnet wird nach Token, nicht nach Wörtern. Wie groß der Aufschlag ausfällt, hängt vom Text ab. In den drei Beispielen oben, die es in beiden Sprachen gibt, reicht die Spanne von gleichauf beim Alltagssatz bis zum Doppelten beim langen Wort. Wer regelmäßig größere Mengen verarbeitet, sollte den eigenen Text einmal messen statt zu schätzen, dafür gibt es die Werkzeuge weiter unten.

Der Platz ist begrenzt. Jedes Modell hat ein Kontextfenster, gemessen in Token. Alles, was zusammen hineinpasst: die Anweisung, die angehängten Dokumente, der bisherige Gesprächsverlauf und die Antwort. Ist es voll, fällt der Anfang heraus.

Zeichen sind unsichtbar. Das Modell sieht das Token „·Katze“, nicht die fünf Buchstaben darin. Fragen nach Buchstabenzahlen, Reimen oder dem dritten Zeichen von hinten treffen deshalb auf eine Wahrnehmung, die diese Ebene gar nicht hat. Die bekannten Fehlschläge bei solchen Aufgaben sind eine Folge der Zerlegung.

Mit eigenem Text nachsehen

Das Modul oben hat feste Beispiele, weil die Zerlegung beim Bauen dieser Seite entstanden ist. Im Browser wird dafür nichts gerechnet. Für eigenen Text gibt es zwei Werkzeuge, die im Browser laufen und nichts kosten:

Tiktokenizer (externe Seite, tiktokenizer.vercel.app) ist das genauere von beiden. Oben links wählt man das Modell, etwa gpt-4o. Man tippt Text ins Feld und sieht sofort die Zerlegung farbig markiert, dazu die Zahl der Token. Der Schalter „Show whitespace“ macht Leerzeichen sichtbar, was den Aha-Moment liefert: das Leerzeichen gehört zum Token. Lohnende Versuche sind der eigene Name, eine E-Mail-Adresse, eine Telefonnummer, ein Codeschnipsel und derselbe Satz einmal auf Deutsch und einmal auf Englisch.

Der Tokenizer von OpenAI (externe Seite, platform.openai.com) ist schlichter und zeigt neben der Zerlegung auch die Nummern, die jedes Token im Vokabular hat. Für den ersten Eindruck reicht er.

Beide zeigen nur die Vokabulare von OpenAI. Andere Anbieter zerlegen anders, die Größenordnung bleibt aber vergleichbar.

Was danach passiert

Mit dem Token ist die Kette noch nicht zu Ende. Jedes bekommt anschließend eine lange Zahlenreihe zugeordnet, und erst mit diesen Zahlen rechnet das Modell. Darum geht es in Kapitel 04.

Quellen

4 Einträge, davon 1 Schlüsselarbeitalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Attention Is All You Need (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Arbeit, mit der alles anfing. Vaswani und sieben Mitautoren stellen am 12.06.2017 die Transformer-Architektur vor und zeigen, dass ein Netz allein über den Mechanismus der Aufmerksamkeit auskommt, ohne die bis dahin übliche schrittweise Verarbeitung. Erst dadurch ließen sich Modelle sinnvoll auf viele Rechenkerne verteilen. Jedes GPT, jedes Claude und jedes Gemini steht auf dieser Arbeit. Abschnitt 3.2.3 hält die Einschränkung fest, die für alle fortsetzenden Modelle gilt: „self-attention layers in the decoder allow each position in the decoder to attend to all positions in the decoder up to and including that position“, dazu die Begründung „We need to prevent leftward information flow in the decoder to preserve the auto-regressive property“. Beide Stellen stehen im Volltext und sind deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.

    Archivfassung (externe Seite, web.archive.org)

  • Werkzeugerreichbar

    Tiktokenizer (externe Seite, tiktokenizer.vercel.app)

    tiktokenizer.vercel.appgeprüft 24.09.2026

    Zeigt im Browser, in welche Token ein beliebiger Text zerfällt. Modell oben links wählen, Text eintippen, den Schalter für Leerzeichen einschalten. Läuft vollständig lokal, es wird nichts hochgeladen.

  • Werkzeugerreichbar

    Tokenizer von OpenAI (externe Seite, platform.openai.com)

    platform.openai.comgeprüft 24.09.2026

    Schlichter als der Tiktokenizer, zeigt dafür zusätzlich die Nummer, die jedes Token im Vokabular hat. Gut für den ersten Eindruck.

  • Originalarbeiterreichbar

    Neural Machine Translation of Rare Words with Subword Units (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Sennrich, Haddow und Birch übertragen 2015 das Byte Pair Encoding aus der Datenkompression auf Sprache. Damit war das Problem seltener Wörter gelöst, und damit stand die Form fest, in der heutige Modelle Text zerlegen: in Stücke unterhalb der Wortgrenze. Der Algorithmus selbst hat Konkurrenz bekommen, das Prinzip ist geblieben.

    Archivfassung (externe Seite, web.archive.org)

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.