GrundlagenGrundkursKapitel 08von 16 im Pfad
Was ein Modell weiß, und woher
In Kapitel 07 ging es darum, woran Sie eine erfundene Angabe erkennen. Hier steht einer der Gründe, warum es überhaupt so weit kommt: Das Wissen eines Modells hat ein Ende, und das Modell merkt es von allein nicht.
Alles, was es weiß, hat es einmal gelesen
Das Training ist ein abgeschlossener Vorgang. Über Monate läuft Material durch ein sehr großes Rechenwerk, und am Ende steht eine Datei mit Zahlen. Diese Zahlen heißen Gewichte, und sie sind der gelernte Teil des Modells. Was sonst noch dazugehört, damit daraus Antworten werden, steht in Kapitel 01.
An dieser Datei ändert Ihr Gespräch nichts. Auch nicht, wenn Sie stundenlang mit ihm arbeiten, es korrigieren, ihm etwas beibringen. Was im Gespräch wie Lernen aussieht, ist Lesen: Alles, was Sie schreiben, steht im Kontext dieser einen Anfrage. Schließen Sie das Fenster, ist es weg.
Der Hersteller kann die Zahlen sehr wohl ändern, und er tut es. Ein Modell bekommt Nachfolger, und es gibt Verfahren, die eine vorhandene Datei auf eigene Beispiele abstimmen (Beurteilen und Einordnen, Kapitel 02). Beides geschieht außerhalb Ihres Gesprächs und dauert länger als eines.
Das Modell selbst hat also nie etwas gespeichert, das es vergessen könnte. Die Anwendung darum herum kann es durchaus, und die Werkzeuge fürs Arbeiten tun es an mehreren Stellen: in einer Projektanweisung, in eigenen Notizen, in einer Wissensbasis daneben. Welche Orte das sind und wer sie füllt, steht in Vibe-Coding / Agentic Engineering, Kapitel 05. Wo es diese Orte nicht gibt, erklären Sie dieselbe Sache in jedem neuen Chat erneut.
Der Stichtag
Irgendwann endet der Text, der ins Training ging. Dieser Zeitpunkt heißt Knowledge Cutoff, und die Anbieter geben ihn an. Drei Beispiele, abgerufen am 31.07.2026:
| Modell | Knowledge Cutoff |
|---|---|
| Claude Opus 5 | Mai 2026 |
| GPT-5.6 | 16. Februar 2026 |
| Gemini 3.6 Flash | März 2026 |
Diese Zahlen veralten schnell, das Verfahren dahinter nicht. Für alles, was danach geschah, taugt keines der drei Modelle als Auskunft: kein Wahlergebnis, kein neues Gesetz, keine Version einer Software, die seither erschienen ist. Und was noch wichtiger ist: keine Korrektur an etwas, das es vorher gelesen hat.
Eine Mauer ist der Stichtag dabei nicht. Einzelnes von danach kann durchaus dastehen, aus Gründen, die in der dritten Tiefe stehen. Als Zusicherung taugt er in beide Richtungen wenig.
Warum das Modell es selbst nicht weiß
Naheliegend wäre, einfach zu fragen. „Bis wann reichen deine Daten?“ Sie bekommen darauf eine Antwort, oft mit Monat und Jahr, und sie klingt, als käme sie aus dem Modell.
Bei den Claude-Modellen kommt sie nachweislich von außen. Anthropic veröffentlicht deren Systemanweisungen im Wortlaut, und dort steht der Stichtag als Vorgabe, wie jede andere Anweisung auch. In der Systemanweisung zu Claude Opus 5 (externe Seite, platform.claude.com) heißt es, das verlässliche Wissen reiche bis Ende Mai 2026, und darüber hinaus könne Claude nicht verlässlich antworten.
Der Text geht weiter und regelt gleich mit, was das Modell tun soll, wenn eine Frage jenseits davon liegt: Es soll sagen, dass es das so oder so nicht wissen kann, und auf die Websuche verweisen.
Damit ist die Frage nach dem Stichtag keine Frage an das Modell. Sie ist eine Frage an den Zettel, den ihm jemand hingelegt hat. Wer wissen will, wo solche Zettel sonst noch hängen, findet das in Kapitel 05.
seitlich verschiebbar
eigene Darstellung, Stand 31.07.2026
Drei Wege, wie Neues hineinkommt
Wenn das Modell nichts dazulernt, wie kommt es dann an Aktuelles? Von Ihrer Seite aus auf drei Arten, und alle drei laufen über dieselbe Stelle.
Sie schreiben es hin. Der direkteste Weg. Was in Ihrer Frage steht, ist da.
Sie geben eine Datei mit. Ein Dokument, eine Tabelle, ein Bild. Meist liest die Anwendung den Text aus und legt ihn dazu. Bei Bild und Ton geht es auch ohne diesen Umweg: Was ein Modell auf einem Bild sieht und was ein PDF dabei kostet, steht in Kapitel 13, der eigene Weg des Tons in Conversational AI, Kapitel 02.
Die Anwendung schlägt nach. Websuche, eine Firmenablage, eine Datenbank. Ein Programm sucht, findet, und schiebt das Gefundene in dieselbe Anfrage.
Der dritte Weg ist der, den man am ehesten für Zauberei hält. Er ist es am wenigsten: Das Modell surft nicht. Ein Programm sucht, und was es findet, steht dann in der Anfrage, als hätten Sie es selbst hineinkopiert.
Eine Quelle liegt außerhalb dieser drei, und Sie haben sie eine Überschrift weiter oben schon gesehen: die Anweisung des Anbieters, in der bei Claude der Stichtag steht. Sie füllt dieselbe Stelle, nur schreibt dort jemand anders.
Alle drei enden im Kontext. Keiner erreicht die Gewichte. Deshalb ist alles Nachgeschlagene beim nächsten Gespräch wieder weg, und deshalb belegt es jedes Mal aufs Neue Platz im Fenster. Was die Gewichte erreicht, ist ein Verfahren für sich, und darum geht es in Beurteilen und Einordnen, Kapitel 02.
Woran Sie es merken
Ein Modell sagt selten von sich aus „das war nach meiner Zeit“. Es antwortet lieber, und zwar in derselben ruhigen Tonlage wie sonst. Drei Anlässe, bei denen sich Nachsehen lohnt:
Sie fragen nach etwas Frischem. Ein Produkt von letzter Woche, eine Personalie, eine Version. Hier fehlt dem Modell die Grundlage am ehesten, und hier ist es am schnellsten geprüft.
Die Antwort nennt eine Version oder ein Datum. Beides veraltet, und beides klingt nachgeschlagen, auch wenn es das nicht ist.
Es steht kein Beleg dabei. Kam die Auskunft aus einer Suche, steht meist eine Fundstelle daneben. Fehlt sie, ist die Herkunft offen: aus den Gewichten, aus Ihrer eigenen Frage oder aus einer Suche, die ihre Fundstellen für sich behält. Nur im ersten Fall ist die Angabe so alt wie das Training, und welcher Fall vorliegt, sagt die Antwort selten.
Wo das keine Rolle spielt
Bei allem, was nicht vom Kalender abhängt, ist der Stichtag gleichgültig. Ein Text soll umformuliert, eine Gliederung geordnet, eine Rechtschreibung geprüft, eine Idee weitergedacht werden: Dafür braucht es keine Nachrichten von gestern. Die Frage nach dem Wissensstand stellt sich dort, wo eine Antwort etwas über die Welt behauptet.
Ein Stichtag klingt nach einer Linie im Kalender. In den Angaben der Anbieter ist er das an keiner Stelle.
Zwei Stichtage, nicht einer
Anthropic führt in der Modellübersicht zwei Zeilen und definiert beide in der Legende darunter (externe Seite, platform.claude.com): Der verlässliche Knowledge Cutoff ist der Tag, bis zu dem das Wissen des Modells am umfangreichsten und verlässlichsten ist. Der Trainingsdaten-Stichtag ist die weitere Spanne der verwendeten Daten.
Bei manchen Modellen fallen beide zusammen, bei anderen liegen Monate dazwischen. Der deutlichste Fall im Stand vom 31.07.2026 ist Claude Sonnet 4.5:
| Verlässlich bis | Trainingsdaten bis | |
|---|---|---|
| Claude Sonnet 4.5 | Januar 2025 | Juli 2025 |
| Claude Haiku 4.5 | Februar 2025 | Juli 2025 |
| Claude Opus 4.6 | Mai 2025 | August 2025 |
Ein halbes Jahr Text ist ins Training gegangen, ohne dass der Hersteller dafür geradesteht. Diese Lücke ist die Angabe selbst: Material am Ende des Trainings ist dünner, weil das Netz die Welt noch nicht eingeholt hat. Ein Ereignis vom Mai ist im Juli in ein paar Meldungen beschrieben. Ein Ereignis von vor drei Jahren steht in Büchern, Analysen, Streitschriften und tausend Kommentaren.
Das Wissen endet nicht überall gleichzeitig
Google sagt für Gemini 3.6 Flash zunächst das Erwartbare:
The knowledge cutoff date for Gemini 3.6 Flash is March 2026 (externe Seite, deepmind.google)
Und dann, im selben Satz, die Einschränkung:
Vierzehn Monate Unterschied, je nachdem, wonach Sie fragen. Welche Gebiete gemeint sind, steht nicht dabei. Für die Praxis heißt das: Der veröffentlichte Stichtag ist die günstigste Auslegung, nicht der Durchschnitt.
Dass es die Anbieter selbst uneinheitlich halten, zeigt sich sogar innerhalb eines Hauses. Anthropics Hilfeartikel für Endnutzer nennt für Haiku 4.5 den Juli 2025 und meint damit die Trainingsdaten. Die Entwicklerdokumentation führt für dasselbe Modell den Februar 2025 als verlässlich. Beide Seiten sind richtig, sie reden über verschiedene Dinge, und der Hilfeartikel (externe Seite, support.claude.com) sagt nicht, über welches.
Was in den Daten steckt
Woraus die Gewichte entstanden sind, beschreiben die drei großen Anbieter unterschiedlich ausführlich. Der Vergleich ist die eigentliche Auskunft.
Googles Modellkarte zu Gemini 3 Pro zählt im Abschnitt Training Dataset sieben Herkünfte einzeln auf: frei herunterladbare Datensätze, Material von Suchprogrammen, lizenzierte Daten aus Verträgen, Daten aus der Nutzung von Google-Produkten, weitere im Geschäftsbetrieb erworbene oder erzeugte Bestände, Daten von der eigenen Belegschaft und maschinell erzeugte Daten. Die Karte sagt dazu, dass sie mehr offenlege als frühere.
OpenAI (externe Seite, arxiv.org) braucht dafür einen Satz und nennt drei: öffentlich zugängliche Informationen aus dem Internet, Material von Partnern, und was Nutzer, Trainer und Forschende beisteuern oder erzeugen.
Bei Anthropic lässt sich der Wandel an derselben Seite ablesen. Für Sonnet 4.5 steht dort noch die lange Aufzählung, mit einem Punkt, der bei den anderen beiden so nicht vorkommt:
Für Sonnet 5 ist daraus eine kürzere Fassung geworden:
Aus fünf benannten Herkünften sind drei zusammengefasste geworden. Die eingewilligten Nutzerdaten fehlten in der Aufzählung, maschinell erzeugte Daten waren dazugekommen. Beim jüngsten Modell auf derselben Seite stehen Nutzerdaten wieder darin, ohne den Zusatz über die Einwilligung:
Was das über die Praxis dahinter aussagt, bleibt offen. Was es über die Auskunft aussagt, steht da: Die Formulierung wechselt von Modell zu Modell.
Seit dem Sommer 2026 haben sich zwei der drei Häuser bewegt, und zwar in verschiedene Richtungen. Zur Herkunft des Materials sagt OpenAIs jüngste Karte (externe Seite, deploymentsafety.openai.com) im zuständigen Abschnitt noch dies:
Eine andere Karte, in der mehr stünde, nennt sie nicht. Bei Google steht die Aufzählung weiterhin da, gebündelt an einer Stelle: Die Karte zu Gemini 3.1 Pro (externe Seite, deepmind.google) führt die Überschrift zum Trainingsdatensatz und schickt den Leser darunter weiter.
Dasselbe tut die Karte zu Gemini 3.8 Flash. Wer eine Angabe über die Trainingsdaten sucht, liest bei Google also die Basiskarte eines Zweigs statt der Karte zu dem Modell, das er tatsächlich benutzt. Welches Haus heute was veröffentlicht und ob es seine Karten überhaupt an einer Stelle auflistet, steht im Modellkarten-Verzeichnis. Wie man eine solche Karte liest, steht in Beurteilen und Einordnen, Kapitel 07.
Der Nachschub kostet Platz und Geld
Dass nachgeschlagene Inhalte im Kontext landen, ist keine Erklärhilfe. Anthropic schreibt es in der Dokumentation zum Suchwerkzeug aus:
Und die Abrechnung dazu:
Zwei Dinge stecken darin. Erstens wird jedes Suchergebnis vollständig geladen, auch der unpassende Teil. Zweitens wird es in jedem weiteren Gesprächszug erneut mitgeschickt und als Eingabe gezählt. Ein Modell, das dreimal sucht, schleppt drei Ergebnismengen durch den Rest des Gesprächs.
Wie viel Platz das braucht, steht in der Dokumentation zum Abrufwerkzeug (externe Seite, platform.claude.com): eine durchschnittliche Webseite von 10 Kilobyte entspricht rund 2.500 Token, eine Forschungsarbeit als PDF von 500 Kilobyte rund 125.000. Was das Kontextfenster ist und warum es knapp wird, steht in Kapitel 03.
Dieselbe Rechnung erklärt, warum Anbieter Wissen nicht einfach ins Modell nehmen: Ein Trainingslauf dauert Monate und kostet ein Vermögen, ein Suchergebnis kostet ein paar Cent und ist in zwei Sekunden da.
Das Wort „basic“ ist die halbe Auskunft
Im ersten Zitat steht eine Einschränkung, die leicht überliest, wer den Satz für die Beschreibung des Suchwerkzeugs hält. Der Rest davon steht im selben Absatz der Dokumentation:
Die Vollständigkeit ist damit eine Eigenschaft der älteren Tool-Fassung. Die neuere lässt Code über die Treffer laufen, bevor sie ankommen, und schickt weiter, was zur Frage passt. Anthropic begründet das mit der Ersparnis bei suchlastigen Anfragen (externe Seite, platform.claude.com).
An der Richtung ändert das nichts, der Nachschub landet weiterhin im Kontext. Es ist weniger davon, und ausgewählt hat vorher ein Programm, das das Modell selbst geschrieben hat. Wie ein Modell dazu kommt, Tools aufzurufen, steht in Kapitel 09.
Der praktische Schluss ist einer über Angaben: Eine Auskunft darüber, wie ein Suchwerkzeug arbeitet, gilt für eine Tool-Fassung. Die Versionsnummer steht in der Anfrage, und wer keine setzt, bekommt eine, die er sich nicht ausgesucht hat.
Was der Cache davon abzieht
„Jedes Mal neu“ ist dabei zu grob. Zwischengespeicherte Eingabe wird billiger abgerechnet, und beim Abrufwerkzeug hält der Anbieter die geholten Inhalte zusätzlich eine Weile vor:
Am Platz im Fenster ändert das nichts, dort steht der Text weiterhin. Was es am Preis ändert, steht in Kapitel 10, und was es beim Durchsatz ausmacht, in Kapitel 11. Die Kehrseite nennt dieselbe Seite: Der Cache liefert unter Umständen eine ältere Fassung der Seite, und wer die frische braucht, schaltet ihn für diesen Abruf ab.
Dieselbe Sache, drei Namen
Weil jeder Anbieter seine eigenen Begriffe pflegt, hier die Zuordnung. Die Stelle, an der das Gefundene ankommt, ist bei allen dieselbe. Wie es dorthin gelangt und wie viel davon, unterscheidet sich, siehe den Abschnitt über die Tool-Fassungen weiter oben.
| Anbieter | Heißt bei ihm | Was passiert |
|---|---|---|
| Anthropic | Web search tool, Web fetch tool | Ergebnis wird ins Kontextfenster geladen |
| OpenAI | File search, Web search | Nachschlagen ergänzt das mitgebrachte Wissen |
| Grounding with Google Search | Antwort wird in Suchergebnissen verankert |
OpenAI hat für den Unterschied, um den es in diesem Kapitel geht, einen eigenen Ausdruck. Die Dateisuche, heißt es dort, erlaube es, das dem Modell innewohnende Wissen zu ergänzen (externe Seite, developers.openai.com). Inherent knowledge steht im Original, und die Unterscheidung zwischen mitgebrachtem und mitgegebenem Wissen kommt damit vom Anbieter selbst. Google benennt in der Dokumentation zur Verankerung (externe Seite, ai.google.dev) den Knowledge Cutoff ausdrücklich als das, was mit der Suche überschritten wird.
Was das Nachschlagen nicht repariert
Ein Modell mit Suchzugriff wirkt gegen die Erfindungen aus Kapitel 07, und es wirkt begrenzt. Die Suche kann daneben greifen, und dann formuliert ein einwandfrei arbeitendes Modell eine falsche Auskunft aus einem falschen Beleg. Der Fehler ist dann nicht im Modell, er ist eine Reihe früher passiert und dort schwerer zu sehen.
Google stellt den Knowledge Cutoff deshalb in dieselbe Liste wie die Halluzinationen. In der Modellkarte zu Gemini 3 Pro (externe Seite, storage.googleapis.com) stehen beide unter Known Limitations, im selben Absatz. Der Stichtag ist dort keine Fußnote zur Aktualität, er zählt als bekannte Grenze des Modells.
Der Stichtag ist eine Angabe des Herstellers über sein eigenes Produkt. Wie alle solchen Angaben lohnt es, ihn daraufhin anzusehen, was er behauptet und was er offenlässt.
Er gilt in beide Richtungen nicht streng
Naheliegend wäre, den Stichtag als obere Schranke zu lesen: davor alles, danach nichts. Paleka, Goel, Geiping und Tramèr halten in einer Arbeit über die Bewertung von Sprachmodellen als Prognosewerkzeug dagegen:
Die Begründung im selben Abschnitt nennt den Weg, auf dem spätere Information hineinkommt:
Der Stichtag bezieht sich üblicherweise auf das Pre-Training. Was danach kommt, Fine-Tuning und Ausrichtung an menschlichen Bewertungen, wurde später erhoben und zeigt Spuren der Zeit dazwischen. Für die Autoren ist das ein methodisches Problem: Wer ein Modell Vergangenes vorhersagen lässt, um seine Prognosefähigkeit zu messen, kann sich auf den Stichtag als Trennlinie nicht verlassen.
Für den Alltag folgt daraus wenig, für die Bewertung von Messungen viel. Eine Prüfung, die auf „das kann das Modell nicht gewusst haben“ beruht, steht auf einer Zusicherung, die niemand gegeben hat.
Was die Angabe verschweigt
Kein Anbieter veröffentlicht, wie er den Stichtag bestimmt. Anthropic unterscheidet verlässliches Wissen von der Reichweite der Trainingsdaten und definiert beides (externe Seite, platform.claude.com), ohne ein Verfahren zu nennen. Was „most extensive and reliable“ heißt, ist damit eine Einschätzung und bleibt ohne Messwert.
Um daraus eine Zahl zu machen, bräuchte es vier Dinge. Erstens eine Menge von Fragen mit bekannter Antwort, gleichmäßig über die Zeit verteilt. Zweitens eine Festlegung, ab welcher Trefferquote Wissen als verlässlich gilt. Drittens eine Aufteilung nach Gebieten, denn Google räumt selbst ein, dass die Grenze je Gebiet verschieden liegt. Viertens die Trennung zwischen wirklichem Wissen und geratener Antwort, und die ist beim selben Verfahren schwierig, das Kapitel 07 beschreibt.
Nichts davon steht in den Angaben. Das macht sie nicht wertlos, es macht sie zu einer Selbstauskunft: nützlich als Größenordnung, ungeeignet als Grenzwert in einer Prüfvorschrift.
Der Nachschub verdrängt
Nachgeschlagenes landet im selben Fenster wie alles andere, und die Größenordnungen sind unangenehm. Anthropic nennt für eine Forschungsarbeit als PDF rund 125.000 Token (externe Seite, platform.claude.com). Bei einem Fenster von 200.000 bleiben danach 75.000 für Systemanweisung, Tool-Beschreibungen, Gesprächsverlauf und die eigentliche Frage.
Drei Folgen, die in Kapitel 05 ausführlicher stehen und hier zusammenlaufen:
Die Mitte wird schlechter berücksichtigt. Ein Dokument, das drei Viertel des Fensters füllt, hat sehr viel Mitte. Was in einem kurzen Prompt eine Randerscheinung ist, wird hier zur Regel.
Beim Überlaufen entscheidet die Anwendung. Ob der Anfang herausfällt, ob zusammengefasst wird, ob das Fenster geleert wird: Das ist eine Produktentscheidung, und sie wird selten angezeigt.
Jede weitere Runde zahlt erneut. Ein Suchergebnis wird in jedem folgenden Gesprächszug mitgeschickt. Drei Suchen in einem langen Gespräch sind kein einmaliger Aufwand.
Daraus folgt eine Bauregel, die dem naheliegenden Weg widerspricht: Mehr Nachschlagen macht die Antwort nicht sicherer. Ab einem gewissen Punkt macht es sie schlechter, weil das Nachgeschlagene die Anweisung verdrängt, die es einordnen sollte. Was hilft, ist genaueres Suchen und weniger Text davon.
Bei einem Anbieter ist diese Regel inzwischen ins Tool selbst gewandert. Die neueren Fassungen der Websuche lassen Code über die Treffer laufen, bevor sie ins Fenster kommen, und geben nur weiter, was zur Frage passt (externe Seite, platform.claude.com). Die Vorauswahl bleibt damit dieselbe Idee, nur trifft sie ein Programm, das dasselbe Modell im selben Durchgang geschrieben hat.
Wo die Anbieter auseinandergehen
Die drei Häuser geben unterschiedlich viel preis, und zwar nicht nur in der Ausführlichkeit.
| Stichtage je Modell | Angabe für jedes Modell | |
|---|---|---|
| Anthropic | zwei, getrennt definiert | ja |
| OpenAI | einer | ja, für die Frontier-Modelle |
| einer, mit Vorbehalt nach Gebiet | uneinheitlich |
Googles Uneinheitlichkeit ist belegbar: Die Karte zu Gemini 3.6 Flash nennt einen Stichtag samt Einschränkung, die Karte zu Gemini 3 Flash nennt gar keinen und verweist für alles auf die Karte zu Gemini 3 Pro (externe Seite, storage.googleapis.com), und Gemini 3.1 Pro nennt ebenfalls keinen.
Und innerhalb eines Hauses geht es ebenfalls auseinander. Anthropics Entwicklerdokumentation führt für Claude Haiku 4.5 zwei Daten, Februar 2025 und Juli 2025. Der Hilfeartikel (externe Seite, support.claude.com) für dieselben Modelle nennt einen einzigen Wert und wählt mal den einen, mal den anderen. Wer sich auf eine dieser Seiten beruft, sollte sagen, auf welche.
Was man daraus nicht schließen sollte
Ein späterer Stichtag ist kein Qualitätsmerkmal. Er sagt, wann der Text endete, und nichts darüber, wie gut das Modell damit umgeht. Ein Modell mit frischeren Daten kann in jeder anderen Hinsicht schwächer sein.
Ein Modell mit Suchzugriff ist auf eine Suche angewiesen und deshalb noch lange nicht aktuell. Die Suche hat ihre eigenen Fehler. Der Unterschied ist, wo der Fehler entsteht und wie sichtbar er ist: Ein falscher Beleg im Kontext sieht für das Modell aus wie ein richtiger.
Die Zahl in der Tabelle gibt die Auslegung des Herstellers wieder, keine Grenze im Kopf des Modells. In einem Fall liegt sie vierzehn Monate großzügiger als in bestimmten Gebieten. Wer die Grenze für eine eigene Anwendung braucht, misst sie selbst, mit eigenen Fragen aus dem eigenen Gebiet.
Quellen
13 Einträge, davon 2 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
Anthropic, System Prompts (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Anthropic veröffentlicht die Systemanweisungen der Claude-Modelle im Wortlaut. Im Prompt zu Claude Opus 5 vom 24.07.2026 steht der Knowledge Cutoff als Anweisung von außen: „Claude's reliable knowledge cutoff, past which it can't answer reliably, is the end of May 2026.“ Zwei Sätze weiter wird geregelt, was bei späteren Ereignissen zu tun ist, nämlich zu sagen, dass es das nicht wissen kann, und auf die Websuche zu verweisen. Der Stichtag kommt damit nicht aus dem Modell, er wird ihm mitgeteilt. Abgerufen am 31.07.2026.
SchlüsselarbeitDokumentationerreichbar
Anthropic, Web search tool (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Die Dokumentation zum Suchwerkzeug, die den Weg des Nachschubs technisch ausschreibt: Suchergebnisse werden in das Kontextfenster geladen und als Eingabe-Token abgerechnet, in jeder Suchrunde und in jedem weiteren Gesprächszug erneut. Damit ist belegt, dass nachgeschlagene Inhalte im Kontext landen statt im Modell.
Dokumentationerreichbar
Anthropic, Models overview (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Anthropics Übersicht aller Modelle mit Kontextfenster, Preis, Abschaltdatum und den zwei Stichtagen. Die Legende unter der Tabelle definiert beide: den verlässlichen Knowledge Cutoff als den Tag, bis zu dem das Wissen des Modells am umfangreichsten und verlässlichsten ist, und den Trainingsdaten-Stichtag als die weitere Spanne der verwendeten Daten. Ein Verfahren, wie der erste bestimmt wird, nennt die Seite nicht.
Dokumentationerreichbar
OpenAI, Models (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
OpenAIs Modellverzeichnis, das je Modell genau einen Knowledge Cutoff als eigenes Feld führt. Für die drei Stufen der Generation 5.6 steht dort der 16.02.2026. Eine Entsprechung zu Anthropics Zweiteilung in verlässliches Wissen und Trainingsdaten gibt es hier nicht, was selbst eine Auskunft über die Angabe ist. Abgerufen am 31.07.2026.
Dokumentationerreichbar
Anthropic, How up-to-date is Claude's training data? (externe Seite, support.claude.com)
support.claude.comgeprüft 24.09.2026
Der Hilfeartikel für Endnutzer, der die Stichtage der Claude-Modelle auflistet. Er weicht von der Entwicklerdokumentation desselben Hauses ab und vermischt dabei die beiden Stichtagsarten, die dort getrennt geführt werden. Für Haiku 4.5 nennt er Juli 2025, die Doku führt Februar 2025 als verlässlich und Juli 2025 als Trainingsdaten.
Originalarbeiterreichbar
Google DeepMind, Gemini 3.6 Flash Model Card (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Googles Modellkarte vom 21.07.2026, die den Knowledge Cutoff nennt und im selben Satz einschränkt, dass er nicht für alle Themengebiete gilt. In manchen Bereichen reiche das Wissen nur bis Januar 2025. Damit sagt ein Anbieter selbst, dass ein Stichtag keine Kante ist.
Dokumentationerreichbar
Anthropic's Transparency Hub (externe Seite, anthropic.com)
anthropic.comgeprüft 24.09.2026
Anthropics Transparenzseite, die je Claude-Modell die Herkunft der Trainingsdaten benennt. Der Vergleich zweier Generationen auf derselben Seite ist der eigentliche Fund. Für Sonnet 4.5 stehen fünf Herkünfte einzeln da, darunter „data from Claude users who have opted in to have their data used for training“. Für Sonnet 5 sind es drei zusammengefasste, die eingewilligten Nutzerdaten kommen darin nicht mehr vor, dafür maschinell erzeugte. Abgerufen am 31.07.2026. Beim jüngsten Modell auf derselben Seite, Claude Fable 5.1, stehen Nutzerdaten („user data“) wieder in der Aufzählung, ohne den Zusatz über die Einwilligung (abgerufen am 23.09.2026).
Originalarbeiterreichbar
Google DeepMind, Gemini 3 Pro Model Card (externe Seite, storage.googleapis.com)
storage.googleapis.comgeprüft 24.09.2026
Googles Modellkarte, Modellfreigabe November 2025, zuletzt geändert Mai 2026. Zwei Belegstellen: Der Abschnitt Known Limitations führt den Knowledge Cutoff Januar 2025 in derselben Liste wie Halluzinationen. Der Abschnitt Training Dataset zählt sieben Herkünfte der Trainingsdaten einzeln auf, darunter lizenzierte Daten, Daten aus Google-Produkten und maschinell erzeugte Daten.
Dokumentationerreichbar
GPT-5 System Card (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
OpenAIs Begleitdokument zum Modell, Dokumentdatum 13.08.2025. Der Abschnitt zu Halluzinationen nennt die eigene Messung, nach der das denkende Modell 65 Prozent seltener falsche Tatsachenbehauptungen aufstellt als der Vorgänger, und führt daneben einen Prüfsatz, der ausdrücklich das Enthalten bei unbeantwortbaren Fragen bewertet. Abschnitt 2, Model Data and Training, fasst die Herkunft der Trainingsdaten in einem einzigen Satz zusammen und nennt drei Quellen, wo Googles Modellkarte sieben einzeln aufführt.
Dokumentationerreichbar
Anthropic, Web fetch tool (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Die Dokumentation zum Abrufwerkzeug, die das Einlesen einer Adresse als Einfügen in den Gesprächsverlauf beschreibt und die Größenordnungen nennt: eine durchschnittliche Webseite von 10 Kilobyte entspricht rund 2.500 Token, eine Forschungsarbeit als PDF mit 500 Kilobyte rund 125.000. Abgerufen am 31.07.2026.
Dokumentationerreichbar
OpenAI, File search (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
OpenAIs Dokumentation zum Nachschlagen in hochgeladenen Dateien. Sie benennt den Unterschied, um den es geht, mit einem eigenen Begriff: Das Nachschlagen ergänze das dem Modell innewohnende Wissen. Damit stammt die Unterscheidung zwischen mitgebrachtem und mitgegebenem Wissen vom Anbieter selbst.
Dokumentationerreichbar
Google, Grounding with Google Search (externe Seite, ai.google.dev)
ai.google.devgeprüft 24.09.2026
Googles Dokumentation zur Verankerung von Antworten in Suchergebnissen. Sie benennt den Knowledge Cutoff ausdrücklich als das, was damit überschritten wird, und beschreibt den ganzen Ablauf aus Suchen, Verarbeiten und Belegen als Sache der Umgebung.
Originalarbeiterreichbar
Pitfalls in Evaluating Language Model Forecasters (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Paleka, Goel, Geiping und Tramèr untersuchen am 31.05.2025, warum Sprachmodelle als Prognosewerkzeug schwer zu bewerten sind. Abschnitt 2.3 begründet, dass ein veröffentlichter Knowledge Cutoff keine Zusicherung darstellt: Er meint oft nur das Pre-Training, während später erhobene Präferenzdaten Wissen über die Zeit danach mitbringen.