Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenAgenten und HarnessKapitel 03von 4 im Pfad

RAG, die Suche vor der Antwort

Tiefe 1: Überblick · Lesezeit 9 Min. · Stand

In Grundkurs, Kapitel 08 steht, dass Neues auf drei Wegen zu einem Modell kommt und dass der dritte darin besteht, dass ein Programm nachschlägt. Dieser Weg hat einen Namen und mehr Teile, als man erwartet.

Vier Schritte, und das Modell kommt zuletzt

RAG steht für Retrieval Augmented Generation, und im Alltag meint es diesen Ablauf:

  1. Die Frage kommt an. Manchmal wird sie vorher umformuliert, etwa weil sie sich auf die vorige Antwort bezieht.
  2. Die Suche läuft. Ein eigener Teil des Programms durchsucht einen vorbereiteten Bestand. Das Modell, das gleich antwortet, tut das nicht.
  3. Das Gefundene wird angehängt. Meist fünf bis zwanzig Textstücke, die zusammen mit der Frage in eine einzige Anfrage gehen.
  4. Das Modell antwortet. Es sieht die Frage und die Textstücke und sonst nichts von Ihrem Bestand.
Aus vielen Stücken im Bestand werden wenige in der Anfrage. Links ein Raster aus vielen kleinen Stücken für den Bestand, rechts davon eine Verengung, dahinter ein Kontextfeld mit wenigen Stücken und das Modell. Betont die Auswahl: Aus einem großen Bestand kommen wenige Stücke an, und was durch die Verengung fällt, ist für das Modell nicht vorhanden. BESTAND, ZERSCHNITTEN einige tausend Stücke DIE SUCHE entscheidet, was durchkommt Die Anfrage fünf bis zwanzig Stücke Modell sieht nur dies

seitlich verschiebbar

Zwischen der Frage und der Antwort liegen zwei Schritte, die ohne das antwortende Modell ablaufen. Es bekommt nur, was der dritte ihm hinlegt.

eigene Darstellung, Stand 06.08.2026

OpenAI beschreibt seine Fassung davon in einem Satz, und beide Suchverfahren stehen darin:

It enables models to retrieve information in a knowledge base of previously uploaded files through semantic and keyword search. (externe Seite, developers.openai.com)

Der Bestand wird dafür vorbereitet: Dokumente werden in Stücke geschnitten, jedes Stück bekommt eine Zahlenreihe, und die Reihen kommen in einen Index. Wie diese Zahlenreihen entstehen, steht in Grundkurs, Kapitel 04. Erzeugt werden sie ebenfalls von einem Modell, und in Tiefe 2 kommt ein drittes dazu. In der Suche stecken also durchaus Modelle. Keines davon ist das, dem Sie gleich gegenübersitzen.

Bevor Sie das Modell verdächtigen

Das ist die Reihenfolge, die man aus diesem Kapitel mitnehmen sollte. Ein Modell antwortet auf das, was vor ihm liegt. Lag das Falsche vor ihm, formuliert es eine falsche Auskunft in derselben ruhigen Tonlage wie jede richtige, und die Ursache steckt zwei Schritte früher.

Dass eine Suche danebengreifen kann, ist in Grundkurs, Kapitel 08 angesprochen. Der Punkt hier ist, wo genau: Die Suche kann die richtige Stelle übersehen. Sie kann eine ähnlich klingende falsche liefern. Sie kann eine veraltete Fassung finden, die niemand aus dem Bestand genommen hat. In allen drei Fällen steht die Ursache vor dem Modell, und das Modell bekommt sie nie zu sehen.

Ein Abschnitt ist das, was das Modell zu sehen bekommt

Gesucht und gefunden wird ein Stück aus einem Dokument, der Fachbegriff dafür ist Chunk. Ein Handbuch von hundert Seiten liegt im Index als einige hundert Stücke, und wenn eine Antwort in zwei davon steht, müssen beide gefunden werden.

Das erklärt eine Beobachtung, die viele machen: Fragen, deren Antwort in einem Absatz steht, funktionieren gut. Fragen, deren Antwort aus fünf Stellen zusammenzusetzen ist, funktionieren schlecht.

Wie groß so ein Stück sein soll und wo man schneidet, ist eine eigene Frage. Warum die Länge in Token gemessen wird, steht in Grundkurs, Kapitel 03; drei Regeln fürs Schneiden stehen in Grundkurs, Kapitel 04.

Woran Sie merken, dass die Suche danebengriff

Der Unterschied zu einer Erfindung aus Grundkurs, Kapitel 07 ist wichtig, weil er andere Gegenmittel verlangt. Dort erfindet das Modell eine Quelle. Hier stimmt die Quelle, und die Aussage steht trotzdem nicht darin.

Drei Anzeichen:

Der Beleg existiert, der Satz steht nicht darin. Das häufigste Muster. Die Fundstelle ist echt, die Zusammenfassung passt zum Thema, die konkrete Angabe kommt aus einer Nachbarstelle.

Die Antwort ist auffällig allgemein. Wenn nichts Passendes gefunden wurde, weicht ein Modell gern auf Allgemeines aus, das auch ohne Bestand richtig ist.

Die Auskunft ist veraltet. Kein Modellfehler. Im Index liegt die alte Fassung, weil die neue nie eingelesen wurde.

Wann sich der Aufwand nicht lohnt

Der Aufbau kostet Vorbereitung, Betrieb und Pflege. Drei Fälle, in denen es etwas Billigeres tut:

Es passt alles ins Fenster. Dann hängt man den Bestand an die Frage und ist fertig. Anthropic zieht diese Grenze weiter, als die meisten sie ziehen würden:

If your knowledge base is smaller than 200,000 tokens (about 500 pages of material), you can just include the entire knowledge base in the prompt that you give the model, with no need for RAG or similar methods. (externe Seite, anthropic.com)

Fünfhundert Seiten sind viel, und die Zahl ist großzügig gerundet: In ein Fenster von 200.000 Token passt kein Bestand von 200.000 Token, weil Frage, Verlauf und Antwort mit hineinmüssen. Grundkurs, Kapitel 08 rechnet das an einem einzelnen Forschungsaufsatz vor. Die Richtung stimmt trotzdem: Die Schwelle, ab der eine Suche sich lohnt, liegt höher als das Bauchgefühl.

Die Frage zielt auf das Wie, nicht auf das Was. Formulieren, ordnen, prüfen, weiterdenken brauchen keinen Bestand. Was das Modell dafür braucht, steht in Grundkurs, Kapitel 05.

Es soll dauerhaft anders antworten. Wenn es um Ton, Format oder ein Fachgebiet als Ganzes geht, sind andere Wege näher. Sie stehen in Beurteilen und Einordnen, Kapitel 02.

Eine vierte Rechnung kommt dazu, sobald jemand zuhört statt zu lesen: Jeder Schritt zwischen Frage und Antwort ist dann eine hörbare Pause. Conversational AI, Kapitel 05 misst dieselben vier Schritte an der Uhr.

Quellen

8 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Originalarbeiterreichbar

    Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Lewis und Mitautoren beschreiben am 22.05.2020, wie ein Modell passende Textstellen nachschlägt und mit in den Kontext nimmt, statt sich auf Gelerntes zu verlassen. Das Verfahren heißt seitdem RAG und ist der übliche Weg zu Antworten aus eigenen Dokumenten. Der Suchteil ist dort bereits vortrainiert, abgestimmt wird die Kopplung zwischen Suche und Erzeugung; heutige Aufbauten setzen eine Suche vor ein fertiges Modell und übernehmen nur den Namen. Die Zusammenfassung nennt bessere Ergebnisse als eigenes Resultat, und genau dieser Teil fällt beim Zitieren regelmäßig weg.

  • Dokumentationerreichbar

    OpenAI, File search (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    OpenAIs Dokumentation zum Nachschlagen in hochgeladenen Dateien. Sie benennt den Unterschied, um den es geht, mit einem eigenen Begriff: Das Nachschlagen ergänze das dem Modell innewohnende Wissen. Damit stammt die Unterscheidung zwischen mitgebrachtem und mitgegebenem Wissen vom Anbieter selbst.

  • Ankündigung des Herstellerserreichbar

    Anthropic, Introducing Contextual Retrieval (externe Seite, anthropic.com)

    anthropic.comgeprüft 24.09.2026

    Anthropic beschreibt am 19.09.2024 einen vollständigen Suchaufbau und beziffert jede Stufe einzeln. Der Kern des Verfahrens ist ein erklärender Vorspann, den ein Modell für jedes Textstück aus dem ganzen Dokument erzeugt; darauf setzen Wortsuche neben Ähnlichkeitssuche und ein zweiter Sortierdurchgang auf. Die Zahlen sind Herstellerangaben aus einem eigenen Versuchsaufbau, sie nennen jeweils den Ausgangswert mit und sind damit nachrechenbar. Wer sie ohne den Vorspann liest, schreibt die Wirkung der falschen Stufe zu. Der Aufsatz gibt zugleich die Größenordnungen, mit denen solche Aufbauten arbeiten, und nennt die Grenze, unterhalb derer sich der ganze Aufwand erübrigt.

  • Originalarbeiterreichbar

    BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Thakur, Reimers und Mitautoren messen am 17.04.2021 zehn Suchverfahren über 18 Datensätze aus verschiedenen Gebieten, ohne sie vorher darauf abzustimmen. Die Arbeit liefert die Namen der Verfahrensfamilien und ihr Kräfteverhältnis: Die alte Wortsuche hält sich als Grundlinie, ein zweiter Sortierdurchgang gewinnt und kostet dafür Rechenzeit. Die Kennzahlen der Arbeit sind nDCG@10 und Recall@100; sie stehen im Volltext und deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.

  • Originalarbeiterreichbar

    Passage Re-ranking with BERT (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Nogueira und Cho beschreiben am 13.01.2019 den zweiten Durchgang, der heute in fast jeder Suche über eigene Dokumente steckt: Ein Sprachmodell bekommt Frage und Textstück gemeinsam vorgelegt und vergibt dafür eine Bewertung, nachdem eine billigere Suche die Kandidaten eingesammelt hat. Zugleich einer der wenigen Belege, in denen eine Retrieval-Kennzahl im Abstract selbst steht.

  • Originalarbeiterreichbar

    Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Reimers und Gurevych zeigen am 27.08.2019, wie aus einem Sprachmodell ein Suchwerkzeug wird: Zwei Kopien desselben Netzes werden so trainiert, dass zusammengehörige Sätze im Raum nah beieinander landen, und der Vergleich läuft danach über den Kosinus. Die Zusammenfassung fängt mit dem Lob für BERT an und beziffert erst danach, warum die Arbeit nötig war: 65 Stunden gegen 5 Sekunden für dieselbe Suche. Wer den Satz über die Untauglichkeit ohne diese beiden Zeilen zitiert, macht aus einer Kostenaussage ein Unvermögen. Zur Frage, wie aus vielen Token-Vektoren einer für den ganzen Abschnitt wird, steht die Antwort in Abschnitt 3: „We experiment with three pooling strategies: Using the output of the CLS-token, computing the mean of all output vectors (MEAN-strategy), and computing a max-over-time of the output vectors (MAX-strategy). The default configuration is MEAN.“ Diese Stelle steht im Volltext und ist deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.

  • Dokumentationerreichbar

    Microsoft, Security Filter Pattern in Azure AI Search (externe Seite, learn.microsoft.com)

    learn.microsoft.comgeprüft 24.09.2026

    Die Anleitung eines Anbieters dazu, wie Zugriffsrechte in eine Suche über eigene Dokumente kommen: als Feld am Eintrag und als Filter in der Abfrage. Wertvoll ist sie vor allem, weil sie die eigene Grenze ausspricht. Der Filter ahmt eine Rechteprüfung nach, er ist keine, und wer die Abfrage stellt, bestimmt, welche Kennung darin steht.

  • Dokumentationerreichbar

    Microsoft, Document-level access control in Azure AI Search (externe Seite, learn.microsoft.com)

    learn.microsoft.comgeprüft 24.09.2026

    Microsofts Übersicht über die Wege, auf denen die Zugriffsrechte einzelner Dokumente in eine Suche kommen. Sie ist der Gegenpol zur älteren Anleitung zum Filtermuster: Hier wertet die Suche die Anmeldung des Fragenden aus, dort vergleicht sie Zeichenketten. Der Anbieter führt das Filtermuster inzwischen als Ausweichweg für die Fälle, in denen der native Weg ausscheidet. Zu lesen ist die Seite mit ihrem Stand, die native Fassung steht als Vorschau.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.