GrundlagenAgenten und HarnessKapitel 03von 4 im Pfad
RAG, die Suche vor der Antwort
In Grundkurs, Kapitel 08 steht, dass Neues auf drei Wegen zu einem Modell kommt und dass der dritte darin besteht, dass ein Programm nachschlägt. Dieser Weg hat einen Namen und mehr Teile, als man erwartet.
Vier Schritte, und das Modell kommt zuletzt
RAG steht für Retrieval Augmented Generation, und im Alltag meint es diesen Ablauf:
- Die Frage kommt an. Manchmal wird sie vorher umformuliert, etwa weil sie sich auf die vorige Antwort bezieht.
- Die Suche läuft. Ein eigener Teil des Programms durchsucht einen vorbereiteten Bestand. Das Modell, das gleich antwortet, tut das nicht.
- Das Gefundene wird angehängt. Meist fünf bis zwanzig Textstücke, die zusammen mit der Frage in eine einzige Anfrage gehen.
- Das Modell antwortet. Es sieht die Frage und die Textstücke und sonst nichts von Ihrem Bestand.
seitlich verschiebbar
eigene Darstellung, Stand 06.08.2026
OpenAI beschreibt seine Fassung davon in einem Satz, und beide Suchverfahren stehen darin:
Der Bestand wird dafür vorbereitet: Dokumente werden in Stücke geschnitten, jedes Stück bekommt eine Zahlenreihe, und die Reihen kommen in einen Index. Wie diese Zahlenreihen entstehen, steht in Grundkurs, Kapitel 04. Erzeugt werden sie ebenfalls von einem Modell, und in Tiefe 2 kommt ein drittes dazu. In der Suche stecken also durchaus Modelle. Keines davon ist das, dem Sie gleich gegenübersitzen.
Bevor Sie das Modell verdächtigen
Das ist die Reihenfolge, die man aus diesem Kapitel mitnehmen sollte. Ein Modell antwortet auf das, was vor ihm liegt. Lag das Falsche vor ihm, formuliert es eine falsche Auskunft in derselben ruhigen Tonlage wie jede richtige, und die Ursache steckt zwei Schritte früher.
Dass eine Suche danebengreifen kann, ist in Grundkurs, Kapitel 08 angesprochen. Der Punkt hier ist, wo genau: Die Suche kann die richtige Stelle übersehen. Sie kann eine ähnlich klingende falsche liefern. Sie kann eine veraltete Fassung finden, die niemand aus dem Bestand genommen hat. In allen drei Fällen steht die Ursache vor dem Modell, und das Modell bekommt sie nie zu sehen.
Ein Abschnitt ist das, was das Modell zu sehen bekommt
Gesucht und gefunden wird ein Stück aus einem Dokument, der Fachbegriff dafür ist Chunk. Ein Handbuch von hundert Seiten liegt im Index als einige hundert Stücke, und wenn eine Antwort in zwei davon steht, müssen beide gefunden werden.
Das erklärt eine Beobachtung, die viele machen: Fragen, deren Antwort in einem Absatz steht, funktionieren gut. Fragen, deren Antwort aus fünf Stellen zusammenzusetzen ist, funktionieren schlecht.
Wie groß so ein Stück sein soll und wo man schneidet, ist eine eigene Frage. Warum die Länge in Token gemessen wird, steht in Grundkurs, Kapitel 03; drei Regeln fürs Schneiden stehen in Grundkurs, Kapitel 04.
Woran Sie merken, dass die Suche danebengriff
Der Unterschied zu einer Erfindung aus Grundkurs, Kapitel 07 ist wichtig, weil er andere Gegenmittel verlangt. Dort erfindet das Modell eine Quelle. Hier stimmt die Quelle, und die Aussage steht trotzdem nicht darin.
Drei Anzeichen:
Der Beleg existiert, der Satz steht nicht darin. Das häufigste Muster. Die Fundstelle ist echt, die Zusammenfassung passt zum Thema, die konkrete Angabe kommt aus einer Nachbarstelle.
Die Antwort ist auffällig allgemein. Wenn nichts Passendes gefunden wurde, weicht ein Modell gern auf Allgemeines aus, das auch ohne Bestand richtig ist.
Die Auskunft ist veraltet. Kein Modellfehler. Im Index liegt die alte Fassung, weil die neue nie eingelesen wurde.
Wann sich der Aufwand nicht lohnt
Der Aufbau kostet Vorbereitung, Betrieb und Pflege. Drei Fälle, in denen es etwas Billigeres tut:
Es passt alles ins Fenster. Dann hängt man den Bestand an die Frage und ist fertig. Anthropic zieht diese Grenze weiter, als die meisten sie ziehen würden:
Fünfhundert Seiten sind viel, und die Zahl ist großzügig gerundet: In ein Fenster von 200.000 Token passt kein Bestand von 200.000 Token, weil Frage, Verlauf und Antwort mit hineinmüssen. Grundkurs, Kapitel 08 rechnet das an einem einzelnen Forschungsaufsatz vor. Die Richtung stimmt trotzdem: Die Schwelle, ab der eine Suche sich lohnt, liegt höher als das Bauchgefühl.
Die Frage zielt auf das Wie, nicht auf das Was. Formulieren, ordnen, prüfen, weiterdenken brauchen keinen Bestand. Was das Modell dafür braucht, steht in Grundkurs, Kapitel 05.
Es soll dauerhaft anders antworten. Wenn es um Ton, Format oder ein Fachgebiet als Ganzes geht, sind andere Wege näher. Sie stehen in Beurteilen und Einordnen, Kapitel 02.
Eine vierte Rechnung kommt dazu, sobald jemand zuhört statt zu lesen: Jeder Schritt zwischen Frage und Antwort ist dann eine hörbare Pause. Conversational AI, Kapitel 05 misst dieselben vier Schritte an der Uhr.
Der Schritt, an dem sich alles entscheidet, ist die Suche. Sie hat mehr Teile, als man von außen sieht.
Zwei Suchen, die verschiedene Fehler machen
Es gibt zwei Familien, und sie sind nicht neu. BEIR misst 2021
Für die Praxis genügen die beiden Enden. Dicht heißt die Ähnlichkeitssuche über Zahlenreihen, wie sie in Grundkurs, Kapitel 04 steht. Dünn besetzt heißt die alte Wortsuche, die zählt, welche Wörter der Frage im Text vorkommen und wie selten sie sonst sind. Das bekannteste Verfahren dafür heißt BM25, und es rechnet zwei Größen mit, die man beim Wort „zählen“ nicht vermutet:
Ein langes Dokument gewinnt also nicht dadurch, dass es lang ist, und das zwanzigste Vorkommen eines Wortes wiegt weniger als das zweite.
Wo die Ähnlichkeitssuche systematisch danebengreift, ist in Grundkurs, Kapitel 04 aufgezählt. Hier die Gegenseite: Die Wortsuche findet nichts, wenn der Text dieselbe Sache anders nennt. Wer nach Kündigungsfrist sucht und im Vertrag steht Beendigungstermin, geht leer aus.
Bemerkenswert am BEIR-Ergebnis ist, wer sich gehalten hat:
Our results show BM25 is a robust baseline (externe Seite, arxiv.org)
Die alte Wortsuche gewinnt dort, wo die Frage die Wörter des Textes benutzt, und das kommt öfter vor, als es in Produktvorführungen aussieht.
Woher die Ähnlichkeitssuche kommt
Gebaut wurde sie für den Fall mit dem Beendigungstermin. Die Arbeit, die sie 2019 brauchbar gemacht hat, fängt mit einem Lob an:
Gemeint ist BERT. Für den Vergleich zweier Sätze war es damals das Beste, was es gab. Der Haken steht im selben Absatz und ist eine Rechnung:
Gemessen ist dort der teuerste Fall, nämlich jedes Paar gegen jedes. Eine einzelne Frage gegen zehntausend Textstücke ist billiger, sie kostet zehntausend Durchläufe statt fünfzig Millionen. Teuer bleibt es trotzdem, und bei einer Million Stücke ist Schluss. Deshalb folgt zwei Zeilen später der Satz, den man häufiger liest als seine Begründung:
Das Wort, an dem alles hängt, ist search. Untauglich ist das Modell für die Suche über einen Bestand, weil sie zu teuer wäre. Zum Vergleichen taugt es, und diese Hälfte kommt weiter unten in diesem Kapitel zurück.
Beide laufen lassen und die Listen zusammenlegen
Wenn zwei Verfahren verschiedene Fehler machen, liegt es nahe, beide zu fahren. Anthropic beschreibt das so:
Der Teil, der dabei gern übersehen wird, ist das Zusammenlegen. Beide Verfahren liefern Punktzahlen, und diese Punktzahlen sind untereinander bedeutungslos: Ein Kosinuswert von 0,81 und ein BM25-Wert von 14,2 lassen sich nicht addieren. Zusammengelegt wird deshalb über die Platzziffer, also darüber, an welcher Stelle ein Textstück in seiner Liste steht. Wer in beiden Listen weit oben steht, gewinnt.
Addiert werden die Plätze dabei nicht. Eine Summe setzte einen Eintrag mit zwei mittleren Plätzen hinter einen mit einem einzelnen Spitzenplatz, und gewollt ist das Gegenteil. Die üblichen Verfahren rechnen deshalb anders, und Anthropic nennt sie im Plural:
seitlich verschiebbar
eigene Darstellung, Stand 06.08.2026
Der zweite Durchgang sieht Frage und Text zusammen an
Die erste Suche vergleicht zwei Zahlenreihen, die getrennt voneinander entstanden sind: eine für die Frage, eine für das Textstück, jede ohne Kenntnis der anderen. Ein zweiter Durchgang legt beides gemeinsam in ein Modell und lässt es bewerten, wie gut sie zueinander passen. Das Verfahren ist von 2019:
Das ist die Hälfte von oben, die zurückkommt. Dasselbe BERT, das jedes Paar einzeln ansehen muss, ist hier genau richtig, weil es nur noch die Kandidaten der ersten Stufe bekommt.
Es sieht genauer hin und kostet dafür. BEIR nennt beides in einem Satz: Sortierverfahren erreichen im Schnitt die besten Ergebnisse, allerdings bei hohem Rechenaufwand (externe Seite, arxiv.org). Deshalb bekommt es nur die Kandidaten der ersten Stufe zu sehen. Anthropic holt in seinem Aufbau die besten 150 und behält davon 20.
Die Zahlen dazu, und die Stufe, die man dabei übersieht
Was die Stufen einzeln bringen, hat derselbe Aufsatz gemessen. An dieser Messung hängt eine dritte Zutat, und sie steckt im Namen des Verfahrens. Anthropic schreibt jedem Textstück vor dem Einlesen einen erklärenden Vorspann voran, erzeugt von einem Modell, das dafür das ganze Dokument vorgelegt bekommt:
Damit steht in jedem Stück, wozu es gehört. Das Stück „Der Umsatz stieg um drei Prozent“ nennt seitdem die Firma und das Quartal, nach denen jemand fragen wird.
Erst so sind die Zahlen zu lesen. Die Fehlerrate der Suche liegt im Ausgangszustand bei 5,7 Prozent und sinkt auf 3,7, wenn allein dieser Vorspann dazukommt (35 Prozent weniger (externe Seite, anthropic.com)). Sie sinkt auf 2,9, wenn Wortsuche und Ähnlichkeitssuche mit diesem Vorspann zusammenlaufen (49 Prozent (externe Seite, anthropic.com)), und auf 1,9 Prozent mit dem zweiten Durchgang darüber (67 Prozent (externe Seite, anthropic.com)). Das sind Herstellerangaben aus einem eigenen Versuchsaufbau, und sie nennen den Ausgangswert mit.
Wer daraus mitnimmt, dass Wortsuche plus Ähnlichkeitssuche die halbe Fehlerrate spart, hat eine Stufe übersprungen. Das Wort Contextual steht in allen drei Zeilen der Messung, und es bezeichnet den Vorspann.
Was neben dem Text im Index steht
Ein Eintrag im Index besteht aus mehr als der Zahlenreihe. Was daneben gehört: Kennung des Dokuments, Herkunft, Fassung, Zeitstempel, Sprache, die Überschriften, unter denen das Stück steht, dazu Name und Länge des Modells, das die Reihe erzeugt hat.
Drei Fragen sind ohne diese Angaben nicht zu beantworten. Warum kam das nach oben, wenn niemand weiß, aus welchem Dokument das Stück stammt. Was gilt noch, wenn zwei Fassungen desselben Handbuchs nebeneinanderliegen. Und wie wird das wieder los, wenn ein Dokument zurückgezogen wird und seine Stücke keine gemeinsame Kennung haben.
Die Angaben sind zugleich der Filter. OpenAI beschreibt das für die eigene Dateisuche knapp:
Wer darf sehen, was gefunden wird
Der Filter für Zugriffsrechte gehört in die Suchabfrage. Ein Modell, das zwanzig Textstücke vorgelegt bekommt, kann nicht wissen, welche davon der Fragende sehen darf, und es kann es auch nicht nachträglich entfernen: Was im Kontext steht, steht dort.
Microsofts Anleitung dazu beschreibt den verbreiteten Weg, eine Kennung als Feld am Eintrag und ein Filter in der Abfrage:
Der nächste Satz derselben Seite ist der wichtigere:
Der Filter ahmt eine Rechteprüfung nach. Wer die Abfrage stellt, bestimmt, welche Kennung darin steht, und damit hängt alles daran, dass die Anwendung davor genau die Kennung des angemeldeten Nutzers einsetzt. Warum die Frage nach den Rechten sich innerhalb des eigenen Hauses genauso stellt wie gegenüber einem Dienstleister, steht in Grundkurs, Kapitel 04.
Derselbe Anbieter führt dieses Muster inzwischen als Ausweichweg und stellt eine Fassung daneben, in der die Suche die Anmeldung des Fragenden auswertet:
Der Stand dazu gehört mitgelesen. Die native Fassung ist eine Vorschau, das Filtermuster steht also weiterhin in vielen Aufbauten:
Drei Zahlen, die verschiedene Fragen beantworten
Zum Schluss die Namen, unter denen die Kennzahlen in der Literatur stehen.
Recall@k ist der Anteil der passenden Stellen, der unter den ersten k Treffern gelandet ist. Anthropic sagt seine Fassung davon genau:
Gezählt werden also die Stellen. Wo eine Frage mehrere hat, zählt jede einzeln, und wer nur wissen will, ob wenigstens eine dabei war, misst etwas anderes: Das heißt Hit Rate@k. Der Unterschied fällt genau bei den Fragen auf, deren Antwort auf mehrere Stellen verteilt ist, und das sind die schwierigen.
MRR mittelt den Kehrwert der Platzziffer der ersten richtigen Stelle. Sie belohnt es, weit oben zu stehen, und sie ist alt genug, um im Abstract der Reranking-Arbeit von 2019 als Maßstab zu dienen: 27 Prozent Verbesserung in MRR@10 (externe Seite, arxiv.org).
nDCG ist die feinste der drei. Sie verrechnet mehrere passende Stellen und gewichtet nach Rang, taugt also dort, wo es mehrere richtige Antworten gibt. BEIR misst damit.
Warum von diesen Zahlen zwei etwas aussagen und der durchschnittliche Ähnlichkeitswert nicht, ist in Grundkurs, Kapitel 04 begründet. Welche Zahl zu welchem Schritt gehört, steht in Tiefe 3.
Der Begriff ist sechs Jahre alt, und was er benennt, hat sich seither verschoben. Das ist keine Wortklauberei, es erklärt, warum manche Erwartungen an solche Systeme regelmäßig enttäuscht werden.
Was 2020 in der Arbeit stand
Was Lewis und Mitautoren am 22.05.2020 vorstellen, ist ein Abstimmungsverfahren, und die Zusammenfassung sagt es im ersten eigenen Satz:
Abgestimmt wird dabei weniger, als der Satz vermuten lässt. Der Suchteil steht zu diesem Zeitpunkt schon fertig da:
Ein vorbereiteter Index über Wikipedia, ein vortrainierter Sucher davor: Das ist ein Suchsystem, und es steht in derselben Zusammenfassung, die den Namen eingeführt hat. Geändert hat sich seither die Kopplung. Damals wurden Sucher und Erzeugung aufeinander abgestimmt, heute stehen sie nebeneinander und wissen voneinander nichts.
Wozu die Arbeit angetreten ist
Der Satz, den man aus ihr gern zieht, steht in der Einleitung:
Herkunftsangabe und Auswechselbarkeit des Wissens: Beides gilt bis heute. Was in derselben Zusammenfassung noch steht, fällt beim Zitieren regelmäßig weg:
Bessere Antworten waren also von Anfang an das Ziel, und sie sind gemessen worden. Was daraus nicht folgt, ist der Umkehrschluss: dass sie sich beim Einbau einer Suche von selbst einstellen. Gemessen wurde ein aufeinander abgestimmter Aufbau an Aufgaben mit bekannter Lösung. Wer eine Suche vor ein fertiges Modell setzt, hat diese Messung nicht geerbt und muss sie selbst führen. Wie, steht im nächsten Abschnitt.
Die Zahl gehört einer Stufe
Der häufigste Messfehler beim Betrieb solcher Systeme ist eine einzige Zahl für das Ganze. Man legt hundert Fragen mit bekannten Antworten vor, zählt die richtigen und bekommt 71 Prozent. Diese Zahl sagt nicht, wo die 29 verloren gegangen sind, und deshalb lässt sie sich auch nicht gezielt verbessern.
Die brauchbare Trennung verläuft zwischen zwei Fragen:
| Frage | Was sie misst | Womit |
|---|---|---|
| Waren die richtigen Stellen dabei? | die Suche | Recall@k über einen Fragensatz mit bekannten Fundstellen, bei genau einer Fundstelle Hit Rate@k |
| Wurde daraus eine richtige Antwort? | das Modell | Bewertung der Antworten, bei denen die Stellen dabei waren |
Die zweite Frage ist ohne die erste sinnlos. Was nicht gefunden wurde, kann nicht in die Antwort kommen, und das ist in Grundkurs, Kapitel 04 begründet.
seitlich verschiebbar
eigene Darstellung, Stand 06.08.2026
Der Fragensatz mit bekannten Fundstellen ist die Grundlage von allem. Fünfzig Fragen sind ein Anfang, jede mit dem Dokument und den Abschnitten, in denen die Antwort steht. Die Fragen zu stellen kostet wenig, die Fundstellen zu belegen ist die Arbeit, und wie viel davon anfällt, hängt am Fachgebiet. Er wird bei jeder Änderung an irgendeiner Stufe erneut gefahren, auch bei einer, die harmlos aussieht: eine andere Abschnittslänge, ein anderes Modell, ein zusätzlicher Filter. BEIR zeigt, warum das nötig ist. Zehn Verfahren über achtzehn Bestände gemessen, und die Rangfolge wechselt je nach Gebiet.
Ein Index ist reproduzierbar oder er ist eine Behauptung
Zwei Messungen aus zwei Wochen sind nur vergleichbar, wenn dazwischen bekannt ist, was sich geändert hat. Dass Modell und Länge festgehalten gehören, verlangt bereits der Kasten in Grundkurs, Kapitel 04. Die vollständige Liste ist länger:
- Modell und Fassung, nicht nur der Name. Anbieter aktualisieren Modelle unter demselben Namen.
- Länge der Zahlenreihe, wenn das Modell kürzbar ist.
- Normalisierung und Abstandsmaß. Kosinus und Skalarprodukt liefern dieselbe Rangfolge nur bei normalisierten Vektoren.
- Fassung der Zerlegung. Länge, Überlappung, an welchen Grenzen geschnitten wurde.
- Vorangestellte Textbausteine. Manche Modelle erwarten vor Frage und Dokument je einen festen Zusatz. Wer ihn beim Suchen anders setzt als beim Einlesen, misst zwei verschiedene Räume gegeneinander.
- Datum des Laufs und Umfang des Bestands zu diesem Zeitpunkt.
Ohne diese Angaben ist eine gefallene Kennzahl nicht zuzuordnen, und dann beginnt das Raten.
Der Bestand ändert sich, der Index nicht von selbst
Ein Index ist eine Kopie. Was im Quellsystem passiert, passiert dort nicht mit, solange es niemand nachführt.
Geändert. Ein Dokument wird überarbeitet, die alten Stücke bleiben im Index und werden weiter gefunden. Zwei Fassungen desselben Absatzes im selben Trefferbereich sind für ein Modell nicht als Widerspruch erkennbar, es verarbeitet beide.
Gelöscht. Der schwierigere Fall. Ein zurückgezogenes Dokument wird weiterhin als Beleg zitiert, mit Fundstelle, und die Antwort sieht so belastbar aus wie jede andere. Deshalb gehört die Dokumentkennung an jedes Stück, und deshalb ist Löschen eine Betriebsaufgabe mit eigenem Weg.
Neu berechtigt. Berechtigungen ändern sich häufiger als Dokumente, und im Index stehen sie als Kopie: Wer gestern lesen durfte, darf es dort auch morgen noch. Das ist der zweite Grund, aus dem Microsofts Anleitung von einer Nachahmung (externe Seite, learn.microsoft.com) spricht. Der erste steht in Tiefe 2 und wiegt schwerer: Der Filter prüft niemanden.
Fünf Sätze, die nach Verbesserung klingen
Zum Schluss die Formulierungen, bei denen ein zweiter Blick lohnt.
„Wir nehmen ein größeres Kontextfenster.“ Damit lässt sich ein kleiner Bestand vollständig mitschicken, und Tiefe 1 nennt die Grenze, bis zu der das reicht. Als Antwort auf eine schlechte Suche taugt es trotzdem nicht: Wenn die richtige Stelle gar nicht gefunden wurde, hilft mehr Platz für die falschen nicht.
„Wir geben dem Modell mehr Abschnitte.“ Der Suche hilft das immer: Je mehr Stellen durchkommen, desto eher ist die richtige dabei. Bezahlt wird an anderer Stelle, und Anthropic sagt, an welcher:
Die Suche wird also besser und die Antwort schlechter. Wo dazwischen der Punkt liegt, ist eine Messung: Anthropic hat fünf, zehn und zwanzig Stellen probiert und ist bei zwanzig geblieben. Wer die beiden Größen verwechselt, verbessert die Zahl, die er misst, und verschlechtert die, um die es geht.
„Wir nehmen ein stärkeres Sprachmodell.“ Die teuerste Stellschraube für ein Problem, das meistens eine Stufe früher sitzt. Erst messen, welche Stufe verliert.
„Der durchschnittliche Ähnlichkeitswert ist gestiegen.“ Warum diese Zahl nichts über die Trefferqualität sagt, steht in Grundkurs, Kapitel 04.
„Wir machen RAG.“ Das beantwortet die Frage nach dem Verfahren. Die Frage, ob die Antworten stimmen, beantwortet allein der Fragensatz mit bekannten Fundstellen.
Quellen
8 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Originalarbeiterreichbar
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Lewis und Mitautoren beschreiben am 22.05.2020, wie ein Modell passende Textstellen nachschlägt und mit in den Kontext nimmt, statt sich auf Gelerntes zu verlassen. Das Verfahren heißt seitdem RAG und ist der übliche Weg zu Antworten aus eigenen Dokumenten. Der Suchteil ist dort bereits vortrainiert, abgestimmt wird die Kopplung zwischen Suche und Erzeugung; heutige Aufbauten setzen eine Suche vor ein fertiges Modell und übernehmen nur den Namen. Die Zusammenfassung nennt bessere Ergebnisse als eigenes Resultat, und genau dieser Teil fällt beim Zitieren regelmäßig weg.
Dokumentationerreichbar
OpenAI, File search (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
OpenAIs Dokumentation zum Nachschlagen in hochgeladenen Dateien. Sie benennt den Unterschied, um den es geht, mit einem eigenen Begriff: Das Nachschlagen ergänze das dem Modell innewohnende Wissen. Damit stammt die Unterscheidung zwischen mitgebrachtem und mitgegebenem Wissen vom Anbieter selbst.
Ankündigung des Herstellerserreichbar
Anthropic, Introducing Contextual Retrieval (externe Seite, anthropic.com)
anthropic.comgeprüft 24.09.2026
Anthropic beschreibt am 19.09.2024 einen vollständigen Suchaufbau und beziffert jede Stufe einzeln. Der Kern des Verfahrens ist ein erklärender Vorspann, den ein Modell für jedes Textstück aus dem ganzen Dokument erzeugt; darauf setzen Wortsuche neben Ähnlichkeitssuche und ein zweiter Sortierdurchgang auf. Die Zahlen sind Herstellerangaben aus einem eigenen Versuchsaufbau, sie nennen jeweils den Ausgangswert mit und sind damit nachrechenbar. Wer sie ohne den Vorspann liest, schreibt die Wirkung der falschen Stufe zu. Der Aufsatz gibt zugleich die Größenordnungen, mit denen solche Aufbauten arbeiten, und nennt die Grenze, unterhalb derer sich der ganze Aufwand erübrigt.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Thakur, Reimers und Mitautoren messen am 17.04.2021 zehn Suchverfahren über 18 Datensätze aus verschiedenen Gebieten, ohne sie vorher darauf abzustimmen. Die Arbeit liefert die Namen der Verfahrensfamilien und ihr Kräfteverhältnis: Die alte Wortsuche hält sich als Grundlinie, ein zweiter Sortierdurchgang gewinnt und kostet dafür Rechenzeit. Die Kennzahlen der Arbeit sind nDCG@10 und Recall@100; sie stehen im Volltext und deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.
Originalarbeiterreichbar
Passage Re-ranking with BERT (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Nogueira und Cho beschreiben am 13.01.2019 den zweiten Durchgang, der heute in fast jeder Suche über eigene Dokumente steckt: Ein Sprachmodell bekommt Frage und Textstück gemeinsam vorgelegt und vergibt dafür eine Bewertung, nachdem eine billigere Suche die Kandidaten eingesammelt hat. Zugleich einer der wenigen Belege, in denen eine Retrieval-Kennzahl im Abstract selbst steht.
Originalarbeiterreichbar
Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Reimers und Gurevych zeigen am 27.08.2019, wie aus einem Sprachmodell ein Suchwerkzeug wird: Zwei Kopien desselben Netzes werden so trainiert, dass zusammengehörige Sätze im Raum nah beieinander landen, und der Vergleich läuft danach über den Kosinus. Die Zusammenfassung fängt mit dem Lob für BERT an und beziffert erst danach, warum die Arbeit nötig war: 65 Stunden gegen 5 Sekunden für dieselbe Suche. Wer den Satz über die Untauglichkeit ohne diese beiden Zeilen zitiert, macht aus einer Kostenaussage ein Unvermögen. Zur Frage, wie aus vielen Token-Vektoren einer für den ganzen Abschnitt wird, steht die Antwort in Abschnitt 3: „We experiment with three pooling strategies: Using the output of the CLS-token, computing the mean of all output vectors (MEAN-strategy), and computing a max-over-time of the output vectors (MAX-strategy). The default configuration is MEAN.“ Diese Stelle steht im Volltext und ist deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.
Dokumentationerreichbar
Microsoft, Security Filter Pattern in Azure AI Search (externe Seite, learn.microsoft.com)
learn.microsoft.comgeprüft 24.09.2026
Die Anleitung eines Anbieters dazu, wie Zugriffsrechte in eine Suche über eigene Dokumente kommen: als Feld am Eintrag und als Filter in der Abfrage. Wertvoll ist sie vor allem, weil sie die eigene Grenze ausspricht. Der Filter ahmt eine Rechteprüfung nach, er ist keine, und wer die Abfrage stellt, bestimmt, welche Kennung darin steht.
Dokumentationerreichbar
Microsoft, Document-level access control in Azure AI Search (externe Seite, learn.microsoft.com)
learn.microsoft.comgeprüft 24.09.2026
Microsofts Übersicht über die Wege, auf denen die Zugriffsrechte einzelner Dokumente in eine Suche kommen. Sie ist der Gegenpol zur älteren Anleitung zum Filtermuster: Hier wertet die Suche die Anmeldung des Fragenden aus, dort vergleicht sie Zeichenketten. Der Anbieter führt das Filtermuster inzwischen als Ausweichweg für die Fälle, in denen der native Weg ausscheidet. Zu lesen ist die Seite mit ihrem Stand, die native Fassung steht als Vorschau.