NachschlagenGlossarBetrieb

Betrieb

Was zwischen Modell und Anwendung liegt. Schlüssel, Grenzen, Protokolle, Kosten.

38 Begriffe27 mit Kapitelverweis116 Zweitwörter im Indexalle 158 im Verzeichnis

API Key

Der Ausweis, mit dem sich ein Programm bei der Schnittstelle eines Anbieters anmeldet.

Anders als ein Passwort gehört er einer Organisation statt einer Person, wird maschinell benutzt und bekommt beim Anlegen ein Ablaufdatum. Wer ihn weitergibt, verschenkt kein Postfach, sondern Guthaben. Deshalb gehört er in einen Dienst auf dem Server und niemals in Code, den ein Browser ausliefert.

auchAPI-Schlüssel · Zugangsschlüssel

Kapitel 11 · Über die APIsiehe Rate Limit

Architecture Decision RecordADR

Eine kurze Notiz je Entscheidung: das Problem, die geprüften Wege, was gemessen wurde, wofür man sich entschieden hat und was das kostet.

Der eigentliche Wert steckt in den verworfenen Einträgen. Ein Weg, der ausprobiert und mit einer Zahl abgelehnt wurde, hält dieselbe Idee davon ab, ein halbes Jahr später als frischer Einfall wiederzukehren. Das Format ist einfach genug, dass es beim Arbeiten entsteht: eine Datei je Entscheidung, fortlaufend nummeriert, mit einem Status von vorgeschlagen über angenommen bis verworfen oder abgelöst. Wo im Dialog mit einem Sprachmodell entwickelt wird, kommt eine zweite Rolle dazu: Das Modell liest die Einträge, bevor es etwas ändert, und die Begründung von damals steht ihm dann zur Verfügung.

auchADR · Architecture Decision Records · Architekturentscheidung · Entscheidungsprotokoll

Beitrag · Warum ich eine eigene Diktier-App gebaut habeBeitrag · ADR und Spezifikation: wie viel Papier ein Agent brauchtMichael Nygard, Documenting Architecture DecisionsMartin Fowler, Architecture Decision Record (Bliki)siehe Vibe Codingsiehe Harness

Aufgezeichneter Testfall

Ein festgehaltenes Gespräch, das die Erwartungen daran speichert statt seines Wortlauts.

Ein Sprachagent liefert bei derselben Eingabe verschiedene Sätze, ein Vergleich auf Gleichheit misst deshalb die Formulierung. Gespeichert wird stattdessen, was passieren sollte: erkannte Absicht, gestarteter Ablauf, erreichte Seite. Ein späterer Lauf misst dagegen. Das ist die Grundform der Prüfung eines Sprachdialogs und zugleich ein Regressionstest, denn er hält fest, was gestern funktioniert hat.

auchTest Case · Testgespräch

Kapitel 10 · Testen, bevor jemand anruftGoogle, Dialogflow CX, TestfälleRasa, End-to-End-Testssiehe Trace

Chunk

Ein Stück eines Dokuments, wie es im Index liegt. Gesucht und gefunden wird immer ein Stück, das ganze Dokument nie.

Dokumente werden vor dem Einlesen zerschnitten, weil ein Treffer sonst hundert Seiten umfasst und der Platz im Kontextfenster begrenzt ist. Die Länge wird in Token gemessen, geschnitten wird möglichst an inhaltlichen Grenzen. Daraus folgt eine Beobachtung, die viele machen: Fragen, deren Antwort in einem Absatz steht, funktionieren gut; Fragen, deren Antwort aus fünf Stellen zusammenzusetzen ist, funktionieren schlecht.

auchTextstück · Abschnitt · Chunking · Passage

Kapitel 03 · RAG, die Suche vor der AntwortKapitel 03 · Token, die Bausteine der SpracheKapitel 04 · Embedding, Bedeutung als Zahlenreihesiehe RAGsiehe Embeddingsiehe Token

Containment

Der Anteil der Gespräche, die ohne Übergabe an einen Menschen zu Ende gingen.

Die meistgenannte Kennzahl im Sprachdialog, weil sie sich in Kosten umrechnen lässt. Ihr blinder Fleck ist groß: Ein Gespräch ohne Übergabe kann gelöst oder abgebrochen sein, und die Zahl unterscheidet das nicht. Sie misst, was der Agent behalten hat, was er geleistet hat, steht auf einem anderen Blatt.

auchContainment Rate · Automatisierungsquote

Kapitel 12 · Was nach dem Gespräch übrig bleibtKapitel 08 · Eskalation an einen MenschenRasa, Auswertung geführter Gesprächesiehe Trace

Domain-Driven DesignDDD

Ein Ansatz für komplexe Software, bei dem Fachleute und Entwickler gemeinsam ein Modell der Fachdomäne erkunden und darüber in einer gemeinsamen Sprache innerhalb einer ausdrücklich gezogenen Grenze sprechen.

Eric Evans hat den Ansatz 2004 in seinem Buch beschrieben und fasst ihn in seiner Referenz in drei Punkten zusammen: sich auf die Kerndomäne konzentrieren, Modelle in der Zusammenarbeit von Fach- und Softwareleuten erkunden, und eine gemeinsame Sprache innerhalb eines ausdrücklich begrenzten Kontexts sprechen. Zwei Begriffe daraus sind Allgemeingut geworden. Die Ubiquitous Language ist die Sprache, die alle im Team benutzen, damit Gespräch und Code dasselbe meinen; der Bounded Context ist die Grenze, meist ein Teilsystem oder ein Team, innerhalb derer ein Modell gilt. In einem Glossar über KI steht der Begriff aus einem Grund: Eine Spezifikation für einen Agenten ist nur so gut wie das Fachwissen, das in sie hineinkommt, und DDD hat dafür seit zwei Jahrzehnten dieselbe Antwort, nämlich den dauerhaften Zugang der Entwickler zu den Fachleuten. Evans selbst warnt zudem davor, die taktischen Muster in einem Altsystem anzuwenden; das enttäusche fast immer, und er beschreibt vier Wege für den Einstieg neben einem solchen Bestand.

auchDDD · Domänengetriebener Entwurf · Domain Driven Design

Kapitel 10 · Vorgabe und UmfangDDD ReferenceDDD Surrounded by Legacy SoftwareSpec-Driven Development is Domain-Driven Design's Impatient Cousinsiehe Spec-Driven Developmentsiehe Test-Driven Developmentsiehe Architecture Decision Record

End-to-End-TestE2E

Eine Prüfung über den ganzen Weg, von der Äußerung des Nutzers bis zur letzten Handlung.

Der Gegenentwurf zur Prüfung einzelner Stufen. Er findet die Fehlerklasse, die jede Stufenprüfung für sich besteht: Erkennung, Modell und Tool arbeiten je richtig, und der Anrufer hört trotzdem etwas Falsches, weil zwei Stufen verschiedene Annahmen über dasselbe Feld haben. Die Ausgabe eines Laufs ist eine Gegenüberstellung von erwarteten und tatsächlichen Ereignissen.

auchEnde-zu-Ende-Test · E2E-Test

Kapitel 10 · Testen, bevor jemand anruftRasa, End-to-End-Testssiehe Aufgezeichneter Testfall

GGUF

Das Dateiformat, in dem ein Modell für llama.cpp auf der Platte liegt. Eine Datei enthält Gewichte, Vokabular und die Angaben, die das Programm zum Ausführen braucht.

GGUF entstand 2023 im Umfeld von llama.cpp und löste dort ein älteres Format ab. In einer Datei steckt alles, was zum Ausführen nötig ist: die Gewichte in der gewählten Quantisierung, das Vokabular, die Bauform des Modells und die Vorlage für den Gesprächsverlauf. Werkzeuge wie Ollama und LM Studio verwalten im Kern solche Dateien. Was beim Umwandeln aus dem ursprünglichen Modell nicht mitgenommen wird, fehlt darin dauerhaft: Die verbreiteten Fassungen der großen offenen Modelle haben im August 2026 überwiegend keine Köpfe für die Vorhersage mehrerer Token, obwohl die zugehörigen Modelle sie haben.

auchGGUF-Datei · Modelldatei

Beitrag · Elf Wege, ein lokales Modell schneller zu machenllama.cpp, die README am Tag der Veröffentlichungsiehe Quantisierungsiehe Laufzeitumgebungsiehe Ollamasiehe Multi-Token Prediction

Grounding

Die Auflage, zu jeder Aussage ein wörtliches Zitat aus der Vorlage zu nennen und die Aussage zurückzunehmen, wenn keines auffindbar ist.

Die Bindung wirkt, weil sie von außen prüfbar ist: Ein Programm kann nachsehen, ob der zitierte Satz in der Vorlage steht. Ihre Grenze liegt eine Stufe höher. Ein auffindbares Zitat belegt, dass der Satz existiert, es belegt nicht, dass er die daraus gezogene Aussage stützt. Wer nur die Existenz prüft, bekommt eine Meldung ohne Befund und hält sie für eine Prüfung.

auchBelegbindung · Zitatpflicht · Belegpflicht · Quellenbindung

Kapitel 07 · Halluzinationen erkennenBeitrag · Welcher Copilot in welchem Microsoft-365-Paket stecktReduce hallucinations28.07.2026 · Entdecken kostet Stunden, Nachprüfen kostet Wochensiehe RAGsiehe Halluzinationsiehe Guardrails

Guardrails

Regeln und Prüfungen um ein Modell herum, die verhindern sollen, dass es Schaden anrichtet.

Guardrails sitzen vor der Eingabe, hinter der Ausgabe oder um die Tools herum. Sie sind Teil des Systems, nicht des Modells, und lassen sich deshalb ändern, ohne das Modell anzufassen. Umgekehrt heißt das: Zwei Anwendungen mit demselben Modell können sich sehr unterschiedlich verhalten.

auchLeitplanken · Sicherheitsfilter · Schutzmechanismen

Kapitel 07 · Guardrails2026 · Dieselben Gewichte, zwei Auslieferungensiehe Harnesssiehe Prompt Injectionsiehe Grounding

Hybride Suche

Ähnlichkeitssuche und klassische Wortsuche laufen beide, ihre Trefferlisten werden über den Platz zusammengelegt.

Die beiden Verfahren machen verschiedene Fehler. Die Wortsuche findet nichts, wenn der Text dieselbe Sache anders nennt; die Ähnlichkeitssuche verfehlt Kennungen und seltene Fachbegriffe. Zusammengelegt wird über die Platzziffer, denn ein Kosinuswert und ein BM25-Wert sind in verschiedenen Einheiten gemessen und lassen sich nicht addieren. Dass die alte Wortsuche dabei eine starke Grundlinie bleibt, hat BEIR 2021 über achtzehn Bestände gemessen.

auchHybrid Search · BM25 · Dense und Sparse · Volltextsuche

Kapitel 03 · RAG, die Suche vor der AntwortBEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval ModelsAnthropic, Introducing Contextual RetrievalOpenAI, File searchsiehe RAGsiehe Rerankingsiehe Embedding

Inferenz

Der laufende Betrieb eines fertigen Modells: rechnen, um eine Antwort zu erzeugen.

Training findet einmal statt, Inferenz bei jeder Anfrage. Deshalb entscheidet die Inferenz über die laufenden Kosten. Ein Modell wird nicht klüger, wenn man es öfter aufruft; es rechnet nur öfter dasselbe Verfahren durch.

auchInference · Ausführung · Laufzeit

Kapitel 02 · Maschinelles Lernen2023 · llama.cpp, das Modell läuft auf dem eigenen Rechner30.07.2026 · Die EU schreibt sieben KI-Gigafabriken aussiehe Laufzeitumgebungsiehe Gewichte

Jailbreak

Der Versuch eines Nutzers, ein Modell zum Ignorieren seiner Vorgaben zu bringen.

Der Angreifer ist hier der Mensch im Gespräch. Er formuliert so, dass die Anweisungen des Betreibers wirkungslos werden, etwa über ein erfundenes Rollenspiel. Die Gegenmaßnahme sitzt selten im Prompt: Was hilft, ist eine Prüfung vor dem Modell und eine Grenze der Rechte dahinter.

auchAusbruch · Umgehung der Vorgaben

Kapitel 07 · GuardrailsAnthropic, Mitigate jailbreaks and prompt injectionssiehe Guardrailssiehe Prompt Injection

KV-Cache

Der Zwischenspeicher, in dem ein laufendes Modell die schon berechneten Schlüssel und Werte jedes Tokens hält, damit es sie beim nächsten Token nicht neu rechnet.

Eine Antwort entsteht in zwei Phasen. Zuerst geht die ganze Eingabe in einem Durchgang durch das Modell (Prefill), danach entsteht Token für Token (Decode), und jedes neue Token sieht auf die Schlüssel und Werte aller Token davor. Diese Zahlen liegen im KV-Cache, im Speicher der Grafikkarte, und sie wachsen mit der Länge des Gesprächs; bei einem Server mit vielen gleichzeitigen Anfragen ist dieser Speicher der knappe Posten, und vLLM ist um seine Verwaltung herum gebaut. Weil ein Token nur von dem abhängt, was vor ihm steht, teilen sich zwei Anfragen mit demselben Anfang dessen Einträge. Das ist der Präfix-Cache, Anbieter verkaufen ihn als Prompt Caching mit Rabatt auf den wiederverwendeten Teil, und deshalb gehört der gleichbleibende Teil einer Anweisung nach vorn.

auchKey-Value-Cache · Präfix-Cache · Prefix Caching · Prompt Caching · Prefill

Kapitel 11 · Über die APIEfficient Memory Management for Large Language Model Serving with PagedAttentionAnthropic, Pricingsiehe Inferenzsiehe Laufzeitumgebungsiehe Tokensiehe Kontextfenstersiehe vLLM

Latenz

Die Zeit zwischen dem Ende einer Äußerung und dem ersten Ton der Antwort.

Eine Summe aus Posten, die einzeln klein aussehen: Aufnahme und Übertragung, die Wartezeit, bis die Erkennung das Ende meldet, die Erkennung selbst, das Modell bis zum ersten Wort, die Ausgabe bis zum ersten Ton, der Rückweg. Im Chatfenster ist eine Pause von drei Sekunden eine bekannte Form des Wartens. Im Gespräch fragen Menschen nach etwa einer Sekunde nach, ob die Gegenseite noch da ist.

auchAntwortzeit · Latenzbudget · Verzögerung

Kapitel 03 · Wenn das Gespräch nicht in Runden läuftsiehe Voice Activity Detectionsiehe Conversational AI

Laufzeitumgebung

Die Schicht zwischen Modellkern und Anwendung: lädt das Modell, nimmt Anfragen an, setzt Grenzen, ruft Tools auf.

Sie beeinflusst Antwortzeit und Kosten stärker als die Modellwahl und ist der Grund, warum dieselben Gewichte bei zwei Anbietern unterschiedlich teuer und unterschiedlich schnell sind. Stapelverarbeitung mehrerer Anfragen, Wiederverwendung berechneter Zustände, gestreamte Ausgabe, Kontingente.

auchServing · Serving-Schicht · Inference-Server · Runtime

Kapitel 01 · Was ein Sprachmodell ist2023 · Ollama, ein Befehl genügt23.07.2026 · Was eine Agenten-Sandbox aushält, entscheidet sich nicht im Kernelsiehe Modellkernsiehe Inferenz

Mandant

Der abgetrennte Bereich einer Organisation in einem gemeinsam genutzten Dienst. Daten, Konten und Einstellungen einer Firma liegen darin und bleiben von denen anderer Firmen getrennt.

Ein Anbieter betreibt eine Anlage für viele Kunden und trennt sie logisch statt körperlich. Für den Einsatz von KI ist der Mandant die Grenze, innerhalb derer ein Assistent suchen darf, und zugleich der Ort, an dem der Anbieter Einstellungen und Ankündigungen hinterlegt. Manches erreicht Kunden ausschließlich auf diesem Weg: Microsoft etwa veröffentlicht neue Funktionen auf offenen Seiten, kündigt Abschaltungen aber im Nachrichtenbereich des jeweiligen Mandanten an. Wer eine Entwicklung von außen verfolgt, sieht den Zuwachs vollständig und den Rückbau gar nicht.

auchTenant · Mandantenfähigkeit · Multi-Tenant · Mandantentrennung

Kapitel 01 · Wo Modelle betrieben werdenBeitrag · Welcher Copilot in welchem Microsoft-365-Paket stecktBeitrag · Was vor der Copilot-Einführung zu klären istApp and network requirements for Microsoft Copilot adminsMessage Center MC1454373, Einstellung der Excel-Funktion COPILOTsiehe Work IQ

MLX

Apples eigenes Rechenframework für maschinelles Lernen auf der eigenen Hardware, mit gemeinsamem Speicher zwischen CPU und GPU.

Apples eigene Forschungsabteilung für maschinelles Lernen veröffentlichte MLX Anfang Dezember 2023 als quelloffenes Rechenframework für Apple Silicon. Der namensgebende Unterschied zu Rechenframeworks aus dem PC-Bereich ist der gemeinsame Speicher: Ein Array liegt einmal im Arbeitsspeicher, eine Operation läuft darauf, ohne dass Daten zwischen CPU und GPU kopiert werden. Werkzeuge wie Ollama und LM Studio setzen MLX neben llama.cpp als zweiten Unterbau ein, wenn ein Modell auf einem Mac läuft.

MLXOllama v0.32.6siehe Laufzeitumgebungsiehe Ollamasiehe Multi-Token Prediction

Moderation

Die maschinelle Prüfung von Inhalten vor oder hinter einem Modell.

Meist eine eigene Schnittstelle, die Text oder Bild auf Kategorien einstuft. Ihre Grenzen stehen in der Dokumentation: Bei einem Tool Call erfasst sie Argumente und Ausgaben, während Tool-Namen, Beschreibungen und Schemata ausgenommen bleiben. Bei einer stückweise gelieferten Antwort liegt ihr Urteil erst nach dem letzten Wort vor.

auchInhaltsprüfung · Content Moderation

Kapitel 07 · GuardrailsOpenAI, Moderationsiehe Guardrailssiehe Jailbreak

NVIDIA Collective Communications LibraryNCCL

NVIDIAs Bibliothek, über die Grafikkarten in einem Verbund Daten austauschen. Ein verteiltes Training gleicht darüber Gewichte und Gradienten ab.

Ein Modell, das auf mehrere Grafikkarten verteilt trainiert wird, muss nach jedem Schritt seine Gradienten zusammenführen und die Gewichte an alle Karten verteilen. NCCL stellt dafür Sammeloperationen wie AllReduce und Broadcast bereit, jeweils als ein einziger Rechenkern, der Übertragung und Rechnung zusammen erledigt, und kennt dabei die Verbindungswege zwischen den Karten. Vorausgesetzt ist eine schnelle Verbindung, innerhalb eines Rechners oder in einem Cluster; zwei Maschinen ohne gemeinsames Netz können keinen NCCL-Verbund bilden. Genau diese Grenze umgeht der Adapter-Sync von TRL, indem nur wenige Megabyte über ein gemeinsames Dateisystem wandern.

auchNCCL · Collective Communications · AllReduce · GPU-Verbund

Overview of NCCLAsync GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCLsiehe Gewichtesiehe vLLMsiehe Speicherbandbreitesiehe Transformer Reinforcement Learning

Ollama

Ein Programm, das ein offenes Modell mit einem einzigen Befehl lädt und auf dem eigenen Rechner ausführt, hinter einer Schnittstelle wie der eines Anbieters.

Ollama erschien im Juli 2023 und macht seither das Herunterladen, Verwalten und Ausführen eines Modells zu einem einzigen Befehl. Der Betrieb bleibt vollständig ohne Netzverbindung möglich, und der Anbieter sagt zu, dass eingehende Daten nicht in ein Training gehen. Auf Apple-Rechnern kann dabei die MLX-Engine als schnellerer Unterbau einspringen, seit der Version vom 04.08.2026 auch für Speculative Decoding über den MTP-Kopf eines Modells. Das Gegenstück mit einem Fenster statt eines Befehls ist LM Studio.

Kapitel 01 · Wo Modelle betrieben werdenOllama v0.0.1OllamaOllama v0.32.6siehe Laufzeitumgebungsiehe Offene Gewichtesiehe MLX

On-Device

Ein Modell rechnet auf dem Gerät des Nutzers, ohne dass die Eingabe es verlässt.

Die Bezeichnung sagt etwas über den Ort der Rechnung und damit über den Zugriff: Was auf dem Gerät bleibt, sieht kein Betreiber. Sie ist allerdings selten der ganze Ablauf. Apple beschreibt für seine Modellreihe zwei Orte nebeneinander, das Gerät und einen eigenen abgesicherten Dienst, und welcher davon greift, entscheidet das System. Wer sich auf die Eigenschaft verlässt, prüft also, unter welchen Bedingungen sie gilt.

auchauf dem Gerät · lokal auf dem Gerät · Edge

Kapitel 10 · Small Language ModelsKapitel 01 · Wo Modelle betrieben werdenApple, Introducing the Third Generation of Apple Foundation Modelssiehe Small Language Modelsiehe Inferenzsiehe Anbietersiehe Betreiber

Prompt Injection

Ein Angriff, bei dem Anweisungen in Daten versteckt werden, die das Modell verarbeitet.

Ein Modell unterscheidet nicht zuverlässig zwischen dem, was es tun soll, und dem, was es lesen soll. Steht in einer eingelesenen Webseite oder Datei eine Anweisung, kann sie befolgt werden. Das ist kein Bedienfehler, sondern eine Eigenschaft des Verfahrens, und der Grund, warum Tool-Rechte eng gesetzt gehören.

auchInjection · Prompt-Angriff · Indirect Prompt Injection

Kapitel 05 · Der Prompt2026 · Ein Agent bricht aus der Sandbox2024 · Das Modell bedient einen Rechner2023 · Function Calling, das Modell fordert Tools an27.07.2026 · Ein Agent bricht aus der Sandbox aus, um eine Prüfung zu bestehensiehe Guardrailssiehe Toolsiehe Agent

Rate Limit

Die Obergrenze dafür, wie viel eine Organisation je Minute über die Schnittstelle verarbeiten darf.

Gemessen wird in drei getrennten Größen: Anfragen, Eingabe-Token und Ausgabe-Token je Minute. Das Kontingent füllt sich fortlaufend nach und wird nicht zur vollen Minute zurückgesetzt, weshalb gleichmäßig verteilter Verkehr mehr durchbringt als eine Salve. Wer eine Grenze erreicht, bekommt den Code 429 samt Wartezeit zurück.

auchRatenbegrenzung · Kontingent · Token-Bucket

Kapitel 11 · Über die APIsiehe API Key

Recall@k

Der Anteil der Fragen, bei denen die richtige Stelle unter den ersten k Treffern war.

Die erste Zahl, die man messen sollte, denn was nicht gefunden wurde, kann nicht in die Antwort kommen. Sie trennt die Suchqualität von der Antwortqualität und braucht dafür einen Fragensatz mit bekannter Fundstelle. Daneben stehen MRR, das den Kehrwert der Platzziffer der ersten richtigen Stelle mittelt, und nDCG, das mehrere passende Stellen verrechnet und nach Rang gewichtet.

auchRecall · Trefferquote · MRR · nDCG

Kapitel 03 · RAG, die Suche vor der AntwortBEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval ModelsPassage Re-ranking with BERTsiehe RAGsiehe Rerankingsiehe Benchmark

Red Teaming

Ein Angriff auf das eigene System im Auftrag, um die Lücken vor dem Gegner zu finden.

Der Begriff kommt aus dem Militär und der IT-Sicherheit: Ein rotes Team spielt den Angreifer. Bei Sprachmodellen heißt das, Prüfer versuchen mit Umgehungsversuchen, eingeschleusten Anweisungen und gefährlichen Anfragen, das Modell zu Verbotenem zu bringen; die Häuser lassen das intern erledigen, von beauftragten Firmen und zunehmend von automatisierten Angreifermodellen. Die Systemkarten nennen, wer geprüft hat, wie lange und mit welchem Zugang. Google lässt die Prüfer außerhalb des Teams sitzen, das das Modell gebaut hat; OpenAI beauftragte für GPT-6 Astra vier Firmen, die es nicht nennt.

auchAngriffstest · Red Team · Rotes Team

Kapitel 07 · Die Systemkarte lesenOpenAI, GPT-6 Astra System CardGoogle DeepMind, Gemini 3.1 Pro Model Cardsiehe Jailbreaksiehe Guardrailssiehe Prompt Injectionsiehe Modellkarte

Refactoring

Die innere Form des Codes ändern, ohne sein Verhalten anzufassen.

Der dritte Schritt im Zyklus der testgetriebenen Entwicklung und der Grund, warum sie über die Zeit etwas einbringt. Umbenennen, Zerlegen, Zusammenfassen, doppelte Stellen zusammenziehen: alles davon verändert, wie ein Programm gelesen wird, und nichts davon verändert, was es tut. Die Bedingung dafür sind grüne Tests, denn sie sind die einzige Auskunft darüber, ob das Verhalten wirklich gleich geblieben ist. Ohne sie ist der Umbau eine Wette. Mit einem Agenten verschiebt sich der Aufwand: Das Umbauen selbst kostet kaum noch Zeit, das Beurteilen des Ergebnisses dagegen schon.

auchRefaktorierung · Umbau des Codes · refaktorisieren

Beitrag · Erst der rote TestKent Beck, Canon TDDsiehe Test-Driven Developmentsiehe Vibe Coding

Regression

Ein Test, der vor einer Änderung durchlief und danach fällt. Kaputt ist damit etwas, das vorher funktioniert hat.

Das Wort kommt aus der Statistik und meint dort etwas anderes. In der Softwareentwicklung bezeichnet es einen Rückfall: Ein Verhalten, das schon einmal richtig war, hat sich nach einer Änderung verschlechtert. Gemessen wird das an den Tests, die vorher durchliefen und danach fallen. Die Rate dazu beantwortet eine andere Frage als die Lösungsquote, denn eine Änderung kann ihre eigene Aufgabe erfüllen und dabei an anderer Stelle etwas zerbrechen. Wer allein zählt, wie viele Aufgaben gelöst wurden, sieht diesen Teil der Rechnung gar nicht. Im Betrieb mit einem Agenten fällt das stärker ins Gewicht, weil mehr Änderungen je Zeiteinheit entstehen und der Bestand darunter derselbe bleibt.

auchRegressionen · Regressionsrate · Regressionstest · Rückfall

Beitrag · Erst der rote TestTDAD: Test-Driven Agentic Development. Reducing Code Regressions in AI Coding Agents via Graph-Based Impact AnalysisDORA, State of AI-assisted Software Development 2025siehe Test-Driven Development

Reranking

Ein zweiter Durchgang, der Frage und Textstück gemeinsam bewertet und die Trefferliste neu ordnet.

Die erste Suche vergleicht zwei Zahlenreihen, die getrennt voneinander entstanden sind. Ein Reranker legt Frage und Textstück zusammen in ein Modell und lässt bewerten, wie gut sie zueinander passen. Das sieht genauer hin und kostet deutlich mehr Rechenzeit, weshalb es nie über den ganzen Bestand läuft, sondern über die Kandidaten der ersten Stufe. Beschrieben wurde das Verfahren 2019 von Nogueira und Cho.

auchReranker · Re-Ranking · Neusortierung · Cross-Encoder

Kapitel 03 · RAG, die Suche vor der AntwortPassage Re-ranking with BERTBEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Modelssiehe RAGsiehe Hybride Suchesiehe Embedding

Spec-Driven DevelopmentSDD

Die Vorgabe steht vor dem Code: Eine Spezifikation ist der Vertrag, aus dem ein Agent Plan, Aufgaben und Code ableitet, und sie bleibt die Quelle der Wahrheit, wenn sich etwas ändert.

Zwei Werkzeuge haben den Begriff 2025 verbreitet: Kiro, die agentische Entwicklungsumgebung von AWS, stellte sich am 14.07.2025 damit vor, und GitHub veröffentlichte am 02.09.2025 Spec Kit, einen quelloffenen Werkzeugsatz in vier Phasen (Specify, Plan, Tasks, Implement), der mit GitHub Copilot, Claude Code und Gemini CLI arbeitet. Die Begründung ist bei beiden dieselbe: Anforderungen sind zu Beginn unsicher, und was einem Entwickler beim Planen hilft, hilft einem Agenten auch. Gemessen ist davon wenig. Die einzige Erhebung an einer ausgebauten Bauform vom April 2026 misst die Hooks, die jede Phase am Projekt erden, und findet 0,15 Punkte auf einer Skala von fünf; ob die Vorgabe selbst wirkt, bleibt offen. Ein kontrollierter Versuch vom August 2026 zeigt, dass die Form der Vorgabe beim stärksten Modell kaum zählt und beim schwächsten den Unterschied macht, und eine Begriffsarbeit vom selben Monat erklärt die eigene Beweislage für unfertig. Offen bleibt bei allen dreien, woher der Inhalt der Spezifikation kommt. Ein Interview-Agent holt heraus, was die befragte Person an Fachwissen mitbringt, und genau dort scheitern nach der Erfahrung eines Beratungshauses, das die Methode lehrt, die meisten Organisationen schon an Domain-Driven Design: am Zugang zu den Fachleuten.

auchSDD · spec-getriebene Entwicklung · Spezifikationsgetriebene Entwicklung · Specification-Driven Development

Kapitel 10 · Vorgabe und UmfangBeitrag · ADR und Spezifikation: wie viel Papier ein Agent brauchtIntroducing KiroSpec-driven development with AI: Get started with a new open source toolkitSpec Kit Agents: Context-Grounded Agentic WorkflowsArchitecture as Capability Equalizer for Coding AgentsSpec-Driven Development for Agentic Software Engineering: Harnessing Human-Agent TeamworkSpec-Driven Development is Domain-Driven Design's Impatient Cousinsiehe Test-Driven Developmentsiehe Domain-Driven Designsiehe Vibe Codingsiehe Agentic Engineeringsiehe Harness

Speculative Decoding

Etwas schlägt mehrere Token auf einmal vor, das große Modell prüft sie in einem Durchgang und übernimmt, was es übernehmen darf.

Das große Modell nimmt jeden Vorschlag mit einer berechneten Wahrscheinlichkeit an und gleicht die Ablehnungen aus; der Rest wird verworfen und neu gerechnet. Erhalten bleibt dadurch die Verteilung, aus der gezogen wird, und zwar im Rahmen der Rechengenauigkeit der Hardware. Der einzelne Text darf trotzdem ein anderer sein. Die Vorschläge stammen aus einer von drei Quellen: einem zweiten, kleineren Modell, einem eigenen Kopf im großen Modell, oder Wortfolgen, die im schon geschriebenen Text vorgekommen sind. Das spart Wartezeit an den vorhersehbaren Stellen eines Textes und kostet Zeit an den übrigen, denn ein verworfener Vorschlag ist bezahlter Rechenaufwand. Für die Qualität der Ausgabe ist es kein Regler, und wer zwei Aufbauten auf Geschwindigkeit vergleicht, sollte wissen, ob auf einer Seite spekuliert wird.

auchSpekulative Dekodierung · Spekulatives Entwerfen

Kapitel 12 · Wie zufällig die Antwort istBeitrag · Elf Wege, ein lokales Modell schneller zu machenFast Inference from Transformers via Speculative DecodingAccelerating Large Language Model Decoding with Speculative Samplingllama.cpp, Dokumentation zum Speculative Decodingsiehe Samplingsiehe Multi-Token Predictionsiehe Speicherbandbreite

Speicherbandbreite

Wie viele Daten je Sekunde zwischen Arbeitsspeicher und Rechenwerk fließen können. Bei einem lokal laufenden Modell entscheidet sie über das Tempo der Antwort.

Ein Sprachmodell erzeugt ein Token nach dem anderen, und für jedes davon müssen seine aktiven Gewichte einmal gelesen werden. Ein Modell mit 27 Milliarden Parametern in vier Bit bewegt so rund 17 Gigabyte je Token. Die Rechenwerke warten dabei den größten Teil der Zeit, weshalb die Bandbreite das Tempo bestimmt und die Rechenleistung selten. Daraus folgen zwei Dinge: Eine gröbere Quantisierung beschleunigt, weil weniger Daten fließen, und ein Modell mit vielen Experten läuft schneller als ein gleich großes, bei dem jeder Parameter mitrechnet. Auch das spekulative Entwerfen setzt hier an, denn die Prüfung mehrerer Vorschläge kostet einen Durchgang durch die Gewichte statt mehrerer.

auchBandbreite · Memory Bandwidth

Beitrag · Elf Wege, ein lokales Modell schneller zu machensiehe Quantisierungsiehe Mixture of Expertssiehe Speculative Decodingsiehe Inferenz

Test-Driven DevelopmentTDD

Die Regel, den Test vor dem Code zu schreiben: erst der Fall, der fällt, dann die Zeilen, die ihn grün machen.

Kent Beck hat die Methode 2002 beschrieben und 2023 noch einmal festgelegt, weil zu viele Darstellungen etwas anderes meinten. Fünf Schritte: eine Liste der Fälle, davon genau einer als lauffähiger Test, dann der Code für diesen einen und alle vorherigen, wahlweise Aufräumarbeit, und von vorn. Verbreitet ist die Kurzform rot, grün, aufräumen. Der rote Lauf am Anfang hat eine Aufgabe, die man ihm nicht ansieht: Er belegt, dass die Prüfung überhaupt anschlagen kann, und genau das fehlt einem Test, der nach dem Code entsteht und beim ersten Lauf grün ist. Im Betrieb mit einem Agenten kommt eine zweite Rolle dazu. Der Test beschreibt dann die Erwartung an eine Arbeit, die jemand anderes ausführt, und wird zur Vorgabe erst dadurch, dass der Ausführende ihn nicht ändern darf.

auchTestgetriebene Entwicklung · TDD · test-first · testgetrieben · Testgetriebene Softwareentwicklung · Rot-Grün-Refactor

Beitrag · Erst der rote TestKent Beck, Canon TDDTDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?siehe Refactoringsiehe Vibe Codingsiehe Architecture Decision Record

Token je SekundeT/s

Die übliche Kennzahl für das Tempo eines Sprachmodells. Sie misst, wie schnell die Antwort geschrieben wird, und sagt nichts über die Wartezeit bis zum ersten Wort.

Gemessen wird üblicherweise die Ausgabe, also wie viele Token je Sekunde beim Schreiben der Antwort entstehen. Das Verarbeiten der Eingabe läuft um ein Vielfaches schneller, weil dort alle Token in einem Durchgang durch das Modell gehen; genau dieser Unterschied ist der Grund, warum sich das Schreiben durch Spekulation beschleunigen lässt. Eine einzelne Zahl sagt wenig: Sie gilt für ein Gerät, eine Quantisierung, eine Programmfassung und eine Art von Aufgabe. Zwei Aufbauten lassen sich damit nur vergleichen, wenn auf beiden Seiten dasselbe gemessen wurde.

auchtok/s · Tokens per second · Durchsatz

Beitrag · Elf Wege, ein lokales Modell schneller zu machensiehe Latenzsiehe Speicherbandbreitesiehe Speculative Decodingsiehe Benchmark

Tokenmaxxing

Der Wettbewerb um den höchsten Token-Verbrauch, bei dem die Menge als Nachweis von Können gilt.

Die Endung stammt aus dem Netzjargon und bedeutet dort, eine einzelne Eigenschaft bis zum Anschlag zu treiben. Wer am meisten verbraucht, gilt danach als der, der am weitesten ist. Seit 2026 gibt es Werkzeuge, die den eigenen Verbrauch auslesen und in öffentliche Ranglisten stellen, dazu firmeninterne Bestenlisten mit demselben Zweck. Der Denkfehler liegt in der Gleichsetzung von Aufwand und Wirkung. Wie weit beides auseinanderliegt, maß 2025 ein randomisierter Versuch mit 16 erfahrenen Entwicklern: Sie erwarteten 24 Prozent Zeitersparnis, schätzten sich hinterher 20 Prozent schneller und brauchten gemessen 19 Prozent länger. Eine Zahl, die leicht zu erheben und noch leichter zu erhöhen ist, taugt nicht als Maßstab. Ernst zu nehmen bleibt der Gedanke dahinter: Wer ein Werkzeug nur nebenbei benutzt, lernt seine Grenzen nicht kennen. Eine Rangfolge folgt daraus nicht.

auchToken Maxxing · Tokenmaxxer · Token-Leaderboard · Tokenmaxing

tokenlytics, Token-Zähler mit WettbewerbTokscale, weltweite Rangliste des Token-VerbrauchsMeasuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivitysiehe Tokensiehe Benchmarksiehe Inferenz

Trace

Die Aufzeichnung eines einzelnen Durchlaufs: welcher Schritt wann begann und wann er endete.

Sie hält fest, was ein Transkript verschweigt, nämlich alles zwischen Frage und Antwort. Jeder Abschnitt darin hat Anfang und Ende, und daraus wird eine Reihenfolge mit Uhrzeiten. Manche Fehler bestehen ausschließlich aus einer Reihenfolge: eine Absage, die vor der zugehörigen Suchanfrage kam. Bei einem Sprachagenten hebt die Voreinstellung dabei auch die Tonaufnahme auf.

auchAblaufspur · Spur · Ablaufprotokoll

Kapitel 12 · Was nach dem Gespräch übrig bleibtOpenAI, Agents SDK, AufzeichnungOpenAI, Abläufe von Agenten bewertensiehe Containment

Visuelles Token

Die Einheit, in der ein Bild abgerechnet wird: ein Stück Bildfläche statt eines Stücks Text.

Ein mitgeschicktes Bild wird in Felder zerlegt, und jedes Feld zählt wie ein Token. Bei Anthropic misst ein Feld 28 mal 28 Bildpunkte, der Preis wächst also mit der Fläche und stößt an eine Obergrenze, oberhalb derer das Bild verkleinert wird. Bei Google wächst das Feld mit dem Bild mit, weshalb dort ein größeres Bild kaum mehr kostet. Dieselbe Datei ergibt bei beiden verschiedene Zahlen, und welche kleiner ist, hängt am Seitenverhältnis. Ein PDF fällt unter dieselbe Rechnung, denn jede Seite wird als Bild verarbeitet.

auchVisual Token · Bildtoken · Patch

Kapitel 13 · Was ein Modell auf einem Bild erkenntVisionImage understandingPDF supportsiehe Tokensiehe Multimodal

vLLM

Ein quelloffener Inferenz-Server, der ein Modell für viele gleichzeitige Anfragen betreibt, hinter einer Schnittstelle wie der eines Anbieters.

vLLM entstand 2023 aus einer Arbeit über die Verwaltung des KV-Cache: Der Speicher wird in Blöcken vergeben, nach dem Vorbild der Speicherverwaltung eines Betriebssystems, sodass kaum etwas verschwendet wird und Anfragen mit gleichem Anfang sich die Einträge teilen. Die Arbeit misst dafür den zwei- bis vierfachen Durchsatz gegenüber den damaligen Systemen bei gleicher Antwortzeit. Wo Ollama ein Modell auf dem eigenen Rechner für eine Person startet, bedient vLLM einen Server mit Hunderten von Anfragen im selben Moment; Trainingsbibliotheken wie TRL benutzen es, um während des Trainings Antworten zu erzeugen. Mehrere LoRA-Adapter kann es gleichzeitig geladen halten und je Anfrage einen davon anwenden.

auchPagedAttention · Inferenz-Server · SGLang

Efficient Memory Management for Large Language Model Serving with PagedAttentionAsync GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCLsiehe Laufzeitumgebungsiehe KV-Cachesiehe Ollamasiehe Inferenzsiehe Low-Rank Adaptation

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.