NachschlagenGlossarAnwendung
Anwendung
Was mit einem Modell gemacht wird, sobald es steht. Von der Suche über Belege bis zur Spracheingabe.
24 Begriffe21 mit Kapitelverweis65 Zweitwörter im Indexalle 158 im Verzeichnis
Agentic Engineering
Die berufliche Gegenseite zum Vibe-Coding: mehrere fehlbare Agenten führen, ohne Richtigkeit, Sicherheit und Wartbarkeit aufzugeben.
Andrej Karpathy stellte den Begriff am 30.04.2026 neben seinen eigenen von 2025 und zog damit selbst die Grenze, die dem ersten Begriff seither fehlte. Vibe-Coding hebt den Boden: Es bringt Menschen zu einem Ergebnis, die sonst keines bekommen hätten. Agentic Engineering hebt die Decke und bleibt eine berufliche Disziplin, bei der jemand für das Ergebnis geradesteht. Eine deutsche Entsprechung hat sich bisher nicht durchgesetzt.
Kapitel 01 · Was Vibe-Coding istSequoia Ascent 2026 summarysiehe Vibe Codingsiehe Agentsiehe Harness
Anrufweitergabe
Das Umlegen eines laufenden Anrufs an eine andere Gegenstelle.
Seit 2009 spezifiziert, in drei Formen: ohne Ankündigung, mit Rückfrage und mit Ankündigung. Der Unterschied hat eine praktische Folge, denn bei der angekündigten Form besteht die Verbindung zum Anrufer fort. Ist das Ziel unerreichbar, lässt sich der Anruf zurückholen.
auchTransfer · Call Transfer · REFER
Kapitel 08 · Eskalation an einen MenschenRFC 5589, SIP Call Control, TransferRFC 3515, The Session Initiation Protocol (SIP) Refer Methodsiehe Session Initiation Protocolsiehe Eskalation
Barge-in
Ins Wort fallen: Jemand redet, während das System noch spricht.
Meldet die Erkennung eine Unterbrechung, bricht das Modell seine laufende Erzeugung ab und verwirft sie. Damit ist die halbe Arbeit getan. Der bereits gesendete Ton liegt im Abspielpuffer der Anwendung und läuft weiter, bis diese ihn selbst leert; ein System, das nur auf das Signal reagiert, redet nach der Unterbrechung noch sekundenlang.
auchHineinreden · Unterbrechung
Kapitel 03 · Wenn das Gespräch nicht in Runden läuftGoogle, Live API capabilities guidesiehe Voice Activity Detectionsiehe Sprachsynthese
Blocking Tool Call
Die Voreinstellung: Das Gespräch hält an, bis das Ergebnis da ist.
Ein Tool Call läuft der Reihe nach. Das Modell legt die Argumente ab, die Anwendung führt aus, schickt das Ergebnis zurück und bittet dann um eine Antwort. Im Chatfenster ist das ein Ladebalken, im Gespräch eine Stille. Es gibt eine Einstellung, mit der der Aufruf im Hintergrund läuft; sie verschiebt die Aufgabe in die Anwendung, denn ein Ergebnis kann dann zu einem Zeitpunkt eintreffen, an dem das Gespräch längst woanders steht.
auchBlockierender Werkzeugaufruf · Sequential Function Calling · Blocking Tool Use
Kapitel 06 · Tools anbindenGoogle, Tool use with Live APIsiehe Latenzsiehe Preamble
Chain-of-ThoughtCoT
Eine Prompt-Technik: Das Modell schreibt vor der Antwort seinen Lösungsweg aus und kommt dadurch bei Rechen- und Textaufgaben öfter zum richtigen Ergebnis.
Jason Wei und Mitautoren bei Google zeigten am 28.01.2022, dass dafür wenige Beispiele in der Eingabe genügen, in denen der Weg ausgeschrieben ist. Acht solcher Beispiele brachten ein Modell mit 540 Milliarden Parametern bei Textaufgaben auf den damaligen Höchststand. Die Technik wirkt allein über die Eingabe. Reasoning-Modelle holen denselben Gedanken seit 2024 ins Training und erzeugen ihre Zwischenschritte von selbst.
auchCoT · Chain of Thought · Gedankenkette · Lösungsweg im Prompt
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models2022 · Zwischenschritte im Promptsiehe Reasoning-Modellsiehe Few Shotsiehe Prompt
Computer Vision
Das Fachgebiet, das aus Bildpunkten nachrechenbare Aussagen macht: Klassen, Koordinaten, Flächen.
Vier Aufgaben stehen dahinter, und sie liefern verschiedene Antwortformen: eine Klasse für das ganze Bild, ein Rechteck um ein einzelnes Ding, eine Klasse je Bildpunkt, oder ein Abstand zwischen zwei Aufnahmen. Ein Sprachmodell mit Bildeingang beantwortet die erste Frage in Prosa und misst dabei nichts; dafür steht der eigene Begriff multimodal.
auchBilderkennung · maschinelles Sehen · Bildverarbeitung
Kapitel 05 · Computer VisionMicrosoft COCO: Common Objects in Contextsiehe Objekterkennungsiehe Multimodalsiehe Neuronales Netz
Conversational AICAI
Sammelbegriff für Systeme, die man bedient, indem man mit ihnen redet.
Dazu gehören das Chatfenster, die Assistenz im Auto und der Sprachagent am Telefon. In der Mitte steht in allen Fällen ein Sprachmodell mit Text auf beiden Seiten; wo gesprochen wird, kommen vorn die Erkennung und hinten die Sprachsynthese dazu. Der Begriff beschreibt die Bedienform und sagt nichts darüber, wie viel das System selbst entscheidet.
auchCAI · Dialogsystem · Sprachdialogsystem · Chatbot
Kapitel 01 · Was Conversational AI istsiehe Sprachagentsiehe Natural Language Processingsiehe Sprachmodell
Dual-Tone Multi-FrequencyDTMF
Der zweite Eingabekanal am Telefon, der an der Stimme vorbeiläuft.
„Drücken Sie die Eins“ überträgt keinen Ton, sondern ein benanntes Ereignis. Der Grund steht in der Spezifikation: Sprachcodecs mit niedriger Bitrate geben solche Doppeltöne nicht zuverlässig genug wieder, damit eine Maschine sie erkennt. Die Empfehlung geht weiter und rät der Vermittlungsstelle, den mitgelieferten Ton gar nicht erst auszuwerten, weil die Kompression selbst Töne erzeugen kann, die niemand gedrückt hat.
auchTastenwahl · Mehrfrequenzwahlverfahren
Kapitel 04 · Über das TelefonRFC 4733, RTP Payload for DTMF Digits, Telephony Tones, and Telephony Signalssiehe Session Initiation Protocol
Eskalation
Die Übergabe eines laufenden Gesprächs an einen Menschen.
Eine der zwei Formen von Human in the Loop. Beim Tastenmenü war der Auslöser eine Taste und stand damit fest; bei einem Sprachagenten muss eigens entschieden werden, wo das System aufhört. Was dabei an Zusammenhang mitgeht, gibt kein Protokoll vor.
auchÜbergabe an einen Menschen · Handoff · Human Handoff
Kapitel 08 · Eskalation an einen MenschenRasa, Fallback and Human HandoffRasa, Patternssiehe Human in the Loopsiehe Sprachagentsiehe Interactive Voice Response
Few Shot
Ein paar Beispiele in der Eingabe, an denen das Modell erkennt, was es tun soll, ohne dafür trainiert zu sein.
Vor GPT-3 brauchte jede neue Aufgabe ein eigenes Nachtraining mit beschrifteten Daten. Seither genügt es oft, zwei oder drei gelöste Fälle in die Eingabe zu schreiben. Ohne Beispiel heißt es Zero Shot, mit einem einzigen One Shot. Das Modell lernt dabei nichts dazu: Nach der Antwort ist der Zusammenhang wieder weg, und beim nächsten Aufruf muss er erneut mitgegeben werden. Am stärksten wirken Beispiele, die das Format zeigen, in dem die Antwort stehen soll.
auchFew-Shot · Zero Shot · One Shot · Beispiele in der Eingabe · In-Context Learning
Kapitel 15 · Wofür man ein Sprachmodell benutztLanguage Models are Few-Shot Learners2020 · GPT-3siehe Promptsiehe Kontextsiehe Fine-Tuning
Interactive Voice ResponseIVR
Das Telefonmenü, das Ansagen vorliest und auf Tastendrücke wartet.
Der Vorgänger des Sprachagenten. Der Ablauf war abzählbar, und genau darin lag seine Stärke: Der Ausstieg zu einem Menschen stand als Menüpunkt fest. Ein System, das ganze Sätze versteht, hat diese Stelle nicht mehr von selbst.
auchSprachdialogsystem · Telefonmenü
Kapitel 08 · Eskalation an einen Menschensiehe Dual-Tone Multi-Frequencysiehe Eskalation
Kontext
Alles, was dem Modell bei einer Anfrage mitgegeben wird. Was nicht darin steht, existiert für das Modell nicht.
Der Kontext ist der Arbeitsspeicher des Modells: Er wird bei jeder Anfrage neu zusammengesetzt und mitgeschickt. Dass ein Chatprogramm sich an gestern erinnert, leistet die Anwendung, indem sie das Gespeicherte jedes Mal erneut hineinlegt.
auchContext · Arbeitsspeicher · Gesprächsverlauf
Kapitel 01 · Was ein Sprachmodell istKapitel 02 · Was ein Sprachmodell tutKapitel 05 · Der Promptsiehe Kontextfenstersiehe Promptsiehe RAG
Kontextfenster
Die Obergrenze an Token, die ein Modell in einem Durchgang gleichzeitig berücksichtigen kann.
Ist das Fenster voll, muss etwas weichen, und was weicht, ist für das Modell nicht mehr vorhanden. Ein größeres Fenster ist deshalb kein besseres Gedächtnis, sondern nur ein größerer Tisch. Ein Gespräch je Thema ist meist wirksamer als ein sehr langes Gespräch über alles.
auchContext Window · Fenstergröße · Kontextlänge
Kapitel 03 · Token, die Bausteine der SpracheKapitel 05 · Der Prompt2024 · Eine Million Token2023 · 100.000 Token, ein Dokument passt hineinsiehe Kontextsiehe Token
Objekterkennung
Die Aufgabe, Dinge im Bild zu finden und je Fund ein Rechteck mit einer Klasse auszugeben.
Die Antwort besteht aus vier Zahlen und einem Etikett, und beide Teile können einzeln falsch sein. Gemessen wird über die Überlappung zwischen vorhergesagtem und hinterlegtem Rechteck: Ab einem festgelegten Anteil gilt der Fund als Treffer. Diese Schwelle ist eine Festlegung des Messprotokolls, weshalb sich Erkennungszahlen aus zwei Quellen selten vergleichen lassen.
auchBounding Box · Detektion · Objektdetektion · IoU
Kapitel 05 · Computer VisionYou Only Look Once: Unified, Real-Time Object DetectionMicrosoft COCO: Common Objects in Contextsiehe Computer Visionsiehe Klassifikationsiehe Benchmark
Physical AI
KI-Systeme, bei denen am Ausgang eine Bewegung steht: Roboter, Fahrzeuge, Laborgeräte.
Der Sammelbegriff für Modelle, die in der physischen Welt handeln statt auf einem Bildschirm. Populär gemacht hat ihn NVIDIA, das auf Deutsch von physischer KI spricht. Das Nadelöhr sind die Daten: Für Text liegt das Netz bereit, für Bewegung muss jede Fähigkeit mit genau dem Roboter und für genau die Aufgabe erhoben werden. Deshalb wird viel in Simulationen und in Weltmodellen geübt. Die übliche Bauform ist das VLA-Modell.
auchPhysische KI · Embodied AI · verkörperte KI · Robotik-Grundmodell
Kapitel 14 · Physical AINVIDIA Releases New Physical AI Models as Global Partners Unveil Next-Generation Robotsπ0: Our First Generalist PolicyPreviewing the Model Hardware Standardsiehe VLA-Modellsiehe Weltmodellsiehe Computer Visionsiehe Multimodal
Preamble
Der kurze Satz, mit dem ein Sprachagent ankündigt, dass er gleich arbeitet.
Ein Tool Call oder eine Suche hält das Gespräch an, und Stille ist im Gespräch eine Aussage. Der Hersteller führt die Ansage deshalb als eigenes Bauteil und nennt beide Seiten: Gut gemacht beruhigt sie, schlecht gemacht erhöht sie die gefühlte Wartezeit, weil sie das Warten benennt, ohne es zu verkürzen. Empfohlen sind Sätze, die die Handlung nennen; abgeraten wird von Formeln, die den Zustand der Maschine beschreiben.
auchAnsage vor der Wartezeit · Füllsatz
Kapitel 05 · Wissen anbindenKapitel 06 · Tools anbindenOpenAI, Using realtime modelssiehe Latenzsiehe Sprachagent
Prompt
Die Eingabe an ein Sprachmodell. Nicht nur die getippte Frage, sondern alles, was das Modell zu sehen bekommt.
Zum Prompt gehören die Systemanweisung, die Nutzereingabe, der bisherige Gesprächsverlauf und die Ergebnisse aufgerufener Tools. Wer nur die getippte Zeile für den Prompt hält, wundert sich über Antworten, die auf etwas Bezug nehmen, das nirgends sichtbar steht.
auchEingabe · Anweisung · Systemprompt · Prompting
Kapitel 05 · Der PromptBeitrag · Warum ich eine eigene Diktier-App gebaut habe2020 · GPT-3siehe Kontextsiehe Kontextfenstersiehe Few Shot
Prompt Engineering
Die Arbeit an der Eingabe, damit ein Modell verlässlich das liefert, was gebraucht wird: Aufgabe, Ziel, Kontext, Beispiele, Ausgabeform.
In den Ratgebern stand der Begriff lange für eine Trickkiste: Rollenzuweisungen, Zauberformeln, Denkanweisungen. Davon hat wenig einen Modellwechsel überstanden. Was bleibt, ist unspektakulär und hält seit Jahren: eine Aufgabe je Prompt, ein überprüfbares Ziel, der Kontext, den das Modell nicht wissen kann, Beispiele für die Form der Antwort, und eine Messung, ob es funktioniert. Dass ein Modell aus wenigen Beispielen in der Eingabe eine Aufgabe übernimmt, war 2020 der Befund, mit dem diese Arbeit anfing. Die Hersteller führen dazu Leitfäden, die sie mit jeder Modellfassung überarbeiten; der zu GPT-5.6 rät, wiederholte Anweisungen und Beispiele wieder herauszunehmen und nur zu behalten, was eine Produktanforderung festhält oder eine gemessene Lücke schließt. Ein Prompt ist damit ein Artefakt mit Ablaufdatum, und die Arbeit daran endet nicht mit dem ersten, der funktioniert.
auchPrompt-Engineering · Prompting-Technik · Prompt Design
Kapitel 06 · Gute Prompts schreibenAnthropic, Prompting best practicesOpenAI, Model guidance für GPT-5.6Language Models are Few-Shot Learnerssiehe Promptsiehe Few Shotsiehe Kontext
Session Initiation ProtocolSIP
Das Protokoll, über das ein Anruf zustande kommt, auch der bei einem Sprachagenten.
Session Initiation Protocol regelt das Klingeln, das Annehmen und das Auflegen. Der Ton läuft daneben über einen eigenen Weg. Für einen Sprachagenten heißt das: Der eingehende Anruf erreicht die Anwendung als Nachricht an eine hinterlegte Adresse, und erst beim Annehmen wird die Sitzung eingerichtet, mit Anweisung, Stimme und Tools. Das Ablehnen ist ein eigener Aufruf und damit eine Entscheidung, die es im Chatfenster nicht gibt.
auchSIP
Kapitel 04 · Über das TelefonOpenAI, Realtime API with SIPsiehe Abtastratesiehe Conversational AI
Strukturierte Ausgabe
Ein Schema, an das ein Modell seine Antwort halten muss, damit ein Programm sie weiterverarbeiten kann.
Seit 2023 lässt sich einem Aufruf ein Schema mitgeben, inzwischen ist die Einhaltung erzwingbar. Gesichert ist damit die Form: Die Ausgabe ist gültiges JSON mit den verlangten Feldern. Ob der herausgezogene Betrag der richtige ist, sagt das Schema nicht, und diese Trennung ist die wichtigste Auskunft dazu. Von allen Aufgabenformen ist diese am billigsten zu prüfen, weil ein Programm über die Gültigkeit entscheiden kann.
auchStructured Output · JSON-Modus · Schema-Zwang
Kapitel 15 · Wofür man ein Sprachmodell benutztKapitel 11 · Über die APIFunction calling and other API updatessiehe Toolsiehe API Key
Temperatur
Eine Einstellung, die bestimmt, wie weit die Bewertungen für die Ziehung auseinandergezogen werden.
Niedrige Temperatur führt zu vorhersagbaren, gleichförmigen Antworten, hohe zu abwechslungsreichen und riskanteren. Dass dieselbe Frage zweimal unterschiedlich beantwortet wird, ist deshalb im Normalfall eine Einstellung und selten eine Fehlfunktion. Auch der niedrigste Wert verspricht keine Wiederholbarkeit, denn er hält nur die Ziehung fest; die Bewertungen davor hängen daran, wie viele fremde Anfragen im selben Moment mitlaufen.
auchTemperature
Kapitel 12 · Wie zufällig die Antwort istsiehe Inferenzsiehe Sampling
Vibe Coding
Programmieren, bei dem der Schwerpunkt vom Schreiben des Codes auf das Beschreiben und Prüfen verschiebt.
Der Begriff kam 2025 auf. Er beschreibt weniger ein Werkzeug als eine Arbeitsteilung: Absicht formulieren, Ergebnis prüfen, nachsteuern. Die Schwierigkeit wandert damit vom Tippen zum Beurteilen, und die Prüfung wird zum Engpass.
auchVibecoding · KI-gestütztes Programmieren
Beitrag · Warum ich eine eigene Diktier-App gebaut habe2025 · „Vibe Coding“ bekommt einen Namen2024 · Cursor Composer, der Editor baut selbst umsiehe Agentsiehe Harnesssiehe Test-Driven Development
Work IQ
Microsofts Schicht zwischen einem Sprachmodell und den Inhalten einer Organisation. Sie entscheidet, was ein Copilot von Postfächern, Dateien und Besprechungen zu sehen bekommt.
Die Schicht liest fortlaufend mit, was in einem Mandanten geschieht, und baut daraus eine durchsuchbare Ordnung über Microsoft 365 und angebundene Fremdsysteme. Jede Antwort ist dabei auf die Rechte des fragenden Kontos beschnitten, was einen doppelten Boden hat: Eine zu weit gefasste Freigabe bleibt unauffällig, solange sich niemand durch die Ordner klickt, und wird durch eine Suche über den gesamten Bestand an einem Nachmittag sichtbar. In der Oberfläche erscheint die Schicht als Schalter, mit dem sich die Verankerung in den Firmendaten zu- und abschalten lässt. Der Zugang zur Schnittstelle hängt am Verbrauch. Für Lizenzierte ist er in allen Copilot-Anwendungen enthalten, für alle anderen wird er nach Nutzung abgerechnet.
auchWorkIQ · Microsoft Work IQ · Work-IQ-Schalter
Beitrag · Welcher Copilot in welchem Microsoft-365-Paket stecktBeitrag · Welchen Copilot habe ich?Beitrag · Was vor der Copilot-Einführung zu klären istWork IQ overviewMicrosoft Copilot overviewsiehe RAGsiehe Groundingsiehe Mandant
Zero-Shot
Eine Aufgabe ohne jedes Beispiel im Prompt lösen, allein aus der Anweisung.
Der Gegenbegriff zu Few-Shot, wo einige Beispiele mitgegeben werden. Dass beides überhaupt geht, war der Befund von 2020 und der Grund, warum ein einzelnes Modell viele Aufgabenformen bedienen kann: Vorher brauchte jede Aufgabe ihr eigenes Training und ihre eigene Datensammlung. Ob Beispiele nützen, hängt von der Form ab; beim Einordnen helfen sie meist, beim Umformen selten.
auchohne Beispiel
Kapitel 15 · Wofür man ein Sprachmodell benutztLanguage Models are Few-Shot Learnerssiehe Few Shotsiehe Prompt