GrundlagenConversational AIKapitel 01von 12 im Pfad
Was Conversational AI ist
Der Begriff sammelt Systeme, die man bedient, indem man mit ihnen redet. Das Chatfenster gehört dazu, die Assistenz im Auto, und die Stimme in der Warteschleife, die auf einen ganzen Satz antwortet statt auf eine Taste.
Ein Kern, zwei Enden
So ist die verbreitete Bauform gebaut: In der Mitte ein Sprachmodell, das Text bekommt und Text zurückgibt. Wer tippt, schickt seinen Text direkt hinein. Wer spricht, braucht an beiden Enden einen Übersetzer, vorn einen von Ton nach Text und hinten einen zurück.
Dieses Kapitel beschreibt durchweg diese Kette, weil sich an ihr die Begriffe auseinanderhalten lassen. Daneben steht eine zweite Bauform, in der ein einziges Modell den Ton unmittelbar verarbeitet; sie kommt in Kapitel 02 an die Reihe, zusammen mit dem, was jede der beiden kostet.
Dass die Bedienung selbst zu Text wurde, ist keine alte Sache. Die Arbeit, die 2020 GPT-3 vorstellte, beschreibt es als das Neue an diesem Modell:
Vorher war die Bedienung eines Sprachsystems eine Sache für Entwickler. Seither ist sie der Text selbst, und deshalb sieht ein Chatfenster aus wie ein Chatfenster.
Die drei Stufen und ihre Namen
Spracherkennung, englisch Speech-to-Text, abgekürzt STT. Sie macht aus Ton Text. Was sie dabei verliert und wie gut sie inzwischen ist, steht im nächsten Kapitel.
Das Sprachmodell. Es bekommt den Text und erzeugt die Antwort, genau wie im Chatfenster.
Sprachsynthese, englisch Text-to-Speech, abgekürzt TTS. Sie macht aus Text Ton. Auch sie arbeitet in Stücken, damit die Antwort anfangen kann, bevor sie fertig ist:
Wer die Namen einmal auseinanderhält, liest jede Produktbeschreibung anders. Wie die beiden Bauteile innen arbeiten, steht in KI-Wissen, Kapitel 07 und KI-Wissen, Kapitel 08. STT und TTS stehen dort als Bausteine, die sich einzeln austauschen lassen, solange die Bauform das hergibt. Welche zwei es davon gibt, steht in Kapitel 02.
Wo Reden aufhört und Handeln anfängt
Ein System, das Fragen zur Bestellung beantwortet, und eines, das die Bestellung storniert, klingen im Gespräch gleich. Der Unterschied liegt am Ende: Beim einen entsteht ein Satz, beim anderen eine Buchung.
Damit ist auch gesagt, worin er nicht liegt. Die Stimme macht aus einem Auskunftssystem keinen Agenten, und ein Tastaturchat kann sehr wohl einer sein. Die Linie verläuft bei der Frage, wer die Reihenfolge der Schritte bestimmt, und die ist in Agenten und Harness, Kapitel 01 gezogen.
Für dieses Kapitel reicht die Staffelung:
| Was es tut | Womit man es baut |
|---|---|
| antwortet auf Fragen | Modell, Anweisung |
| antwortet aus eigenen Unterlagen | dazu eine Suche, siehe Agenten und Harness, Kapitel 03 |
| löst etwas aus | dazu Tools, siehe Agenten und Harness, Kapitel 02 |
| entscheidet die Reihenfolge selbst | ein Agent, siehe Agenten und Harness, Kapitel 01 |
Jede Zeile setzt die darüber voraus. Der Sprung, der zählt, liegt zwischen Zeile zwei und drei: Ab dort kann etwas passieren, das sich nicht durch Nachfragen zurücknehmen lässt.
Was die beiden mittleren Zeilen im Gespräch kosten, steht in Kapitel 05 und Kapitel 06.
Warum die Zeit hier zählt
Ein Chatfenster darf drei Sekunden überlegen. Der Cursor blinkt, das ist eine bekannte Form des Wartens, und wer die Antwort dann bekommt, empfindet nichts Besonderes dabei.
Im Gespräch ist dieselbe Pause eine Störung. Nach etwa einer Sekunde Stille fragen Menschen nach, ob die Gegenseite noch da ist. Das gilt am Telefon seit Jahrzehnten und ändert sich nicht dadurch, dass am anderen Ende eine Maschine sitzt. Was dieser Kanal sonst noch mitbringt, steht in Kapitel 04.
Daraus folgt fast alles, was diesen Bereich von der getippten Anwendung unterscheidet: Die Erkennung darf nicht auf das Satzende warten, die Antwort muss anfangen, bevor sie fertig gedacht ist, und jede Suche unterwegs kostet Zeit, die hörbar ist.
Wer entscheidet, wann jemand zu Ende geredet hat, und was passiert, wenn mittendrin jemand dazwischenredet: Das nimmt sich Kapitel 03 vor.
Gesprächssysteme gab es lange vor den Sprachmodellen. Sie waren anders gebaut, und wer diesen Bau einmal gesehen hat, erkennt danach besser, was im heutigen Modell alles mit drinsteckt.
Fünf Stufen, von denen drei sichtbar blieben
Rasa ist ein Werkzeugkasten für solche Systeme, und seine Dokumentation beschreibt den Aufbau in einem Satz:
Das erste Bauteil nimmt den Text und macht daraus etwas, womit ein Programm rechnen kann:
Das zweite entscheidet, was daraufhin geschieht:
Mit der Erkennung davor und der Ausgabe dahinter ergibt das fünf Stufen: Ton zu Text, verstehen, entscheiden, formulieren, Text zu Ton. Heute stehen an derselben Stelle drei, und die drei mittleren sind zu einer geworden.
seitlich verschiebbar
eigene Darstellung, Stand 07.08.2026
Absicht und Merkmal
Zwei Begriffe aus dem Zitat lohnen sich, weil sie in jeder Beschreibung eines Dialogsystems vorkommen.
Die Absicht, englisch intent. Sie ordnet die Äußerung einer Klasse zu:
Der wichtigste Teil steht am Ende: defined in the domain file. Die möglichen Absichten stehen in einer Datei, gepflegt von Hand, eine Liste mit vierzig oder zweihundert Einträgen.
Das Merkmal, englisch entity. Es zieht die Einzelheiten heraus:
Aus „Ich möchte meinen Termin am Dienstag verschieben“ wird damit die Absicht
termin_verschieben und das Merkmal Dienstag vom Typ Datum. Ab hier arbeitet
das System mit zwei Werten, und der Satz selbst wird weggeworfen.
Wer etwas sagte, das auf keine Absicht der Liste passte, bekam die Fallback-Antwort. „Das habe ich leider nicht verstanden“ war die wörtliche Auskunft über den Zustand des Systems.
Formuliert wurde nichts
Im ersten Zitat steht ein dritter Begriff, der leicht überlesen wird: response retrieval, also Abruf. Die Antwort wurde aus einer Sammlung geholt. In der Datei stand für jede Absicht ein Satz, oft drei bis vier zur Abwechslung, und das System wählte einen davon aus.
Das erklärt, warum diese Systeme klangen, wie sie klangen. Jeder Satz, den sie sagten, hatte vorher ein Mensch geschrieben. Alles, was darin stand, war verantwortet; alles, was nicht darin stand, konnte nie gesagt werden.
Woher das Kürzel NLP kommt
NLP steht für Natural Language Processing, Sprachverarbeitung. Das ist der Oberbegriff für das ganze Feld, und er ist älter als jedes Sprachmodell. NLU ist der Teil davon, der eine Äußerung versteht, NLG die Gegenrichtung, Natural Language Generation, das Formulieren einer Ausgabe.
Wie dieses Feld vor den großen Modellen arbeitete, beschreibt die Arbeit zu GPT-3 in ihrem ersten Absatz:
Jede Aufgabe brauchte ihre eigene Sammlung: Übersetzen, Zusammenfassen, Absichten erkennen, Namen finden. Wie diese Verfahren gearbeitet haben, steht in KI-Wissen, Kapitel 06. Vier Aufgaben, vier Datensammlungen, vier Trainingsläufe, und wer eine fünfte wollte, fing von vorn an. Ein Dialogsystem für eine Bank ließ sich für eine Versicherung nur mit neuem Material aufsetzen.
Was der Wechsel gebracht hat
Der Gewinn ist der offensichtliche Teil. Das Modell versteht Formulierungen, die in keiner Liste stehen, antwortet auf Nachfragen, wechselt das Thema mit und kommt zurück. Ein Aufwand von Monaten schrumpft auf eine Anweisung in Prosa. Wie die aussieht, steht in Grundkurs, Kapitel 06.
Der Verlust ist unauffälliger und deshalb der wichtigere Teil dieses Kapitels. Die Liste der Absichten war eine Beschränkung, und sie war zugleich eine Garantie: Ein System mit vierzig Absichten konnte über nichts anderes sprechen. Was es sagte, hatte jemand vorher geschrieben, und was es verstand, war abzählbar.
Beides ist weg. Ein Sprachmodell antwortet auf alles, auch auf das, was niemand vorgesehen hat, und formuliert dabei Sätze, die vorher nirgends standen. Der Rahmen, den früher der Aufbau erzwang, muss seither eigens gebaut werden. Das ist der Grund, warum es in diesem Bereich ein Wort wie Guardrails überhaupt gibt.
Die drei mittleren Stufen sind im Modell aufgegangen. Was das für den Bau bedeutet, zeigt sich an drei Fragen: Wo kann man eingreifen, was lässt sich messen, und wo liegt der Zustand des Gesprächs.
Jede Stufe war eine Adresse
Die Bauteile der alten Kette waren auch technisch getrennt. Jedes hatte eine Schnittstelle, und man konnte eines davon herausnehmen, ohne die anderen anzufassen. Die Formulierung der Antwort ließ sich sogar ganz aus dem System herausziehen:
Der Ablauf dahinter beschreibt genau die Arbeitsteilung:
Das System entschied also, dass geantwortet wird, und ein fremder Dienst entschied, wie. Wer die Formulierung ändern wollte, tauschte diesen Dienst und ließ die Dialogführung stehen. Wer die Dialogführung ändern wollte, machte es andersherum.
Heute liegt beides im selben Modell. Der Eingriff sitzt an einer einzigen Stelle, und diese Stelle ist Text: die Anweisung, die vor dem Gespräch steht. Sie entscheidet über Tonfall, Themengrenzen und Reihenfolge zugleich. Das ist bequem für den Anfang und unangenehm, sobald zwei Anforderungen einander widersprechen, weil es keine zwei Orte gibt, an denen sie getrennt stehen könnten.
Die Zahl, die früher anfiel
Was an der Verstehensstufe herauskam, war maschinenlesbar und hatte einen Wert. Die Bauteilliste zeigt es in ihren Ausgabebeispielen: eine erkannte Absicht, daneben ein Zahlenwert zwischen null und eins, und darunter die Rangfolge der übrigen Kandidaten. Aus dieser Zahl ließ sich eine Regel bauen, die keinen Ermessensspielraum hatte. Unter 0,4 wird nachgefragt, unter 0,2 wird an einen Menschen übergeben.
Ein Sprachmodell liefert diese Zahl nicht. Es gibt Wahrscheinlichkeiten, die hängen allerdings an einzelnen Token und sagen nichts darüber, wie sicher das Modell die Absicht getroffen hat; was dort tatsächlich gemessen wird, steht in Grundkurs, Kapitel 12. Wer eine Schwelle braucht, muss sie sich bauen, etwa indem er das Modell selbst nach einer Einschätzung fragt. Das ist dann eine Aussage des Modells über sich selbst. Gemessen wird dabei nichts.
Damit verschiebt sich die Prüfbarkeit von der Laufzeit in den Test. Beim alten Aufbau konnte das System im Betrieb erkennen, dass es unsicher war. Beim neuen muss vorher geprüft werden, wie es sich auf Beispieleingaben verhält, und zwar auf vielen. Was das praktisch heißt, steht in Vibe-Coding / Agentic Engineering, Kapitel 07.
Wo der Zustand liegt
Ein Gespräch hat einen Zustand: was schon gesagt wurde, welche Angaben vorliegen, welche noch fehlen, ob gerade ein mehrstufiger Vorgang läuft. Das alte Dialogmanagement führte ihn als Datensatz mit Feldern mit. Die Doku zeigt ihn im Anfrageformat an den Formulierungsdienst: eine Kennung des Gegenübers, die Sammlung der bislang gefüllten Felder, die letzte Äußerung samt erkannter Absicht und der gerade aktive Vorgang.
Der Gewinn dieser Bauform ist die Einsehbarkeit. Der Zustand liegt als Objekt vor, ein Programm kann ihn lesen, prüfen, protokollieren und verändern. Ob eine Angabe fehlt, ist eine Abfrage auf ein leeres Feld.
Beim Sprachmodell ist der Zustand der Kontext, also die Abfolge der bisherigen Beiträge; Grundkurs, Kapitel 02 zeigt, warum das so ist. Was das System „weiß“, steht damit im selben Text wie alles andere und lässt sich von dort nur wieder herauslesen, indem man das Modell danach fragt. Das ist der Grund, warum viele Sprachanwendungen den Zustand doppelt führen: einmal im Gespräch, damit das Modell natürlich reagiert, und einmal daneben in Feldern, damit ein Programm damit arbeiten kann.
Zwei Wahrheiten über denselben Zustand sind eine bekannte Fehlerquelle, und hier sind sie eingeplant. Die Frage beim Bau lautet deshalb, welche der beiden im Zweifel gilt. Üblich und richtig ist: Die Felder gewinnen, das Gespräch wird nachgezogen.
Was daraus für die Bauentscheidung folgt
Drei Dinge, die man vor der ersten Zeile Code beantwortet haben sollte.
Wo die Grenze herkommt. Früher war sie eine Eigenschaft des Aufbaus, die Liste der Absichten. Heute muss sie eigens gebaut werden, als Anweisung, als Prüfung vor der Ausgabe oder als beides. Der Aufbau selbst hält niemanden davon ab, über das Wetter zu reden, wenn er für Terminverschiebungen gedacht war. Wie diese Prüfungen aussehen und wo sie sitzen, steht in Kapitel 07.
Wo die Übergabe an einen Menschen sitzt. Beim alten Aufbau war der Auslöser eine Zahl. Beim neuen braucht es eine eigene Entscheidung, was das System als „hier höre ich auf“ erkennen soll, und diese Entscheidung ist inhaltlich. Kapitel 08 nimmt sich vor, was danach kommt.
Was protokolliert wird. Ein Datensatz mit Feldern lässt sich aufbewahren, durchsuchen und in eine Auswertung geben. Ein Gesprächsverlauf besteht aus Prosa, und wer daraus Kennzahlen ziehen will, braucht dafür einen weiteren Verarbeitungsschritt, der selbst wieder ein Modell sein kann und dann dieselben Fragen aufwirft. Was ein Durchlauf hinterlässt und was die Voreinstellung davon aufhebt, nimmt sich Kapitel 12 vor.
Quellen
5 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Originalarbeiterreichbar
Language Models are Few-Shot Learners (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
GPT-3, eingereicht am 28.05.2020. Zeigt, dass ein ausreichend großes Modell Aufgaben löst, für die es nie eigens trainiert wurde, wenn man ihm im Text ein paar Beispiele vorlegt. Das ist der Grund, warum Prompting überhaupt funktioniert. Die Zusammenfassung beschreibt außerdem, was vorher galt: Ein Sprachverarbeitungssystem brauchte für jede Aufgabe eigens gesammelte Beispiele, Tausende bis Zehntausende.
Dokumentationerreichbar
OpenAI, Text to speech (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Seite zur Sprachausgabe, mit zwei Angaben, die für ein Gespräch zählen. Der Ton kommt stückweise und lässt sich abspielen, bevor die Datei fertig ist; ohne das käme die Antwort erst nach der letzten Silbe. Und die Stimme wird über eine Anweisung in Prosa geführt, mit einer Liste dessen, was sich damit erreichen lässt: Akzent, Gefühlsspanne, Betonung, Nachahmung, Tempo, Klangfarbe, Flüstern.
Dokumentationerreichbar
Rasa, Architecture Overview (externe Seite, legacy-docs-oss.rasa.com)
legacy-docs-oss.rasa.comgeprüft 24.09.2026
Der Bauplan eines Dialogsystems aus der Zeit vor den Sprachmodellen, in zwei getrennten Stufen: eine für das Verstehen der Äußerung, eine für die Entscheidung über den nächsten Schritt. Beleg dafür, dass die beiden mittleren Stufen der Kette einmal eigene Bauteile mit eigenen Namen waren. In der Adresse steht das Wort Legacy, der Anbieter führt die Seite als Altbestand, deshalb liegt eine Archivfassung dabei.
Dokumentationerreichbar
Rasa, NLU Components (externe Seite, rasa.com)
rasa.comgeprüft 24.09.2026
Die Bauteilliste der Verstehensstufe, und damit die Erklärung zweier Begriffe, die in jeder Beschreibung eines Dialogsystems vorkommen: Die Absicht ordnet die Äußerung einer von mehreren vorher festgelegten Klassen zu, die Merkmalserkennung zieht Namen, Orte und Zahlen heraus. Eine feste Liste von Absichten ist der Unterschied zum Sprachmodell, das keine braucht.
Dokumentationerreichbar
Rasa, NLG Servers (externe Seite, legacy-docs-oss.rasa.com)
legacy-docs-oss.rasa.comgeprüft 24.09.2026
Der Beleg dafür, dass die Formulierungsstufe eines Dialogsystems ein eigener Dienst sein konnte, ansprechbar über eine Schnittstelle und austauschbar, ohne die Dialogführung anzufassen. Die Seite zeigt zugleich, was an dieser Stelle übergeben wurde: der Gesprächszustand mit seinen Feldern, der erkannten Absicht und deren Zahlenwert. Legacy-Adresse, deshalb mit Archivfassung.