Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenConversational AIKapitel 03von 12 im Pfad

Wenn das Gespräch nicht in Runden läuft

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Ein Chatfenster arbeitet in Runden. Sie tippen, drücken Enter, das Modell antwortet, Sie sind wieder dran. Enter ist dabei mehr als eine Taste: Es ist das Zeichen, dass Sie fertig sind.

Im Gespräch gibt es diese Taste nicht. Jemand muss also entscheiden, wann ein Beitrag zu Ende ist, und dieser Jemand ist ein Programm.

Der Schalter davor

Das Bauteil heißt Voice Activity Detection, abgekürzt VAD, auf Deutsch Sprachaktivitätserkennung. Es hört das Mikrofon ab und schneidet den laufenden Ton in Stücke, die an das Modell gehen. Die einfache Bauart nimmt dafür die Stille:

It uses periods of silence to automatically chunk the audio. (externe Seite, developers.openai.com)

Das klingt naheliegend und geht oft schief. Menschen machen Pausen mitten im Satz, wenn sie nachdenken, eine Nummer vorlesen oder nach dem richtigen Wort suchen. Für ein Programm, das auf Stille wartet, sieht jede Denkpause aus wie ein Satzende.

Die zweite Bauart hört auf die Wörter

Deshalb gibt es inzwischen eine andere, die den Inhalt heranzieht:

Semantic VAD is a new mode that uses a semantic classifier to detect when the user has finished speaking, based on the words they have uttered. (externe Seite, developers.openai.com)

Der Maßstab ist damit der angefangene Satz und seine Vollständigkeit. Den Gewinn beschreibt der Anbieter in der Sprache der Vorsicht:

With this mode, the model is less likely to interrupt the user during a speech-to-speech conversation, or chunk a transcript before the user is done speaking. (externe Seite, developers.openai.com)

Less likely, also seltener. Eine Garantie steht da nicht: Ob jemand fertig geredet hat, weiß im Zweifel nur er selbst.

Beide Bauarten sind Einstellungssache

Die Dokumentation führt für die erste Bauart vier Stellschrauben auf: wie laut es sein muss, wie viel Ton vor dem erkannten Beginn mitgeschickt wird, wie lange die Stille dauern soll, und ob nach dem Ende sofort geantwortet wird. Die zweite kennt stattdessen vier Stufen von zurückhaltend bis vorschnell.

Das ist die eigentliche Nachricht dieses Abschnitts. Wo ein Beitrag endet, ist eine Einstellung, getroffen von jemandem, der die Sprecher nie gehört hat. Wer sie zu eng wählt, baut ein System, das ins Wort fällt; wer sie zu weit wählt, eines, das nach jedem Satz schweigt.

Die offene Verbindung

Der Gegensatz zum Chatfenster liegt in der Verbindung. Statt einer Anfrage mit einer Antwort läuft ein Strom, der offen bleibt, und in dem beide Seiten jederzeit etwas beitragen können:

By default, the model automatically performs VAD on a continuous audio input stream. (externe Seite, ai.google.dev)

Genau deshalb steht dieses Thema in einem eigenen Kapitel, getrennt von der Erkennung in Kapitel 02. Eine offene Verbindung mit beidseitigem Zugriff gibt es auch dort, wo getippt wird, und alle Fragen dieses Kapitels stellen sich dann genauso.

Quellen

4 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Dokumentationerreichbar

    OpenAI, Voice activity detection (VAD) (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Seite hinter dem Schalter, der entscheidet, ob eine Aufnahme überhaupt beim Modell ankommt. Zwei Betriebsarten stehen dort nebeneinander: eine Lautstärkeschwelle, die lauteren Ton verlangt und in lauter Umgebung besser fährt, und eine zweite, die stattdessen anhand der gesprochenen Wörter entscheidet, ob jemand zu Ende geredet hat. Beleg dafür, dass die Lautstärkeprüfung vor der Erkennung ein dokumentierter Griff der Anbieter ist, und dafür, wo sie aufhört.

  • Dokumentationerreichbar

    Google, Live API capabilities guide (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Die Beschreibung zweier Einstellungen, die es nur beim durchgehenden Modell gibt: Das Modell darf entscheiden, ob es überhaupt antwortet, und es richtet seinen Ton nach dem des Gegenübers. Beides setzt voraus, dass mehr ankommt als der Wortlaut. Beide laufen nur über eine Vorabfassung der Schnittstelle und fehlen im neuesten Live-Modell des Anbieters, was die Seite unter jeder der beiden vermerkt. Dieselbe Seite vergleicht inzwischen drei Modelle in einer Tabelle: Das aktuelle Live-Modell führt Denken fest verdrahtet ohne wählbare Stufe, die Fassung mit ausgedehntem Denken erlaubt niedrig, mittel und hoch, und nur beim als Vorgänger geführten Gemini 3.1 Flash Live Preview gibt es zusätzlich die niedrigste Stufe als Voreinstellung, mit der Antwortzeit begründet. Sie beschreibt außerdem das Hineinreden: Das Modell verwirft seine laufende Erzeugung, und im Kommentar des Codebeispiels zum Feld interrupted steht, dass die Anwendung den schon gesendeten Ton selbst aus ihrem Puffer räumen muss. Die Erkennung der Sprechpausen lässt sich abschalten und an den Client übergeben. Der Preis dafür steht daneben: Die Pufferung auf der Gegenseite entfällt, und die Seite nennt 500 Millisekunden Stille als Untergrenze für die eigene Erkennung.

  • Originalarbeiterreichbar

    W3C, Media Capture and Streams (externe Seite, w3.org)

    w3.orggeprüft 24.09.2026

    Die Spezifikation der Aufnahme im Browser, und der einzige Ort, an dem die Echo-Unterdrückung als eigene Einstellung beschrieben wird. Sie steht dort neben der Pegelregelung und der Rauschunterdrückung, mit zwei Betriebsarten für die Frage, ob nur die Gegenseite oder auch der eigene Ton aus dem Mikrofonsignal gerechnet wird. Weder OpenAI noch Google erwähnen Echo in ihrer Dokumentation zur Sprachschnittstelle: Der Griff sitzt vor der Schnittstelle, im Browser oder im Gerät.

  • Dokumentationerreichbar

    OpenAI, Text to speech (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Seite zur Sprachausgabe, mit zwei Angaben, die für ein Gespräch zählen. Der Ton kommt stückweise und lässt sich abspielen, bevor die Datei fertig ist; ohne das käme die Antwort erst nach der letzten Silbe. Und die Stimme wird über eine Anweisung in Prosa geführt, mit einer Liste dessen, was sich damit erreichen lässt: Akzent, Gefühlsspanne, Betonung, Nachahmung, Tempo, Klangfarbe, Flüstern.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.