GrundlagenConversational AIKapitel 04von 12 im Pfad
Über das Telefon
Ein Sprachagent, den man anrufen kann, braucht keine App, keine Anmeldung und keine Webseite. Er braucht eine Rufnummer. Das ist der Zugang, den auch die haben, die mit alldem sonst nichts zu tun haben wollen.
Der Anruf kommt als Ereignis an
Zwischen dem Telefonnetz und einem Sprachmodell steht ein Protokoll, das älter ist als alles andere in diesem Pfad:
SIP is a protocol used to make phone calls over the internet. (externe Seite, developers.openai.com)
Was danach passiert, sieht aus wie ein Klingeln und ist eine Nachricht. Der Anbieter meldet den eingehenden Anruf an eine Adresse, die man ihm vorher genannt hat, und wartet:
Annehmen und Ablehnen sind zwei getrennte Aufrufe. Die Dokumentation nennt beim Ablehnen sogar ein Beispiel dafür, wann man es tut: bei einer Länderkennzahl, die man nicht bedienen möchte. Das Telefon bringt also eine Entscheidung mit, die es im Chatfenster gar nicht gibt. Dort betritt niemand den Raum, den man nicht hereingelassen hätte.
Was die Leitung wegnimmt
Ton im Telefonnetz ist meistens grob. Das verbreitete Format misst achttausend Mal in der Sekunde, mit acht Bit je Messung; es geht auf eine Empfehlung aus der Zeit vor dem Internet zurück, und vieles, was daran hängt, richtet sich weiter danach.
Festgelegt ist das allerdings nur für dieses eine Format. Derselbe Standard führt daneben eines mit der doppelten Auflösung, und er sagt das ausdrücklich:
Welche der beiden Auflösungen an einem Gespräch ankommt, handeln die Endpunkte beim Verbindungsaufbau aus. Die Einzelheiten stehen in Tiefe 2.
Die Spracherkennung richtet sich nach einer anderen Zahl. Whisper rechnet auf 16.000 Messungen je Sekunde (externe Seite, arxiv.org) und bringt jede Aufnahme vorher auf diesen Wert. Über die schmale Leitung bekommt es die Hälfte davon, über die breite genau so viel.
Was das für die Erkennungsqualität bedeutet, steht hier bewusst nicht. Es gibt dazu keine Erhebung, die man ohne eigene Messung übernehmen könnte, und eine Vermutung mit einer Prozentzahl wäre schlechter als gar keine Zahl. Sicher ist die Richtung: Weniger Signal bleibt weniger Signal.
Und was er sonst noch wegnimmt
Das Zweite fällt erst auf, wenn man danach sucht. Am Telefon gibt es keinen Bildschirm.
Damit fällt eine ganze Klasse von Bedienelementen weg, die man beim Bauen einer Sprachanwendung im Browser unbewusst voraussetzt. Keine Liste zum Auswählen, keine Fußnote unter einer Auskunft, kein Bestätigungsdialog vor einer Buchung. Was in Agenten und Harness, Kapitel 02 ein Klick auf „Ja, ausführen“ ist, muss hier ein Satz werden, den jemand versteht und beantwortet.
Der Auskunft aus eigenen Unterlagen ist Kapitel 05 gewidmet, dem Tool Call Kapitel 06.
Drei Dinge unterscheiden einen Anruf von einer Verbindung aus dem Browser: wie er zustande kommt, in welcher Form der Ton ankommt, und was er zur Wartezeit beiträgt.
Wie ein Anruf zustande kommt
Der Ablauf hat zwei Schichten, und sie laufen über verschiedene Wege. Die Signalisierung, also das Klingeln, das Annehmen und das Auflegen, geht über SIP. Der Ton selbst geht daneben.
Für das eigene Netz heißt das zwei Freigaben. Die eine für die Signalisierung:
Die andere für den Ton, der über SRTP läuft, also über UDP mit Verschlüsselung. Wer schon einmal eine Telefonanlage hinter einer Firewall aufgesetzt hat, kennt beide Freigaben.
Der eingehende Anruf selbst ist ein Ereignis:
Daran hängt, was dabei noch offen ist. Die Sitzung wird erst beim Annehmen eingerichtet, mit Anweisung, Stimme und Tools. Wer je nach Rufnummer verschieden antworten will, entscheidet das also in dem Moment, in dem er abnimmt. Und wer gar nicht antworten will, hat den zweiten Aufruf:
Acht Bit, achttausend Mal in der Sekunde
Der Ton kommt meistens in einem der beiden Formate an, die das Telefonnetz am längsten kennt:
Die logarithmische Skalierung ist der Kniff, mit dem acht Bit für Sprache ausreichen: Leise Abstufungen bekommen mehr Auflösung als laute. Welche der beiden Rechenarten benutzt wird, ist eine geografische Frage:
PCMU denotes mu-law scaling, PCMA A-law scaling. (externe Seite, rfc-editor.org)
In Nordamerika und Japan mu-law, in Europa A-law. Die Taktrate steht in derselben Tabelle und ist für beide gleich, achttausend Messungen in der Sekunde.
Die Zeile darüber, und warum ihre Zahl in die Irre führt
Tiefe 1 zitiert sie: G.722 tastet mit 16.000 ab. In der Liste der Payload-Typen steht daneben trotzdem 8.000, und der Standard nennt das selbst einen alten Fehler, der aus Verträglichkeitsgründen stehen bleibt. Wer die Auflösung eines Gesprächs aus dieser Liste abliest, bekommt für diese eine Zeile die halbe Zahl angezeigt.
Deshalb gehört eine Angabe zur Auflösung immer an das Format, auf das sich die beiden Endpunkte geeinigt haben. Für PCMA und PCMU sind es achttausend Messungen, für G.722 sind es sechzehntausend.
Daneben die Zahl, mit der die Erkennung rechnet: Whisper bringt jede Aufnahme auf 16.000 Messungen je Sekunde (externe Seite, arxiv.org), bevor es sie überhaupt ansieht. Die Aufnahme aus dem Browser liefert das von sich aus, die schmale Leitung liefert die Hälfte. Was von dort ankommt, wird also hochgerechnet, und Hochrechnen erzeugt keine Information, die vorher gefehlt hat.
seitlich verschiebbar
eigene Darstellung nach RFC 3551 (Tabelle 4) und Whisper 2022 (Abschnitt 2.2), Stand 07.08.2026
Die Leitung im Latenzbudget
Die sechs Posten der Wartezeit stehen in Kapitel 03. Am Telefon kommt ein siebter dazu, die Strecke selbst: vom Endgerät zum Netzbetreiber, von dort zum Anbieter, und derselbe Weg zurück.
Auch dieser Posten steht hier ohne Zahl, aus demselben Grund wie fünf der sechs anderen. Es gibt keine Herstellerangabe dafür, weil es keine allgemeine geben kann: Die Strecke hängt am Netz, am Land und an der Zahl der Vermittlungen dazwischen. Wer sie kennen will, misst sie im eigenen Aufbau.
Was sich dagegen sagen lässt: Der Posten ist da, er ist spürbar, und er hängt als einziger an der Wahl des Netzwegs statt an der Wahl des Modells.
Zwei Eigenheiten des Telefons haben kein Gegenstück in der Anwendung im Browser: ein zweiter Eingabekanal, der an der Stimme vorbeiläuft, und eine Sitzung, die kürzer sein kann als das Gespräch darüber.
Der Kanal, der keine Sprache ist
„Drücken Sie die Eins“ ist älter als jedes Sprachsystem und funktioniert noch immer. Interessant daran ist, wie der Tastendruck übertragen wird.
Als Ton nämlich nur scheinbar. Die Spezifikation dafür hält den Grund in ihrer Einleitung fest:
Ein Sprachcodec ist auf Sprache abgestimmt. Was er wegwerfen darf, richtet sich danach, was ein Mensch hört, und ein Doppelton aus zwei festen Frequenzen fällt aus diesem Muster heraus. Er kommt an, klingt für ein Ohr richtig, und hat trotzdem nicht mehr die Genauigkeit, die eine Maschine braucht. Bei einem anderen Signal der Telefonie geht noch mehr verloren:
Die Lösung ist, den Tastendruck als benanntes Ereignis zu übertragen. Die Eins fährt als Eins über die Leitung. Der Fachbegriff für die Tastenwahl ist DTMF, kurz für Dual-Tone Multi-Frequency, und er benennt das Tonpaar, das eine Taste im alten Netz erzeugte. Und die Empfehlung an die Vermittlungsstelle geht einen Schritt weiter:
Das ist die eigentliche Pointe. Die Kompression erzeugt Töne, die niemand gedrückt hat. Wer beide Kanäle auswertet, den Ton und das Ereignis, holt sich Eingaben ins System, die nie stattgefunden haben.
Das Muster kehrt in diesem Pfad wieder. Der Kanal liefert etwas, das aussieht wie eine Eingabe, und die Anwendung muss entscheiden, welchem der beiden Wege sie glaubt. Bei der Voice Activity Detection in Kapitel 03 war es die eigene Ausgabe im Mikrofon, hier ist es ein Rechenartefakt.
Eine Sitzung endet, ein Gespräch vielleicht nicht
Die Sprachsitzung hat eine Obergrenze:
The maximum duration of a Realtime session is 60 minutes. (externe Seite, developers.openai.com)
Im Browser ist das eine Randbedingung. Am Telefon ist es eine Ansage, denn ein Anrufer legt nicht auf, weil im Hintergrund eine Sitzung abläuft. Wer einen Sprachagenten für längere Gespräche baut, braucht also einen Übergang, und der ist eine Entscheidung über den Gesprächszustand: Was nimmt die neue Sitzung mit, was bleibt liegen.
Woraus dieser Zustand besteht und warum er beim Sprachmodell an einer anderen Stelle liegt als beim klassischen Aufbau, steht in Kapitel 01.
Was dieses Kapitel offen lässt
Zwei Fragen bleiben hier bewusst offen.
Die Erkennungsqualität in Zahlen. Dass am Telefon weniger Signal ankommt, ist belegt. Was das für die Wortfehlerrate bedeutet, ist es nicht. Die Zahlen, die dazu kursieren, stammen aus Erhebungen mit verschiedenen Aufnahmen, Sprechern und Modellen; eine davon herauszugreifen hieße, sich die passende auszusuchen.
Der ausgehende Anruf. Dieses Kapitel beschreibt, was passiert, wenn jemand anruft. Der umgekehrte Fall, ein System, das selbst wählt, wirft Fragen auf, die über die Technik hinausgehen: wer angerufen werden darf, was zu Beginn gesagt werden muss, und wer dafür geradesteht. Der Teil davon, der die Stimme selbst betrifft, gehört in ein eigenes Kapitel dieses Pfades.
Quellen
5 Einträge, davon 1 Schlüsselarbeitalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
Robust Speech Recognition via Large-Scale Weak Supervision (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Radford und Mitautoren stellen am 06.12.2022 das Modell vor, mit dem die Spracherkennung ohne Nachschulung für den eigenen Fall auskommt. Der Weg dahin war Menge, allerdings sortierte Menge: 680.000 Stunden Ton aus dem Netz mit den zugehörigen Abschriften, dazu ein Apparat (Abschnitt 3.1), der maschinell erzeugte Abschriften wieder aussortiert, die gesprochene Sprache gegen die geschriebene prüft und Dubletten entfernt. Eingetauscht wurden geprüfte Abschriften gegen mehr Material. Das Ergebnis wurde samt Gewichten und Ableitungscode veröffentlicht und ist damit ohne eigenes Training benutzbar.
Dokumentationerreichbar
OpenAI, Realtime API with SIP (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Der Weg, auf dem ein Sprachagent ans öffentliche Telefonnetz kommt. Der eingehende Anruf ist dort ein Ereignis: Der Anbieter meldet ihn an eine hinterlegte Adresse, und die Anwendung entscheidet über zwei getrennte Endpunkte, ob sie ihn annimmt oder ablehnt. Dazu die Anforderungen an das eigene Netz, Signalisierung über TLS auf Port 5061 und der Medienpfad über SRTP. Zu Abtastraten und Tonformaten sagt die Seite nichts, dafür stehen RFC 3551 und RFC 4733.
Originalarbeiterreichbar
rfc-editor.orggeprüft 24.09.2026
Der Standard, der festlegt, wie Ton in einem Telefongespräch über das Netz übertragen wird. Die beiden verbreiteten Formate der Telefonie heißen dort PCMU und PCMA, gehen auf die Empfehlung ITU-T G.711 zurück und arbeiten mit acht Bit je Abtastung; Tabelle 4 nennt für beide eine Taktrate von 8.000. Derselbe Standard führt daneben G.722 mit einer Abtastrate von 16.000 und L16 mit 44.100. Welche Auflösung an einem Gespräch ankommt, entscheidet damit die Aushandlung zwischen den Endpunkten.
Originalarbeiterreichbar
rfc-editor.orggeprüft 24.09.2026
Wie eine gedrückte Taste im Telefonnetz übertragen wird, nämlich als benanntes Ereignis. Der Grund steht in der Einleitung: Sprachcodecs mit niedriger Bitrate geben solche Töne nicht zuverlässig genug wieder, damit eine Maschine sie erkennt. Die Empfehlung an die Vermittlungsstelle geht weiter, denn die Kompression kann selbst Töne erzeugen, die niemand gedrückt hat.
Dokumentationerreichbar
OpenAI, Realtime conversations (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Beschreibung dessen, was in einer laufenden Sprachsitzung passiert, und der Ort, an dem der Anbieter den Preis einer Prüfung vor der Antwort selbst benennt: Wer die automatische Antwort abschaltet, um Eingaben zu moderieren, zu prüfen oder erst etwas nachzuschlagen, bezahlt das mit Wartezeit. Dieselbe Seite nennt die Obergrenze einer Sitzung und beschreibt den Ablauf eines Tool Calls.