Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenConversational AIKapitel 02von 12 im Pfad

Sprache und Audio

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Ein Sprachmodell arbeitet mit getipptem Text. Token, Prompt, Kontextfenster, Tools, all das setzt ihn voraus. Sobald jemand spricht, kommt eine Schicht davor, und die hat eigene Fehler und eigene Entscheidungen.

Kapitel 01 hat diese Schicht benannt: vorn die Spracherkennung, hinten die Sprachsynthese. Dieses Kapitel nimmt sich die erste vor.

Erkennung und Erzeugung

Zwei entgegengesetzte Wege zwischen Ton und Text. Getrennte Systeme gehen je einen davon, das durchgehende Modell weiter unten geht beide.

Erkennung macht aus Ton Text. Es gab sie lange vor 2022, und die besten Werte kamen damals aus einer Anpassung an den jeweiligen Datenbestand. Die Arbeit, die das änderte, erschien im Dezember 2022:

When scaled to 680,000 hours of multilingual and multitask supervision, the resulting models generalize well to standard benchmarks and are often competitive with prior fully supervised results but in a zero-shot transfer setting without the need for any fine-tuning. (externe Seite, arxiv.org)

Der letzte Halbsatz ist die Neuerung: Das Modell erreicht diese Werte ohne Anpassung an den einzelnen Datenbestand. Der Weg dahin war Menge, allerdings sortierte Menge. Die Autoren beschreiben in Abschnitt 3.1 einen eigenen Apparat, der maschinell erzeugte Abschriften wieder aussortiert, die gesprochene Sprache gegen die geschriebene prüft und Dubletten entfernt. Eingetauscht wurden geprüfte Abschriften gegen mehr Material.

Die Autoren beziffern den Abstand zum Menschen selbst:

When compared to humans, the models approach their accuracy and robustness. (externe Seite, arxiv.org)

Der Satz gilt für die Aufnahmen, an denen sie gemessen haben. Wie schnell solche Zahlen kippen, wenn das Material wechselt, steht in Tiefe 2, und die Warnung davor stammt aus derselben Arbeit.

Erzeugung macht aus Text Ton. Sie kommt in diesem Kapitel kaum vor, weil die Entscheidungen, um die es hier geht, alle an der Erkennung hängen: Was falsch angekommen ist, spricht auch die beste Stimme falsch aus. Wie beide Verfahren gebaut sind, steht in KI-Wissen, Kapitel 07 und KI-Wissen, Kapitel 08.

Zwei Bauformen

Wer etwas mit Sprache bauen will, findet bei einem Anbieter inzwischen drei Bauformen nebeneinander:

Choose between GPT-Live, Realtime API sessions, and chained voice pipelines. (externe Seite, developers.openai.com)

Zwei davon sind die etablierten Gegenpole, um die es in diesem Kapitel geht. Die dritte, GPT-Live, kommt am Ende des Kapitels dazu.

Die Kette. Erkennung, dann ein gewöhnliches Textmodell, dann Sprachausgabe. Drei Systeme hintereinander, dazwischen jeweils Text, den man sehen und prüfen kann.

Inspect or transform intermediate text and replace each component independently. (externe Seite, developers.openai.com)

Das eine Modell. Ton geht hinein, Ton kommt heraus, ohne Umweg über eine Textstufe.

Use one model to interpret audio, decide what to do, and respond in speech. (externe Seite, developers.openai.com)

Reine Formen sind das nur auf dem Papier. Auch beim durchgehenden Modell läuft eine Erkennung nebenher mit, sonst gäbe es dort keine Abschrift, und wer will, mischt beides. Was daraus folgt, steht in Tiefe 3.

Oben drei Kästen mit Text an den Übergängen, unten ein Kasten ohne Zwischenstand. Beide Bauformen als zwei Reihen untereinander. Oben Erkennung, Textmodell und Sprachausgabe mit je einer Textmarke dazwischen. Unten ein einziger Kasten, der Ton entgegennimmt und Ton abgibt. Beide Reihen sind gleich breit, weil die Grafik keine Zeitangabe macht. DIE KETTE Ton Erkennung Text Textmodell Text Sprachausgabe Ton DAS EINE MODELL Ton ein Modell, Ton hinein und Ton heraus Ton An den blauen Stellen liegt der Text vor, bevor er weitergeht.

seitlich verschiebbar

Oben drei Systeme mit Text dazwischen, unten eines ohne. Blau markiert sind die Stellen, an denen ein Programm den Text liest, bevor er weitergeht.

eigene Darstellung, Stand 07.08.2026

Wofür welche taugt

Der Unterschied klingt technisch und entscheidet praktisch alles.

Die Kette ist langsamer, weil drei Systeme nacheinander arbeiten. Dafür liegt nach jedem Schritt Text vor, und an dem lässt sich prüfen, protokollieren und abbrechen. Der Anbieter empfiehlt sie genau dafür:

Use this path when each stage needs to be visible or replaceable. (externe Seite, developers.openai.com)

Das eine Modell antwortet schneller und klingt natürlicher, weil es hört, wie etwas gesagt wurde und was daneben noch zu hören war. Eine Abschrift bekommt man auch dort, sie entsteht allerdings auf einem eigenen Weg und stimmt nicht zwingend mit dem überein, worauf das Modell geantwortet hat. Was das im Betrieb bedeutet, steht in Tiefe 3.

Die Reihenfolge

Dieselbe Doku formuliert die Regel, die daraus folgt, in einem Satz:

The practical rule is: choose the audio architecture first, then design the rest of the agent workflow the same way you would for text. (externe Seite, developers.openai.com)

Das ist bemerkenswert, weil es die übliche Reihenfolge umdreht. Erst die Bauform, dann alles Weitere. Wer mittendrin wechselt, baut den größeren Teil neu.

Eine Entscheidung steht allerdings noch davor, und sie betrifft beide Bauformen: Wer sagt eigentlich, wann jemand zu Ende geredet hat. Kapitel 03 nimmt sich das vor.

Die dritte Form

GPT-Live trennt die Sprachebene vom Denken dahinter. Ein eigenes Modell hört zu und spricht, und zwar gleichzeitig:

GPT-Live can listen and speak at the same time, a capability called full duplex. (externe Seite, developers.openai.com)

Die Antwort selbst kommt von einem zweiten System, das die eigene Anwendung oder der Anbieter betreibt:

The live model handles the spoken interaction and delegates reasoning and tool use to a separate backend. (externe Seite, developers.openai.com)

Damit liegt GPT-Live zwischen den beiden Polen dieses Kapitels: Die Sprachebene nimmt Ton direkt entgegen wie das eine Modell, das Denken dahinter läuft textbasiert wie bei der Kette. Was das für die Fragen aus Tiefe 2 und Tiefe 3 bedeutet, ist an dieser Stelle noch nicht ausgearbeitet.

Quellen

11 Einträge, davon 1 Schlüsselarbeitalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Robust Speech Recognition via Large-Scale Weak Supervision (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Radford und Mitautoren stellen am 06.12.2022 das Modell vor, mit dem die Spracherkennung ohne Nachschulung für den eigenen Fall auskommt. Der Weg dahin war Menge, allerdings sortierte Menge: 680.000 Stunden Ton aus dem Netz mit den zugehörigen Abschriften, dazu ein Apparat (Abschnitt 3.1), der maschinell erzeugte Abschriften wieder aussortiert, die gesprochene Sprache gegen die geschriebene prüft und Dubletten entfernt. Eingetauscht wurden geprüfte Abschriften gegen mehr Material. Das Ergebnis wurde samt Gewichten und Ableitungscode veröffentlicht und ist damit ohne eigenes Training benutzbar.

  • Dokumentationerreichbar

    OpenAI, Voice agents (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Seite, auf der ein Anbieter die Bauformen für Sprache nebeneinanderstellt und sagt, wofür jede taugt: eine Sitzung, in der ein Modell den Ton direkt entgegennimmt und erzeugt, eine Kette aus Erkennung, Textmodell und Sprachausgabe, oder seit einer Überarbeitung im September 2026 zusätzlich GPT-Live, das die Sprachebene von einem eigenen Backend trennt. Sie nennt außerdem die Reihenfolge der Entscheidung, nämlich zuerst die Bauform und danach alles andere.

  • Dokumentationerreichbar

    OpenAI, Realtime transcription (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Beschreibt die Transkription innerhalb einer laufenden Sprachsitzung und damit den Umstand, dass auch dort ein zweites System mitläuft. Wichtig sind zwei Angaben: Produktnamen und Abkürzungen brauchen eine Stichwortliste, damit sie richtig ankommen, und diese Liste hat eine Längengrenze, ab der die Sitzung abgewiesen wird. Dazu die Aufforderung, Einstellungen an echtem Material zu messen.

  • Dokumentationerreichbar

    OpenAI, Voice activity detection (VAD) (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Seite hinter dem Schalter, der entscheidet, ob eine Aufnahme überhaupt beim Modell ankommt. Zwei Betriebsarten stehen dort nebeneinander: eine Lautstärkeschwelle, die lauteren Ton verlangt und in lauter Umgebung besser fährt, und eine zweite, die stattdessen anhand der gesprochenen Wörter entscheidet, ob jemand zu Ende geredet hat. Beleg dafür, dass die Lautstärkeprüfung vor der Erkennung ein dokumentierter Griff der Anbieter ist, und dafür, wo sie aufhört.

  • Originalarbeiterreichbar

    NVIDIA, Modellkarte Parakeet TDT 0.6B v3 (externe Seite, huggingface.co)

    huggingface.cogeprüft 24.09.2026

    Die Modellkarte eines Erkennungsmodells mit 600 Millionen Parametern, das 25 europäische Sprachen abdeckt und die Sprache selbst erkennt. Es ist der Gegenentwurf zur Größe: klein genug für einen Laptop, und in den ausgewiesenen Auswertungen liegt es bei der Wortfehlerrate im Bereich deutlich größerer Modelle. Die Tabellen weisen die Werte je Datensatz aus, dazu Zeitmarken auf Wort- und Abschnittsebene und eine Messung der Rauschfestigkeit: Bei Musik und Störgeräusch so laut wie die Stimme steigt die mittlere Wortfehlerrate über acht Datensätze von 6,34 auf 11,66 Prozent.

  • Dokumentationerreichbar

    OpenAI, Realtime client events (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Stelle, an der der Hersteller selbst schreibt, dass die Abschrift einer Sprachsitzung nicht dasselbe ist wie das, worauf das Modell geantwortet hat. Sie nennt beides beim Namen: einen eigenen Weg für die Abschrift und einen Hinweischarakter statt eines Protokolls.

  • Dokumentationerreichbar

    OpenAI, Transcribing User Audio with a Separate Realtime Request (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Anleitung, die den Nebenkanal einer Sprachsitzung als Problem behandelt und dafür ein Beispiel des Herstellers mitliefert: verstanden wird ein Unfall mit dem Auto, mitgeschrieben eine Lautfolge. Sie beschreibt den Ausweg, die Abschrift vom selben Modell erzeugen zu lassen, nennt sein Ergebnis eine Verringerung der Abweichung und beziffert seinen Preis, gemessen am getrennten Erkennungsmodell: drei- bis fünffach für den letzten Redebeitrag, sechzehn- bis zweiundzwanzigfach mit der ganzen Sitzung im Kontext.

  • Dokumentationerreichbar

    OpenAI, Using realtime models (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Anleitung zum Anweisen eines Sprachmodells, das rohen Ton verarbeitet. Sie belegt nebenbei, was ein solches Modell auseinanderhalten kann: Stille, Hintergrundgeräusch, Wartemusik, Fernsehton und ein Gespräch, das jemand anderem gilt. Dieselbe Seite führt die Ansage vor einer Wartezeit als eigenes Bauteil mit Namen und benennt ihre Kehrseite: Schlecht gemacht erhöht sie die gefühlte Wartezeit. Die Anweisungen stehen dort für zwei Modellfassungen nebeneinander und lauten verschieden; zitiert ist hier die neuere.

  • Dokumentationerreichbar

    Google, Audio understanding (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Die Doku zur Tonverarbeitung, und der Beleg dafür, dass Gemini den Ton selbst verarbeitet. Sie sagt Sprecherzuordnung, Erkennung von Gefühlen in Sprache und Musik sowie das Verstehen von Geräuschen ohne Sprache zu, und sie rechnet Ton in 32 Token je Sekunde um. Alle vier Angaben wären nach einer Transkription unmöglich, denn dort bleibt nur der Wortlaut übrig. Google trennt das ausdrücklich von der reinen Spracherkennung und verweist dafür auf ein eigenes Modell.

  • Dokumentationerreichbar

    Google, Live API capabilities guide (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Die Beschreibung zweier Einstellungen, die es nur beim durchgehenden Modell gibt: Das Modell darf entscheiden, ob es überhaupt antwortet, und es richtet seinen Ton nach dem des Gegenübers. Beides setzt voraus, dass mehr ankommt als der Wortlaut. Beide laufen nur über eine Vorabfassung der Schnittstelle und fehlen im neuesten Live-Modell des Anbieters, was die Seite unter jeder der beiden vermerkt. Dieselbe Seite vergleicht inzwischen drei Modelle in einer Tabelle: Das aktuelle Live-Modell führt Denken fest verdrahtet ohne wählbare Stufe, die Fassung mit ausgedehntem Denken erlaubt niedrig, mittel und hoch, und nur beim als Vorgänger geführten Gemini 3.1 Flash Live Preview gibt es zusätzlich die niedrigste Stufe als Voreinstellung, mit der Antwortzeit begründet. Sie beschreibt außerdem das Hineinreden: Das Modell verwirft seine laufende Erzeugung, und im Kommentar des Codebeispiels zum Feld interrupted steht, dass die Anwendung den schon gesendeten Ton selbst aus ihrem Puffer räumen muss. Die Erkennung der Sprechpausen lässt sich abschalten und an den Client übergeben. Der Preis dafür steht daneben: Die Pufferung auf der Gegenseite entfällt, und die Seite nennt 500 Millisekunden Stille als Untergrenze für die eigene Erkennung.

  • Dokumentationerreichbar

    Gemini Apps Privacy Hub (externe Seite, support.google.com)

    support.google.comgeprüft 24.09.2026

    Googles eigene Darstellung, was mit den Daten aus Gemini Apps geschieht: was in der Aktivität gespeichert wird, dass Audio dazugehört, dass menschliche Prüfer einen Teil lesen, wie lange geprüfte Unterhaltungen bleiben, und die Bitte, keine vertraulichen Angaben einzugeben. Beleg für die Datenschutz-Abgrenzung, an der Quelle des Anbieters statt an einer Auslegung.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.