Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenKI-WissenKapitel 08von 14 im Pfad

Sprachsynthese

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Der Weg von Text zu Schall ist der umgekehrte zu dem aus Kapitel 07, und er ist schwerer. Bei der Erkennung gibt es eine richtige Antwort, nämlich das gesprochene Wort. Bei der Erzeugung gibt es unendlich viele: Jeder Satz lässt sich in tausend Tonlagen, Tempi und Betonungen sagen, und alle sind richtig.

Conversational AI, Kapitel 01 führt den Begriff ein und nennt die Abkürzung TTS. Dieses Kapitel beschreibt, wie das Bauteil dahinter arbeitet.

Zwei Wege, aus Text Ton zu machen

Bis 2016 gab es zwei Bauformen, und der Hersteller, der beide ablöste, hat sie in seiner Ankündigung nebeneinandergestellt.

Der erste Weg setzt aufgenommene Sprache neu zusammen:

concatenative TTS, where a very large database of short speech fragments are recorded from a single speaker and then recombined to form complete utterances. (externe Seite, deepmind.google)

Der zweite Weg speichert stattdessen Kennwerte und rechnet daraus:

parametric TTS, where all the information required to generate the data is stored in the parameters of the model, and the contents and characteristics of the speech can be controlled via the inputs to the model. (externe Seite, deepmind.google)

Beide haben je eine Schwäche, und beide Schwächen sind gut belegt.

Das Zusammensetzen aus Schnipseln

Wer Sprachschnipsel zusammensetzt, hört echte menschliche Laute, und das klingt in guten Fällen sehr natürlich. Was das kostet, steht direkt daneben:

This makes it difficult to modify the voice (for example switching to a different speaker, or altering the emphasis or emotion of their speech) without recording a whole new database. (externe Seite, deepmind.google)

Eine neue Stimme heißt also: neue Aufnahmen, tagelang, mit derselben Person. Eine andere Betonung heißt dasselbe. Solche Systeme waren an ihre Sprecherin gebunden, und die Übergänge zwischen zwei Schnipseln waren der Ort, an dem man die Naht hörte.

Der Bruch, das Netz erzeugt die Welle selbst

Der parametrische Weg war beweglich und klang schlechter, weil am Ende ein Bauteil stand, das aus Kennwerten Schall macht:

Existing parametric models typically generate audio signals by passing their outputs through signal processing algorithms known as vocoders. (externe Seite, deepmind.google)

2016 wurde dieses Bauteil durch ein neuronales Netz ersetzt, das die Schallwelle direkt erzeugt:

This paper introduces WaveNet, a deep neural network for generating raw audio waveforms. (externe Seite, arxiv.org)

Die Autoren beziffern den Abstand zu beiden alten Bauformen:

human listeners rating it as significantly more natural sounding than the best parametric and concatenative systems for both English and Mandarin. (externe Seite, arxiv.org)

Damit war die Frage entschieden. Was heute in einem Sprachagenten spricht, steht in dieser Linie.

Was eine Stimme ausmacht

Der Text sagt, welche Wörter fallen. Alles andere muss das System erfinden, und es ist mehr, als man beim Zuhören merkt.

Die Tonhöhe und ihr Verlauf über den Satz. Eine Frage endet oben, eine Feststellung unten.

Die Länge jedes Lautes. Wer betont, dehnt.

Die Pausen, und zwar an Stellen, an denen kein Satzzeichen steht.

Die Klangfarbe, an der wir eine Person wiedererkennen.

Die ersten drei zusammen heißen Prosodie, und die Bedeutung hängt an ihnen mit. „Das hast du gut gemacht“ ist je nach Betonung ein Lob oder das Gegenteil, und im Text steht beides gleich.

Was das Gesetz an dieser Stelle verlangt

Seit dem 02.08.2026 gilt Artikel 50 der KI-Verordnung. Anbieter müssen erzeugte Inhalte maschinenlesbar markieren:

Anbieter von KI-Systemen, einschließlich KI-Systemen mit allgemeinem Verwendungszweck, die synthetische Audio-, Bild-, Video- oder Textinhalte erzeugen, stellen sicher, dass die Ausgaben des KI-Systems in einem maschinenlesbaren Format gekennzeichnet und als künstlich erzeugt oder manipuliert erkennbar sind. (externe Seite, eur-lex.europa.eu)

Was daraus für eine Sprachanwendung folgt, welche Ausnahmen es gibt und wie die Kennzeichnung technisch aussieht, steht in Conversational AI, Kapitel 09. Dort geht es um die Pflichten, hier um das Verfahren.

Woran Sie eine erzeugte Stimme festmachen

Hören Sie auf die Pausen. Ein System, das nach Satzzeichen atmet, klingt regelmäßiger als ein Mensch.

Achten Sie auf seltene Wörter. Namen, Fachbegriffe und Abkürzungen sind die Stelle, an der die Aussprache geraten wird.

Fragen Sie, wo die Stimme herkommt. Eine nachgebildete Stimme braucht die Zustimmung der Person, der sie gehört, und beide großen Anbieter verlangen dafür einen Nachweis.

Verwechseln Sie Natürlichkeit nicht mit Richtigkeit. Eine Stimme, die gut klingt, kann einen falschen Satz sprechen. Was vor ihr steht, entscheidet darüber.

Quellen

8 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Ankündigung des Herstellerserreichbar

    WaveNet: A generative model for raw audio (externe Seite, deepmind.google)

    deepmind.googlegeprüft 24.09.2026

    Die Ankündigung vom 08.09.2016 beim Hersteller, vier Tage vor der Arbeit dazu, und der Ort, an dem die beiden alten Bauformen der Sprachausgabe erklärt werden. Sie definiert nebenbei den Vocoder als das Bauteil, durch das die parametrischen Verfahren ihre Ausgabe schicken, und nennt die Zahl, an der die Aufgabe hängt: 16.000 Abtastwerte je Sekunde.

  • Originalarbeiterreichbar

    WaveNet: A Generative Model for Raw Audio (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Van den Oord und Mitautoren stellen am 12.09.2016 das Verfahren vor, das den Schall Abtastwert für Abtastwert erzeugt statt ihn aus Bausteinen zusammenzusetzen. Der Kurztext nennt beide Bauformen, die es damit überholt, und er nennt auch die Grenze des Verfahrens: Jeder Wert hängt von allen vorherigen ab, also entsteht die Ausgabe streng nacheinander.

  • Dokumentationerreichbar

    OpenAI, Text to speech (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Seite zur Sprachausgabe, mit zwei Angaben, die für ein Gespräch zählen. Der Ton kommt stückweise und lässt sich abspielen, bevor die Datei fertig ist; ohne das käme die Antwort erst nach der letzten Silbe. Und die Stimme wird über eine Anweisung in Prosa geführt, mit einer Liste dessen, was sich damit erreichen lässt: Akzent, Gefühlsspanne, Betonung, Nachahmung, Tempo, Klangfarbe, Flüstern.

  • Originalarbeiterreichbar

    Verordnung (EU) 2024/1689 über künstliche Intelligenz (externe Seite, eur-lex.europa.eu)

    eur-lex.europa.eugeprüft 24.09.2026

    Der Rechtstext selbst, veröffentlicht am 12.07.2024 und in Kraft getreten am 01.08.2024. Er ordnet Anwendungen nach Risiko und legt die Pflichten je Stufe fest. Die Anwendbarkeit beginnt gestaffelt, nicht mit dem Inkrafttreten. Die Adresse zeigt seit dem 29.07.2026 auf die deutsche Fassung: Die Zitate unten stehen im Text so, wie er hier zitiert wird, und die Fassung ohne Sprachangabe liefert die englische.

  • Originalarbeiterreichbar

    Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Shen und Mitautoren beschreiben am 16.12.2017 die Bauform, die bis heute unter den meisten Sprachausgaben steht: erst ein Netz, das aus Zeichen ein Mel-Spektrogramm vorhersagt, dann ein zweites, das daraus die Schallwelle macht. Der Kurztext nennt die Bewertung mit 4,53 gegen 4,58 für aufgenommene Sprache; diese Zahlen stehen dort in Formelschreibweise und sind deshalb nicht als Zitat hinterlegt.

  • Dokumentationerreichbar

    OpenAI, Custom voices (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Seite zum Nachbilden einer eigenen Stimme aus einer Tonprobe, bis zum 11.09.2026 Teil der Seite zur Sprachausgabe (openai-tts-doku), seitdem ausgelagert. Sie führt den gesprochenen Zustimmungssatz als Prüfschritt, die Regel, dass die Aufnahme nur eine von mehreren vorgegebenen Phrasen enthalten darf, und die Obergrenze von zwanzig selbst erzeugten Stimmen je Organisation.

  • Dokumentationerreichbar

    ElevenLabs, Professional voice cloning (externe Seite, elevenlabs.io)

    elevenlabs.iogeprüft 24.09.2026

    Wie eine Stimme nachgebildet wird, beim Anbieter selbst beschrieben. Zwei Bedingungen stehen im Fließtext: Erlaubt ist nur die eigene Stimme, und vor der Freischaltung steht ein Nachweis, dass sie einem gehört.

  • Dokumentationerreichbar

    torchaudio, Audio Feature Extractions (externe Seite, docs.pytorch.org)

    docs.pytorch.orggeprüft 24.09.2026

    Die Doku der Programmbibliothek zeigt die Vorstufe jeder Erkennung als Rechenschritte: Fouriertransformation über kurze Abschnitte, dann eine Umrechnung der Frequenzbänder auf die Mel-Skala. Sie belegt damit, dass das Mel-Spektrogramm ein Rechenschritt vor dem Modell ist.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.