NachschlagenQuellenregister

Dokumentationerreichbar

OpenAI, Voice agents

developers.openai.com (externe Seite)

Die Seite, auf der ein Anbieter die Bauformen für Sprache nebeneinanderstellt und sagt, wofür jede taugt: eine Sitzung, in der ein Modell den Ton direkt entgegennimmt und erzeugt, eine Kette aus Erkennung, Textmodell und Sprachausgabe, oder seit einer Überarbeitung im September 2026 zusätzlich GPT-Live, das die Sprachebene von einem eigenen Backend trennt. Sie nennt außerdem die Reihenfolge der Entscheidung, nämlich zuerst die Bauform und danach alles andere.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 17.09.2026:

  • Choose between GPT-Live, Realtime API sessions, and chained voice pipelines.bestätigt 24.09.2026
  • The practical rule is: choose the audio architecture first, then design the rest of the agent workflow the same way you would for text.bestätigt 24.09.2026
  • Use this path when each stage needs to be visible or replaceable.bestätigt 24.09.2026
  • Use one model to interpret audio, decide what to do, and respond in speech.bestätigt 24.09.2026
  • Inspect or transform intermediate text and replace each component independently.bestätigt 24.09.2026
  • Use Guardrails and human review when spoken workflows need safety checks or approvals.bestätigt 24.09.2026
  • GPT-Live can listen and speak at the same time, a capability called full duplex.bestätigt 24.09.2026
  • The live model handles the spoken interaction and delegates reasoning and tool use to a separate backend.bestätigt 24.09.2026

02 Sprache und Audio08 Eskalation an einen Menschen

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.