NachschlagenQuellenregister

Dokumentationerreichbar

OpenAI Whisper, Repository

github.com (externe Seite)

Das Repository zum Erkennungsmodell, und die knappste Beschreibung des Bruchs zwischen alter und neuer Bauform: Ein einziges Modell übernimmt Aufgaben, für die früher mehrere Stufen hintereinander standen. Daneben stehen zwei Angaben zum Betrieb, das Fenster von 30 Sekunden und die Mel-Stufe davor.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:

  • A Transformer sequence-to-sequence model is trained on various speech processing tasks, including multilingual speech recognition, speech translation, spoken language identification, and voice activity detection.bestätigt 24.09.2026
  • These tasks are jointly represented as a sequence of tokens to be predicted by the decoder, allowing a single model to replace many stages of a traditional speech-processing pipeline.bestätigt 24.09.2026
  • Internally, the transcribe() method reads the entire file and processes the audio with a sliding 30-second window, performing autoregressive sequence-to-sequence predictions on each window.bestätigt 24.09.2026

07 Spracherkennung

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.