Dokumentationerreichbar
OpenAI Whisper, Repository
Das Repository zum Erkennungsmodell, und die knappste Beschreibung des Bruchs zwischen alter und neuer Bauform: Ein einziges Modell übernimmt Aufgaben, für die früher mehrere Stufen hintereinander standen. Daneben stehen zwei Angaben zum Betrieb, das Fenster von 30 Sekunden und die Mel-Stufe davor.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:
A Transformer sequence-to-sequence model is trained on various speech processing tasks, including multilingual speech recognition, speech translation, spoken language identification, and voice activity detection.
bestätigt 24.09.2026These tasks are jointly represented as a sequence of tokens to be predicted by the decoder, allowing a single model to replace many stages of a traditional speech-processing pipeline.
bestätigt 24.09.2026Internally, the transcribe() method reads the entire file and processes the audio with a sliding 30-second window, performing autoregressive sequence-to-sequence predictions on each window.
bestätigt 24.09.2026