NachschlagenQuellenregister

SchlüsselarbeitOriginalarbeiterreichbar

Robust Speech Recognition via Large-Scale Weak Supervision

arxiv.org (externe Seite)

Radford und Mitautoren stellen am 06.12.2022 das Modell vor, mit dem die Spracherkennung ohne Nachschulung für den eigenen Fall auskommt. Der Weg dahin war Menge, allerdings sortierte Menge: 680.000 Stunden Ton aus dem Netz mit den zugehörigen Abschriften, dazu ein Apparat (Abschnitt 3.1), der maschinell erzeugte Abschriften wieder aussortiert, die gesprochene Sprache gegen die geschriebene prüft und Dubletten entfernt. Eingetauscht wurden geprüfte Abschriften gegen mehr Material. Das Ergebnis wurde samt Gewichten und Ableitungscode veröffentlicht und ist damit ohne eigenes Training benutzbar.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.08.2026:

  • When scaled to 680,000 hours of multilingual and multitask supervision, the resulting models generalize well to standard benchmarks and are often competitive with prior fully supervised results but in a zero-shot transfer setting without the need for any fine-tuning.bestätigt 24.09.2026
  • When compared to humans, the models approach their accuracy and robustness.bestätigt 24.09.2026

Abtastrate im GlossarSpracherkennung im Glossar02 Sprache und Audio04 Über das Telefon07 Spracherkennung

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.