NachschlagenQuellenregister

Dokumentationerreichbar

Google, Audio understanding

ai.google.dev (externe Seite)

Die Doku zur Tonverarbeitung, und der Beleg dafür, dass Gemini den Ton selbst verarbeitet. Sie sagt Sprecherzuordnung, Erkennung von Gefühlen in Sprache und Musik sowie das Verstehen von Geräuschen ohne Sprache zu, und sie rechnet Ton in 32 Token je Sekunde um. Alle vier Angaben wären nach einer Transkription unmöglich, denn dort bleibt nur der Wortlaut übrig. Google trennt das ausdrücklich von der reinen Spracherkennung und verweist dafür auf ein eigenes Modell.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 06.09.2026:

  • Gemini understands non-speech sounds (birdsong, sirens, etc.)bestätigt 24.09.2026
  • 32 tokens per second of audiobestätigt 24.09.2026
  • Emotion detection in speech and musicbestätigt 24.09.2026

02 Sprache und Audio

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.