Dokumentationerreichbar
Google, Audio understanding
Die Doku zur Tonverarbeitung, und der Beleg dafür, dass Gemini den Ton selbst verarbeitet. Sie sagt Sprecherzuordnung, Erkennung von Gefühlen in Sprache und Musik sowie das Verstehen von Geräuschen ohne Sprache zu, und sie rechnet Ton in 32 Token je Sekunde um. Alle vier Angaben wären nach einer Transkription unmöglich, denn dort bleibt nur der Wortlaut übrig. Google trennt das ausdrücklich von der reinen Spracherkennung und verweist dafür auf ein eigenes Modell.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 06.09.2026:
Gemini understands non-speech sounds (birdsong, sirens, etc.)
bestätigt 24.09.202632 tokens per second of audio
bestätigt 24.09.2026Emotion detection in speech and music
bestätigt 24.09.2026