NachschlagenQuellenregister

Dokumentationerreichbar

Google, Live API capabilities guide

ai.google.dev (externe Seite)

Die Beschreibung zweier Einstellungen, die es nur beim durchgehenden Modell gibt: Das Modell darf entscheiden, ob es überhaupt antwortet, und es richtet seinen Ton nach dem des Gegenübers. Beides setzt voraus, dass mehr ankommt als der Wortlaut. Beide laufen nur über eine Vorabfassung der Schnittstelle und fehlen im neuesten Live-Modell des Anbieters, was die Seite unter jeder der beiden vermerkt. Dieselbe Seite vergleicht inzwischen drei Modelle in einer Tabelle: Das aktuelle Live-Modell führt Denken fest verdrahtet ohne wählbare Stufe, die Fassung mit ausgedehntem Denken erlaubt niedrig, mittel und hoch, und nur beim als Vorgänger geführten Gemini 3.1 Flash Live Preview gibt es zusätzlich die niedrigste Stufe als Voreinstellung, mit der Antwortzeit begründet. Sie beschreibt außerdem das Hineinreden: Das Modell verwirft seine laufende Erzeugung, und im Kommentar des Codebeispiels zum Feld interrupted steht, dass die Anwendung den schon gesendeten Ton selbst aus ihrem Puffer räumen muss. Die Erkennung der Sprechpausen lässt sich abschalten und an den Client übergeben. Der Preis dafür steht daneben: Die Pufferung auf der Gegenseite entfällt, und die Seite nennt 500 Millisekunden Stille als Untergrenze für die eigene Erkennung.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.08.2026:

  • Gemini can proactively decide not to respond if the content is not relevantbestätigt 24.09.2026
  • lets Gemini adapt its response style to the input expression and tonebestätigt 24.09.2026
  • This feature is not supported in Gemini 3.1 Flash Live.bestätigt 24.09.2026
  • Uses thinkingLevel to control thinking depth with settings like minimal, low, medium, and high. Defaults to minimal to optimize for lowest latency.bestätigt 24.09.2026
  • When VAD detects an interruption, the ongoing generation is canceled and discarded.bestätigt 24.09.2026
  • By default, the model automatically performs VAD on a continuous audio input stream.bestätigt 24.09.2026
  • In this configuration the client is responsible for detecting user speech and sending activityStart and activityEnd messages at the appropriate times.bestätigt 24.09.2026
  • No pre-speech buffer: The server no longer prepends audio before the detected speech start.bestätigt 24.09.2026
  • No silence tolerance: The server acts immediately on your activityEnd signal with no additional wait.bestätigt 24.09.2026
  • To preserve audio quality with manual VAD, use an end-of-speech silence threshold of at least 500ms in your client's voice activity detector.bestätigt 24.09.2026
  • Native audio output models support any of the voices available for our Text-to-Speech (TTS) models.bestätigt 24.09.2026

Barge-in im Glossar02 Sprache und Audio03 Wenn das Gespräch nicht in Runden läuft

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.