
Gemini 3.8 Live führt Tools aus – das Gespräch läuft im Hintergrund weiter

Google veröffentlichte am 15. September 2026 Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking. Beide Sprachmodelle können Werkzeuge und externe APIs im Hintergrund aufrufen, während sie weiter Audio ausgeben und das Gespräch fortsetzen, wie Googles Ankündigung der Modelle erläutert.
Seit dem Start am 15. September stehen beide Varianten Entwicklern über die Live API und Google AI Studio zur Verfügung. Gemini 3.8 Live ist für schnelle Standarddialoge ausgelegt; Extended Thinking ergänzt konfigurierbare Hintergrundanalyse für komplexe, mehrstufige Aufgaben. Die Freigabe in Search, Gemini, Workspace und den Unternehmensprodukten erfolgt dagegen je nach Oberfläche und Nutzergruppe unterschiedlich.
Asynchrone Aufrufe verändern den Gesprächsablauf
Der entscheidende Unterschied zu einem blockierenden Sprachagenten liegt im zeitlichen Ablauf. Gemini 3.8 Live kann eine Anfrage zunächst sprachlich bestätigen, anschließend eine Funktion ausführen und das Ergebnis später in dieselbe Sitzung übernehmen. Der Nutzer muss während eines Kalender-, Buchungs- oder Datenbankaufrufs nicht zwangsläufig auf eine stumme Verbindung warten.
Beim Basismodell ist die asynchrone Ausführung der Standard, ein blockierender Modus bleibt jedoch für kompatible Abläufe verfügbar. Anwendungen können außerdem festlegen, ob ein eingetroffenes Werkzeugergebnis still verarbeitet, in einer Gesprächspause ausgegeben oder in die laufende Ausgabe eingeschoben wird.
Extended Thinking verlangt eine andere Sitzungslogik. Die Variante arbeitet ausschließlich mit nicht blockierenden Funktionen und kann während der Hintergrundanalyse mehrere Audioantworten zu einer Anfrage liefern. Eine unabhängige Einordnung von DataCamp beschreibt die Denkstufen low, medium und high sowie die Zustände IN_PROGRESS und IDLE, die ein Client statt eines einzelnen Abschluss-Signals auswerten muss.
Die Einsatzmatrix trennt Dialog, Analyse und Transkription
Die drei Modelllinien lösen nicht dieselbe Aufgabe. Für die Architektur ist entscheidend, ob das System selbst sprechen und handeln, zusätzlich länger planen oder ausschließlich Sprache in Text umwandeln soll.
- Direkter Standarddialog: Gemini 3.8 Live. Das Basismodell passt zu Sprachinteraktionen, bei denen kurze Reaktionszeiten wichtiger sind als eine längere Planung. Es verarbeitet Audio, Text, Bilder und Video und kann externe Funktionen während des Dialogs anstoßen.
- Komplexe Hintergrundarbeit: Gemini 3.8 Live Extended Thinking. Diese Variante ist für mehrstufige Aufgaben gedacht, bei denen mehrere Ergebnisse geprüft oder Werkzeuge koordiniert werden. Die Anwendung muss dafür fortlaufende Zwischenäußerungen und asynchrone Zustände korrekt behandeln.
- Reine Verschriftlichung: Gemini 3.5 Transcribe. Wenn keine gesprochene Modellantwort und keine agentische Planung benötigt werden, ist das gesonderte Speech-to-Text-Modell die passendere Linie. Die Live-Version verarbeitet einen Audiostrom; die dateibasierte Variante ergänzt unter anderem Zeitstempel und Sprechertrennung.
Diese Trennung verhindert zwei Fehlentscheidungen: Extended Thinking ist kein allgemein schnelleres Live-Modell, und Transcribe ist kein Sprachagent. Die erste Variante tauscht zusätzlichen Rechenaufwand gegen mehrstufige Analyse; die zweite erzeugt Text statt eines fortlaufenden gesprochenen Dialogs.
API-Preis und Produktoberfläche sind getrennt zu betrachten
Der Google-Beitrag für Entwickler nennt für beide 3.8-Modelle 0,005 US-Dollar pro Minute Audioeingabe und 0,018 US-Dollar pro Minute Audioausgabe, bestätigt den Zugriff über die Live API und Google AI Studio sowie eine Abdeckung von mehr als 97 Sprachen; für Gemini 3.5 Transcribe werden mehr als 85 Sprachen ausgewiesen. Die Minutenbeträge sind Schätzwerte auf Basis der Tokenpreise, keine Pauschale für eine komplette Anwendung.
Zusätzliche Ausgaben können durch längere Ausgaben, Thinking-Tokens, Telefonie, Streaming-Infrastruktur, Suchzugriffe und externe Werkzeuge entstehen. Weil Extended Thinking bei anspruchsvollen Aufgaben mehr Ausgabetokens einschließlich Denktokens verbrauchen kann, bedeutet die gemeinsame Preistabelle nicht automatisch identische Sitzungskosten.
Auch die Endnutzerangebote folgen einem eigenen Rollout. Gemini 3.8 Live wird für Search Live ausgerollt. Extended Thinking ist für Gemini Live sowie – abhängig vom Abonnement – für Docs, Gmail und Keep vorgesehen. In Gemini Enterprise befinden sich beide Varianten zunächst in einer Private Preview. Die allgemeine Entwicklerverfügbarkeit lässt sich daher nicht auf jede Google-Oberfläche oder jedes Nutzerkonto übertragen.
Benchmarks ersetzen keinen Produktionstest
Google hebt in den Startmaterialien für Extended Thinking einen Wert von 82,6 im Speech-to-Speech Quality Index und 68,6 Prozent bei τ-Voice hervor. DataCamp ordnet diese beiden Werte der öffentlichen Rangliste von Artificial Analysis zu, weist aber darauf hin, dass andere veröffentlichte Resultate aus Herstellerkonfigurationen stammen. Die Auswahl und Darstellung in der Ankündigung bleibt deshalb Teil der Produktpositionierung.
Vor allem der Abstand zum Basismodell bei mehrstufigen Werkzeugaufgaben stützt die vorgesehene Rollenverteilung, beweist aber keine entsprechende Erfolgsquote in einer konkreten deutschsprachigen Anwendung. Akzente, Fachbegriffe, fehlerhafte Werkzeugantworten, Sitzungsdauer und eigene Dialogregeln verändern die Bedingungen gegenüber einem standardisierten Test.
Fest steht damit: Die beiden 3.8-Modelle sind für Entwickler veröffentlicht, Hintergrundaufrufe bei laufender Audioausgabe gehören zum bestätigten Funktionsumfang, und Extended Thinking erweitert diesen Ablauf um steuerbare mehrstufige Analyse. Offen bleiben unabhängige Felddaten zu langen deutschsprachigen Produktionssitzungen sowie die vollständige Freigabe in den noch gestaffelt ausgerollten Unternehmens- und Endnutzeroberflächen.
Lesen Sie auch:
Ähnliche Artikel


GPT‑Live‑1 hört beim Sprechen weiter zu – die Stimme kostet extra

Gemini 3.8 Flash startet günstig – hoher Denkaufwand verbraucht mehr Tokens

Gemini springt durch Videos – bis zu 88 Prozent weniger Tokens

YouTube übersetzt Livestreams live – der Pilot beginnt erst 2027

Gemini Enterprise for Legal startet – Vertraulichkeit bleibt der Prüfstein
Newsletter abonnieren
Erhalten Sie die neuesten Nachrichten zu Web3, KI und Krypto direkt in Ihren Posteingang.