Gemini 3.8 Live: Google bringt KI-Sprachagenten in Echtzeit

Google veröffentlicht Gemini 3.8 Live und 3.5 Transcribe: Echtzeit-Sprachagenten, Tool-Aufrufe und Live-Transkription für Entwickler weltweit.

Abstrakte Echtzeit-Audio-Wellen verbinden Mikrofon, Sprachagent und Entwicklercode in blau-violettem Licht

Google erweitert seine Entwicklerplattform um neue Echtzeit-Audiomodelle. Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking sind seit dem 15. September 2026 über die Gemini API und Google AI Studio verfügbar. Sie sollen Sprachagenten ermöglichen, die nicht nur antworten, sondern während des Gesprächs Werkzeuge aufrufen und Aufgaben ausführen.

Was Google neu veröffentlicht

Gemini 3.8 Live ist ein Audio-zu-Audio-Modell für natürliche Dialoge mit geringer Latenz. Die Variante Extended Thinking kann komplexe mehrstufige Aufgaben im Hintergrund bearbeiten, während die Unterhaltung weiterläuft. Google nennt dafür unter anderem asynchrone Funktionsaufrufe, visuellen Kontext, die Verarbeitung alphanumerischer Angaben und inkrementelle Aktualisierungen strukturierter Ergebnisse.

Für Entwickler bedeutet das: Ein Sprachagent kann beispielsweise während einer laufenden Unterhaltung eine API aufrufen, Daten nachladen oder einen Arbeitsschritt anstoßen, ohne den Dialog vollständig zu unterbrechen. Die Modelle sind über die Gemini Live API und zum Ausprobieren über Google AI Studio erreichbar.

Gemini 3.5 Transcribe für Live-Transkription

Zusätzlich führt Google Gemini 3.5 Transcribe als spezialisiertes Echtzeit-Sprach-zu-Text-Modell. Es unterstützt laut Google mehr als 85 Sprachen, automatische Sprachwechsel und ein benutzerdefiniertes Vokabular mit bis zu 1.000 Begriffen. Das ist vor allem für Untertitel, Diktate, Gesprächsprotokolle und Callcenter-Anwendungen relevant.

Die technische Grundlage der Live API ist eine zustandsbehaftete WebSocket-Verbindung. Audio wird als 16-Bit-PCM mit 16 kHz eingespeist, die Audioausgabe erfolgt mit 24 kHz. Für produktive Client-zu-Server-Anwendungen empfiehlt Google kurzlebige Tokens statt dauerhaft eingebetteter API-Schlüssel.

Preise und Grenzen des Zugangs

Im kostenpflichtigen API-Tarif berechnet Google für Gemini 3.8 Live und Extended Thinking 0,005 US-Dollar je Minute Audioeingabe und 0,018 US-Dollar je Minute Audioausgabe. Die Preisdokumentation weist zugleich einen kostenlosen Tarif aus; bei diesem können Daten zur Produktverbesserung verwendet werden, während Google dies im bezahlten Tarif ausschließt. Suchgrundierung und weitere Funktionen können zusätzlichen Bedingungen unterliegen.

Die neuen Modelle sind damit kein fertiger Endnutzer-Chatbot, sondern Bausteine für eigene Anwendungen. Entwickler benötigen einen Zugang zur Gemini API oder zu AI Studio und müssen die jeweiligen Länder-, Kontingent- und Kontobedingungen beachten. Die Live API unterstützt laut Dokumentation 70 Sprachen; Googles Produktankündigung nennt für die neuen Audiofunktionen eine breitere Sprachabdeckung, weshalb konkrete Modell- und Feature-Unterstützung vor dem Einsatz geprüft werden sollte.

Was sich praktisch ändert

Für Teams, die Sprachschnittstellen bauen, sinkt der Aufwand für eine gekoppelte Kette aus Spracherkennung, Textmodell und Sprachsynthese. Ein einzelnes Live-Modell kann Dialog, Tool-Aufrufe und Audioausgabe enger verbinden. Gleichzeitig bleiben WebSocket-Infrastruktur, Sicherheitskonzept, Kostenkontrolle und die Prüfung der Modellantworten Aufgaben des jeweiligen Projekts.

Die Entwicklung passt zu Googles jüngstem Ausbau von KI-Anwendungen: Die offene KI-Forschung von NASA und IBM zeigt den Einsatz spezialisierter Modelle in der Wissenschaft, während Sprachagenten nun stärker in alltägliche Software integriert werden können.

Quellen

Stand: 25. September 2026.