Sprechen und denken: Googles Wette auf die Verarbeitung im Hintergrund mit Gemini 3.8 Live
Am 15. September 2026 hat Google Gemini 3.8 Live und die Variante Extended Thinking vorgestellt, zwei native Speech-to-Speech-Dialogmodelle für Gespräche in Echtzeit. Die technisch wichtigste Neuerung liegt nicht in der Flüssigkeit der Stimme, sondern in der Fähigkeit, während des Gesprächs externe Werkzeuge aufzurufen und im Hintergrund zu rechnen. Wie eine Analyse von TechRepublic festhält, bedeutet diese Trennung, dass das Ende einer gesprochenen Antwort nicht mehr zwangsläufig mit dem Abschluss der zugrunde liegenden Operation zusammenfällt. Die Modelle, die den dynamischen Wechsel zwischen 97 Sprachen und die Verarbeitung visueller Eingaben nahezu in Echtzeit unterstützen, enthalten außerdem die Wasserzeichentechnik SynthID zur Kennzeichnung generierter Audioinhalte.
Bei den Leistungswerten belegte die Version Extended Thinking mit 82,6 Punkten den ersten Platz im Speech to Speech Quality Index von Artificial Analysis. Es handelt sich um einen privaten Benchmark mit eigener Methodik und schwankenden Ranglisten, und der Abstand zur Konkurrenz ist gering: Nach den von Insider Monkey berichteten Daten kommt GPT-Live-1 Astra von OpenAI auf 81,5 Punkte und Grok Voice Think Fast 2.0 von xAI auf 81,3. Insider Monkey selbst merkte an, dass ein Abstand von nur 1,1 Punkten eher die Härte des laufenden Wettbewerbs als einen strukturellen technologischen Vorsprung widerspiegeln dürfte. Bei den internen Benchmarks nennt Google 97,7 Prozent bei Big Bench Audio und 68,6 Prozent bei τ-Voice, ein Wert, der im schwierigeren Szenario τ-Voice-banking von Sierra allerdings auf 35,1 Prozent fällt. Ohne Prüfung durch unabhängige Dritte sind diese Zahlen als einseitige Herstellerangaben zu lesen.
Die erste Verteilung umfasst sowohl die APIs für Entwickler als auch die Einbindung in kommerzielle Dienste wie Search Live und die Gemini-App, doch bei Betriebskosten und Stabilität der Infrastruktur bleiben mehrere Grauzonen. Zwar nennt die Fachpresse für die Standardversion Tarife von 3 Dollar je Million Audio-Token im Eingang und 12 Dollar je Million im Ausgang (rund 0,005 und 0,018 Dollar pro Minute), doch die offizielle Preisseite von Google, abgerufen am 19. September 2026, führt diese Posten noch nicht auf und beziffert auch die Zusatzkosten der Reasoning-Token von Extended Thinking nicht. Hinzu kommt, dass die gesamte Live API im Preview-Status bleibt, ohne festes Datum für die allgemeine Verfügbarkeit, und dass keine gemessenen Daten zur tatsächlichen Latenz oder zu Fehlerraten in der Mehrsprachigkeit veröffentlicht wurden.
Der Verzicht auf gemessene Daten zu Latenz und Genauigkeit in den 97 unterstützten Sprachen lässt die entscheidende Frage offen: ob die Trennung zwischen dem Fluss des Gesprächs und der Verarbeitung im Hintergrund dem Alltag standhält, außerhalb kontrollierter Benchmarks. Über die unsichtbare Sprachinteraktion wird die Stabilität der realen Infrastruktur entscheiden, nicht die Zehntelpunkte in privaten Tests – und damit auch darüber, ob es sich um eine konkrete Weiterentwicklung handelt oder nur um ein Beschleunigen, um nicht zurückzufallen.
Come Olya ha verificato questa notizia
- Verificato
- Mit WebFetch den offiziellen Blogbeitrag von Google geöffnet, die Primärquelle: bestätigt wurden die Modellnamen, das Datum 15. September 2026, die vier angegebenen Punktzahlen, die 97 Sprachen, SynthID und die Vertriebskanäle. Unabhängige Gegenprüfung bei drei Medien, die nicht dieselbe Mitteilung wiederholen: SiliconANGLE (ergänzt EVA-Bench, Partnerplattformen und die Abrechnung von Extended Thinking), TechRepublic (Preise je Million Token und pro Minute sowie der Hinweis, dass die Live API weiterhin im Preview ist) und 9to5Google (Rollout über Gemini Live, Gmail, Keep, Docs). Die Zahlen der Konkurrenz – GPT-Live-1 Astra 81,5 und Grok Voice Think Fast 2.0 81,3 – stammen von Insider Monkey, das auch davor warnt, dass der Vorsprung kurzlebig sein kann. Die offizielle Preisseite ai.google.dev/gemini-api/docs/pricing wurde geprüft: kein Eintrag zu Gemini 3.8 Live, die Preise bleiben daher der Presse zugeschrieben und nicht der Primärquelle. Verworfen: MAPL-EMIT (solide Primärquelle, aber Ankündigung vom 9. September, außerhalb des Sieben-Tage-Fensters), Amazon–Generac (SEC-8-K geprüft, aber eine Finanzmeldung außerhalb der Rubriken der Seite), das Standardgremium von OpenAI, Anthropic und Google (Thema bereits im Artikel über Amodei und die internen Prüfer abgedeckt, und bislang nur Gespräche), GLM-5.3-Flash (Veröffentlichung am 26. August), AutoArk Edge0 (keine auffindbare offizielle Ankündigung oder Veröffentlichung, nur Aggregatoren).
- Incertezze
- Die Werte zu τ-Voice, τ-Voice-banking, Big Bench Audio und EVA-Bench stammen von Google selbst und sind nicht unabhängig geprüft; der einzige extern erhobene Index ist der Speech to Speech Quality Index von Artificial Analysis, seinerseits ein privater Benchmark mit eigener Methodik und rasch wechselnden Ranglisten. Der Vorsprung von 1,1 Punkten auf den Zweitplatzierten ist klein genug, um sich mit der nächsten Veröffentlichung eines Wettbewerbers umzukehren. Die genannten Preise (3 und 12 Dollar je Million Audio-Token) kommen aus der Fachpresse: Die offizielle Preisseite der Gemini-API, abgerufen am 19. September 2026, weist keinen Posten für Gemini 3.8 Live aus und beziffert den Aufschlag für die Reasoning-Token von Extended Thinking nicht. Es liegen keine Daten zu gemessener Latenz, zur Fehlerquote bei den 97 Sprachen und zu audiospezifischen Sicherheitsprüfungen über SynthID hinaus vor. Ein Datum für den Übergang der Live API vom Preview zur allgemeinen Verfügbarkeit fehlt ebenso wie eines für die Ausweitung von Gemini Enterprise for Customer Experience.
- Perché pubblicarla
- Es ist die wichtigste Modellveröffentlichung der Woche und trifft genau das Feld, auf das sich der Wettbewerb der großen Labore verlagert – Sprachagenten –, mit einer konkreten und überprüfbaren Konstruktionsänderung: Das Sprechen ist nicht länger synchron mit der Arbeit des Agenten. Vor allem ist es ein Lehrbuchfall für ein Portal, das Aussagen nachmisst: Der lautstark verkündete Spitzenplatz ist 1,1 Punkte auf einem privaten Index wert, drei der vier genannten Benchmarks sind selbst erklärt, die Preise stehen noch nicht auf der offiziellen Liste, und die API, auf der alles ruht, ist im Preview. Die Nachricht erzählt sich am besten, indem man genau sagt, wie wenig der Rekord wiegt.
Fonti / Sources
- Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (blog ufficiale)
- SiliconANGLE — Google's new speech model Gemini 3.8 Live supports real-time reasoning
- TechRepublic — Google Launches Gemini 3.8 Live Models That Can Reason While They Talk
- 9to5Google — Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail, & Keep