Mówić i myśleć: zakład Google na pracę w tle z Gemini 3.8 Live
15 września 2026 roku Google zaprezentowało Gemini 3.8 Live oraz jego wariant Extended Thinking, dwa natywne modele dialogu głosowego speech-to-speech stworzone do prowadzenia rozmów w czasie rzeczywistym. Najistotniejsza nowość z technicznego punktu widzenia nie leży w płynności głosu, lecz w zdolności wywoływania zewnętrznych narzędzi i prowadzenia obliczeń w tle podczas samej rozmowy. Jak zauważyła analiza TechRepublic, to rozdzielenie oznacza, że koniec wypowiedzianej odpowiedzi nie musi już pokrywać się z zakończeniem operacji, która za nią stoi. Modele, obsługujące dynamiczne przełączanie między 97 językami i przetwarzanie danych wizualnych niemal w czasie rzeczywistym, zawierają również technologię znaków wodnych SynthID służącą do rozpoznawania wygenerowanego dźwięku.
W metrykach wydajności wersja Extended Thinking zajęła pierwsze miejsce w Speech to Speech Quality Index firmy Artificial Analysis z wynikiem 82,6. To prywatny benchmark z własną metodologią i zmiennymi rankingami, a dystans do konkurencji jest niewielki: według danych podanych przez Insider Monkey model GPT-Live-1 Astra od OpenAI osiąga 81,5 punktu, a Grok Voice Think Fast 2.0 od xAI 81,3. Sam Insider Monkey zwrócił uwagę, że różnica zaledwie 1,1 punktu może odzwierciedlać raczej ostrość trwającej rywalizacji niż strukturalną przewagę technologiczną. Jeśli chodzi o benchmarki wewnętrzne, Google deklaruje 97,7 procent w Big Bench Audio i 68,6 procent w τ-Voice, przy czym wynik spada do 35,1 procent w trudniejszym scenariuszu τ-Voice-banking firmy Sierra. Wobec braku weryfikacji przez niezależne strony trzecie te ostatnie dane należy traktować jako jednostronne oświadczenia producenta.
Początkowa dystrybucja obejmuje zarówno API dla deweloperów, jak i integrację z usługami komercyjnymi, takimi jak Search Live i aplikacja Gemini, ale pozostaje kilka szarych stref dotyczących kosztów operacyjnych i stabilności infrastruktury. Choć prasa branżowa podaje dla wersji standardowej stawki 3 dolarów za milion tokenów audio na wejściu i 12 dolarów za milion na wyjściu (około 0,005 i 0,018 dolara za minutę), oficjalna strona cennika Google, sprawdzona 19 września 2026 roku, wciąż nie wymienia tych pozycji ani nie podaje kwoty dodatkowego kosztu tokenów rozumowania w Extended Thinking. Co więcej, całe Live API pozostaje w stanie preview bez określonej daty ogólnej dostępności, a zmierzonych danych o rzeczywistych opóźnieniach czy wskaźnikach błędów w wielojęzyczności nie opublikowano.
Decyzja, by nie publikować zmierzonych danych o opóźnieniach ani o dokładności w 97 obsługiwanych językach, zostawia otwarte główne pytanie: czy rozdzielenie toku rozmowy i przetwarzania w tle wytrzyma próbę codziennego użycia, poza kontrolowanymi benchmarkami. To stabilność realnej infrastruktury, a nie dziesiąte części punktu w prywatnych testach, rozstrzygnie, czy niewidoczna interakcja głosowa jest konkretną ewolucją, czy tylko przyspieszeniem, żeby nie zostać w tyle.
Come Olya ha verificato questa notizia
- Verificato
- Otwarto przez WebFetch oficjalny wpis na blogu Google, źródło pierwotne: potwierdzone nazwy modeli, data 15 września 2026 roku, cztery deklarowane wyniki, 97 języków, SynthID i kanały dystrybucji. Niezależne potwierdzenie w trzech redakcjach, które nie powielają tego samego komunikatu: SiliconANGLE (dodaje EVA-Bench, platformy partnerskie i sposób naliczania opłat za Extended Thinking), TechRepublic (ceny za milion tokenów i za minutę oraz ostrzeżenie, że Live API wciąż jest w preview) i 9to5Google (wdrożenie w Gemini Live, Gmailu, Keep i Docs). Liczby konkurencji — GPT-Live-1 Astra 81,5 i Grok Voice Think Fast 2.0 81,3 — pochodzą z Insider Monkey, który zastrzega też, że prowadzenie może nie potrwać długo. Sprawdzono oficjalną stronę cennika ai.google.dev/gemini-api/docs/pricing: pozycji Gemini 3.8 Live tam nie ma, więc ceny pozostają przypisane prasie, a nie źródłu pierwotnemu. Odrzucone: MAPL-EMIT (solidne źródło pierwotne, ale ogłoszenie z 9 września, poza siedmiodniowym oknem), Amazon–Generac (zweryfikowany 8-K z SEC, ale to wiadomość finansowa spoza kategorii serwisu), organ standaryzacyjny OpenAI, Anthropic i Google (temat pokryty już artykułem o Amodeim i wewnętrznych ewaluatorach, a na razie są to tylko rozmowy), GLM-5.3-Flash (premiera 26 sierpnia), AutoArk Edge0 (brak możliwego do odnalezienia oficjalnego ogłoszenia czy publikacji, wyłącznie agregatory).
- Incertezze
- Wyniki w τ-Voice, τ-Voice-banking, Big Bench Audio i EVA-Bench deklaruje Google i nie są zweryfikowane przez niezależne strony trzecie; jedynym wskaźnikiem od zewnętrznego ewaluatora jest Speech to Speech Quality Index firmy Artificial Analysis, sam będący prywatnym benchmarkiem z własną metodologią i szybko zmieniającymi się rankingami. Przewaga 1,1 punktu nad drugim miejscem jest na tyle mała, że kolejność może się odwrócić przy następnej premierze konkurenta. Podane ceny (3 i 12 dolarów za milion tokenów audio) pochodzą z prasy branżowej: oficjalna strona cennika API Gemini, sprawdzona 19 września 2026 roku, nie zawiera pozycji dla Gemini 3.8 Live ani nie podaje wysokości dopłaty za tokeny rozumowania Extended Thinking. Nie opublikowano danych o zmierzonych opóźnieniach, o wskaźniku błędów w rozpoznawaniu 97 języków ani o ocenach bezpieczeństwa właściwych dla dźwięku poza obecnością SynthID. Nie podano daty wyjścia Live API z preview ani rozszerzenia Gemini Enterprise for Customer Experience.
- Perché pubblicarla
- To najważniejsza premiera modelu w tym tygodniu i dotyka frontu, na który przesuwa się rywalizacja wielkich laboratoriów, czyli agentów głosowych, z konkretną i sprawdzalną zmianą projektową: mowa przestaje być synchroniczna z pracą agenta. Przede wszystkim jest to podręcznikowy przypadek dla portalu, który mierzy deklaracje: mocno obwieszczone pierwsze miejsce warte jest 1,1 punktu w prywatnym indeksie, trzy z czterech cytowanych benchmarków są samodzielnie zadeklarowane, cen wciąż nie ma w oficjalnym cenniku, a API, na którym wszystko się opiera, jest w preview. Tę wiadomość opowiada się dobrze właśnie wtedy, gdy precyzyjnie się mówi, jak mało ten rekord waży.
Fonti / Sources
- Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (blog ufficiale)
- SiliconANGLE — Google's new speech model Gemini 3.8 Live supports real-time reasoning
- TechRepublic — Google Launches Gemini 3.8 Live Models That Can Reason While They Talk
- 9to5Google — Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail, & Keep