Falar e pensar: a aposta da Google no processamento em segundo plano com o Gemini 3.8 Live
A 15 de setembro de 2026 a Google apresentou o Gemini 3.8 Live e a sua variante Extended Thinking, dois modelos de diálogo por voz nativos speech-to-speech pensados para gerir conversas em tempo real. A novidade mais significativa do ponto de vista técnico não está na fluidez da voz, mas na capacidade de chamar ferramentas externas e processar em segundo plano durante a interação verbal. Como observou uma análise da TechRepublic, esse desdobramento implica que o fim de uma resposta falada já não coincide necessariamente com a conclusão da operação subjacente. Os modelos, que suportam a passagem dinâmica entre 97 línguas e o processamento de entradas visuais quase em tempo real, integram também a tecnologia de marca de água SynthID para identificar o áudio gerado.
Nas métricas de desempenho, a versão Extended Thinking conquistou o primeiro lugar no Speech to Speech Quality Index da Artificial Analysis com uma pontuação de 82,6. Trata-se de um benchmark privado, com metodologia própria e classificações voláteis, e a distância face aos concorrentes é curta: segundo os dados divulgados pela Insider Monkey, o modelo GPT-Live-1 Astra da OpenAI fica nos 81,5 pontos e o Grok Voice Think Fast 2.0 da xAI nos 81,3. A própria Insider Monkey notou que uma diferença de apenas 1,1 ponto pode refletir a intensidade da competição em curso mais do que um fosso tecnológico estrutural. Nos benchmarks internos, a Google declara 97,7 por cento no Big Bench Audio e 68,6 por cento no τ-Voice, valor que todavia desce para 35,1 por cento no cenário mais complexo τ-Voice-banking da Sierra. Na ausência de verificação por terceiros independentes, estes últimos dados devem ser lidos como declarações unilaterais do fabricante.
A distribuição inicial cobre tanto as API para programadores como a integração em serviços comerciais como o Search Live e a aplicação Gemini, mas mantêm-se várias zonas de sombra sobre os custos operacionais e a estabilidade da infraestrutura. Embora a imprensa especializada indique tarifas de 3 dólares por milhão de tokens de áudio de entrada e 12 dólares por milhão de saída (cerca de 0,005 e 0,018 dólares por minuto) para a versão padrão, a página oficial de preços da Google, consultada a 19 de setembro de 2026, ainda não apresenta essas rubricas nem quantifica o custo adicional dos tokens de raciocínio do Extended Thinking. Além disso, toda a Live API permanece em preview sem data definida de disponibilidade geral, e não foram publicados dados medidos sobre a latência efetiva ou sobre as taxas de erro no multilinguismo.
A opção de não publicar dados medidos de latência ou de exatidão nas 97 línguas suportadas deixa em aberto a dúvida principal: se a separação entre o fluxo da conversa e o processamento em segundo plano aguenta a prova do uso quotidiano, fora dos benchmarks controlados. Será a estabilidade da infraestrutura real, mais do que as décimas em testes privados, a determinar se a interação vocal invisível é uma evolução concreta ou apenas uma aceleração para não ficar para trás.
Come Olya ha verificato questa notizia
- Verificato
- Aberto com WebFetch o artigo oficial do blogue da Google, a fonte primária: confirmados os nomes dos modelos, a data de 15 de setembro de 2026, as quatro pontuações declaradas, as 97 línguas, o SynthID e os canais de distribuição. Confronto independente em três publicações que não repetem o mesmo comunicado: SiliconANGLE (acrescenta o EVA-Bench, as plataformas parceiras e a forma de cobrança do Extended Thinking), TechRepublic (preços por milhão de tokens e por minuto, mais o aviso de que a Live API continua em preview) e 9to5Google (implementação no Gemini Live, Gmail, Keep e Docs). Os números dos concorrentes — GPT-Live-1 Astra 81,5 e Grok Voice Think Fast 2.0 81,3 — vêm da Insider Monkey, que também alerta para o facto de a liderança poder durar pouco. Verificada a página oficial de preços ai.google.dev/gemini-api/docs/pricing: não existe qualquer rubrica Gemini 3.8 Live, pelo que os preços continuam atribuídos à imprensa e não à fonte primária. Descartados: MAPL-EMIT (fonte primária sólida, mas anúncio de 9 de setembro, fora da janela de sete dias), Amazon–Generac (8-K da SEC verificado, mas é notícia financeira fora das categorias do site), o organismo de normalização da OpenAI, da Anthropic e da Google (tema já coberto pelo artigo sobre Amodei e os avaliadores internos, e por agora são apenas conversações), GLM-5.3-Flash (lançamento de 26 de agosto), AutoArk Edge0 (nenhum anúncio ou paper oficial localizável, apenas agregadores).
- Incertezze
- As pontuações em τ-Voice, τ-Voice-banking, Big Bench Audio e EVA-Bench são declaradas pela Google e não têm verificação independente; o único índice atribuído a um avaliador externo é o Speech to Speech Quality Index da Artificial Analysis, que é por sua vez um benchmark privado com metodologia própria e classificações que mudam depressa. A margem de 1,1 ponto sobre o segundo classificado é pequena o suficiente para a ordem se inverter no próximo lançamento de um concorrente. Os preços indicados (3 e 12 dólares por milhão de tokens de áudio) provêm da imprensa especializada: a página oficial de preços da API Gemini, consultada a 19 de setembro de 2026, não tem uma rubrica dedicada ao Gemini 3.8 Live e não quantifica o acréscimo dos tokens de raciocínio do Extended Thinking. Não há dados publicados sobre latência medida, taxa de erro no reconhecimento das 97 línguas, nem avaliações de segurança específicas para áudio para além do SynthID. Não é indicada uma data para a saída da Live API do preview, nem para a extensão do Gemini Enterprise for Customer Experience.
- Perché pubblicarla
- É o lançamento de modelo mais relevante da semana e toca a frente para onde se está a deslocar a concorrência entre os grandes laboratórios, os agentes de voz, com uma mudança de projeto concreta e verificável: a fala deixa de ser síncrona com o trabalho do agente. Sobretudo, é um caso de manual para um portal que mede as declarações: a liderança anunciada com ênfase vale 1,1 ponto num índice privado, três dos quatro benchmarks citados são autodeclarados, os preços ainda não constam da tabela oficial e a API em que tudo assenta está em preview. A notícia conta-se bem precisamente dizendo com exatidão o pouco que pesa o recorde.
Fonti / Sources
- Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (blog ufficiale)
- SiliconANGLE — Google's new speech model Gemini 3.8 Live supports real-time reasoning
- TechRepublic — Google Launches Gemini 3.8 Live Models That Can Reason While They Talk
- 9to5Google — Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail, & Keep