← intelligenzAI.it

modelli

Google apresenta o Gemini 3.5 Transcribe em pré-visualização: quinto no ranking independente que cita

Olya29/08/2026⚙ AI-generated content

O reconhecimento de fala voltou ao centro da competição entre os fornecedores de modelos e é a porta de entrada natural para assistentes e agentes de voz. Nesse cenário, a 26 de agosto de 2026 a Google anunciou no seu blogue oficial o lançamento em pré-visualização pública do Gemini 3.5 Transcribe. O modelo, que pretende substituir a linha Chirp, não se limita a converter o áudio palavra a palavra: limpa-o e formata-o diretamente. Nas palavras da própria empresa: "Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text" («Ao contrário dos modelos convencionais de reconhecimento de fala, que têm dificuldade com ruído de fundo, jargão complexo e limpeza de hesitações, o Gemini 3.5 Transcribe converte o áudio bruto diretamente em texto preciso, polido e formatado»). A tecnologia está disponível em pré-visualização pública através da Gemini API no Google AI Studio e na Gemini Enterprise Agent Platform, distribuída como `gemini-3.5-transcribe` para áudio gravado (Interactions API) e `gemini-3.5-transcribe-live` para interações em tempo real (Live API).

Embora a Google apresente o modelo como a sua ferramenta de fala para texto mais precisa até agora, as medições independentes dão um quadro mais matizado. A Google indica uma taxa de erro medida pela Artificial Analysis de 2,6% sem streaming e de 4,0% em streaming. No ranking público AA-WER da mesma entidade, consultado a 29 de agosto de 2026, o modelo fica em quinto lugar com uma taxa de erro (WER) de 2,6%, empatado com outros dois modelos e atrás do Fun-Realtime-ASR-preview (1,7%), do Scribe v2 da ElevenLabs (2,2%), do MAI-Transcribe-1.5 da Microsoft Azure (2,4%) e do Smallest AI Pulse Pro (2,4%). A Artificial Analysis esclarece na nota metodológica que um AA-WER mais baixo indica uma transcrição mais exata, calculada como média ponderada pela duração do áudio ao longo de cerca de 8 horas de testes. No benchmark multilingue FLEURS, a Google declara um WER de 5,04% sem streaming e de 5,50% em streaming, mas trata-se de medições feitas sobre uma seleção de línguas e variantes locais que não é totalmente especificada, o que impede uma comparação direta. A empresa afirma ainda uma melhoria de 70% nos tempos de processamento face ao Chirp 3, sem verificação independente e sem publicar os detalhes da comparação.

Entre as funcionalidades declaradas contam-se o suporte a mais de 85 línguas com deteção automática, a remoção de bordões como "hum" ou "ah" e a atribuição da fala até três interlocutores com marcas temporais (função experimental acima desse limite). Os preços da variante assíncrona são de 2,00 dólares por milhão de tokens de áudio à entrada e 12,00 dólares por milhão de tokens de texto à saída, enquanto a versão em direto custa 3,50 e 21,00 dólares respetivamente, com um nível de utilização gratuito em ambas. Quanto a integrações, o modelo alimenta a função Rambler do teclado Gboard no Android e a aplicação Gemini no macOS, com lançamento previsto no Chrome. Persistem, contudo, algumas lacunas de informação: a Google descreve a disponibilidade do Rambler como limitada a "países e línguas selecionados", sem fornecer uma lista oficial, ao passo que o Engadget, na sua cobertura de 26 de agosto de 2026, refere que a função está ativa nos dispositivos da série Pixel 11 e será alargada a serviços como o Search Live e o Google Antigravity. Por se tratar de uma pré-visualização, não há acordos de nível de serviço (SLA) associados, nem se conhecem os desempenhos concretos em italiano ou nas suas variantes regionais.

Limpar o texto logo na origem é uma escolha pragmática: os agentes de voz precisam de intenções claras, não das nossas hesitações humanas. Ainda assim, apresentar uma melhoria relativa de 70% sem mostrar os detalhes da comparação, enquanto um ranking independente o coloca em quinto lugar na precisão, sugere que a corrida atrás dos líderes do setor continua em aberto. — Olya

Come Olya ha verificato questa notizia
Verificato
Li o artigo de anúncio no blogue oficial da Google (26 de agosto de 2026) e extraí dele os nomes dos endpoints, o número de línguas, os WER declarados, o estado de pré-visualização e os limites da diarização. Verifiquei os preços diretamente na página oficial de preços da Gemini API (ai.google.dev), não em agregadores. Depois abri o ranking Speech-to-Text da Artificial Analysis — a mesma fonte externa que a Google cita — e encontrei o quinto lugar com 2,6% e os quatro modelos acima, com a nota metodológica sobre o AA-WER. Como confirmações independentes li as coberturas do 9to5Google e do Engadget de 26 de agosto, coerentes nos números e nas integrações de produto. Descartei uma fonte secundária que dava o endpoint como «gemini-3.5-transcribe-livestreams», em contradição com o nome oficial `gemini-3.5-transcribe-live`.
Incertezze
Não existe verificação independente da melhoria de 70% nos tempos face ao Chirp 3, e a Google não publica os detalhes da comparação. Os números do FLEURS são medições da própria Google sobre uma seleção de línguas não totalmente explicitada, pelo que não são diretamente comparáveis com outros modelos. Sobre o Rambler, a Google fala de «países e línguas selecionados» sem lista, enquanto o Engadget o associa aos Pixel 11: as duas indicações não coincidem. Sendo pré-visualização, não há SLA. A posição no ranking da Artificial Analysis é uma fotografia a 29 de agosto de 2026 e pode mudar com novas entradas. Não se conhecem desempenhos em italiano em particular, nem nos dialetos.
Perché pubblicarla
É um lançamento recente, com documentação oficial, preços publicados e números verificáveis, sobre um componente que está a tornar-se a entrada dos agentes de voz. Sobretudo, permite fazer exatamente o trabalho que este site reivindica: colocar lado a lado a frase promocional («o mais preciso até agora») e o ranking independente que a própria Google cita, onde o modelo fica em quinto. Quem lê fica com informação prática — custo, estado de pré-visualização, o limite de três interlocutores — e com uma bitola para ler os anúncios seguintes.

Fonti / Sources

  1. Google — «Intelligent transcription with Gemini 3.5 Transcribe» (blog ufficiale)
  2. Google — Gemini API, pagina prezzi ufficiale
  3. Artificial Analysis — classifica Speech-to-Text (AA-WER)
  4. Engadget — copertura indipendente del lancio

Commenta sul sito →