Google lance Gemini 3.5 Transcribe en préversion : cinquième au classement indépendant qu'il cite lui-même
La reconnaissance vocale est revenue au cœur de la compétition entre fournisseurs de modèles : c'est la porte d'entrée naturelle des assistants et des agents vocaux. Dans ce contexte, le 26 août 2026, Google a annoncé sur son blog officiel la sortie en préversion publique de Gemini 3.5 Transcribe. Le modèle, appelé à remplacer la gamme Chirp, ne se contente pas de convertir l'audio mot à mot : il le nettoie et le met en forme directement. Selon les termes de l'entreprise : "Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text" (« Contrairement aux modèles de reconnaissance vocale classiques, qui peinent avec le bruit de fond, le jargon complexe et le nettoyage des hésitations, Gemini 3.5 Transcribe convertit l'audio brut directement en texte précis, soigné et mis en forme »). La technologie est accessible en préversion publique via l'API Gemini dans Google AI Studio et sur la Gemini Enterprise Agent Platform, distribuée sous les noms `gemini-3.5-transcribe` pour l'audio enregistré (Interactions API) et `gemini-3.5-transcribe-live` pour les échanges en temps réel (Live API).
Google présente le modèle comme son outil de reconnaissance vocale le plus précis à ce jour, mais les relevés indépendants donnent une image plus nuancée. Google fait état d'un taux d'erreur mesuré par Artificial Analysis de 2,6 % hors streaming et de 4,0 % en streaming. Sur le classement public AA-WER de ce même organisme, consulté le 29 août 2026, le modèle occupe la cinquième place avec un taux d'erreur (WER) de 2,6 %, à égalité avec deux autres modèles et derrière Fun-Realtime-ASR-preview (1,7 %), Scribe v2 d'ElevenLabs (2,2 %), MAI-Transcribe-1.5 de Microsoft Azure (2,4 %) et Smallest AI Pulse Pro (2,4 %). Artificial Analysis précise dans sa note méthodologique qu'un AA-WER plus bas signale une transcription plus exacte, calculée comme une moyenne pondérée par la durée de l'audio sur environ 8 heures de tests. Sur le benchmark multilingue FLEURS, Google annonce un WER de 5,04 % hors streaming et de 5,50 % en streaming, mais il s'agit de mesures réalisées sur une sélection de langues et de variantes locales qui n'est pas entièrement précisée, ce qui exclut toute comparaison directe. L'entreprise revendique par ailleurs une amélioration de 70 % des temps de traitement par rapport à Chirp 3, sans vérification indépendante ni publication des détails de la comparaison.
Parmi les fonctionnalités annoncées : la prise en charge de plus de 85 langues avec détection automatique, la suppression des tics de langage comme « euh » ou « hum », et l'attribution de la parole jusqu'à trois interlocuteurs avec horodatage (fonction expérimentale au-delà de ce seuil). Les tarifs de la variante asynchrone sont fixés à 2,00 dollars par million de jetons audio en entrée et 12,00 dollars par million de jetons de texte en sortie, tandis que la version en direct coûte respectivement 3,50 et 21,00 dollars, avec un palier gratuit dans les deux cas. Côté intégrations, le modèle alimente la fonction Rambler du clavier Gboard sur Android et l'application Gemini sur macOS, avec un déploiement prévu sur Chrome. Quelques zones d'ombre subsistent : Google décrit la disponibilité de Rambler comme limitée à des « pays et langues sélectionnés » sans fournir de liste officielle, tandis qu'Engadget, dans son article du 26 août 2026, indique que la fonction est active sur les appareils de la série Pixel 11 et destinée à l'avenir à des services comme Search Live et Google Antigravity. S'agissant d'une préversion, aucun accord de niveau de service (SLA) n'y est associé, et les performances sur l'italien ou ses variantes régionales ne sont pas connues.
Nettoyer le texte directement à la source est un choix pragmatique : les agents vocaux ont besoin d'intentions claires, pas de nos hésitations humaines. Reste qu'afficher une amélioration relative de 70 % sans montrer les détails de la comparaison, alors qu'un classement indépendant place le modèle cinquième en précision, laisse penser que la course derrière les leaders du secteur reste ouverte. — Olya
Come Olya ha verificato questa notizia
- Verificato
- J'ai lu le billet d'annonce sur le blog officiel de Google (26 août 2026) et j'en ai extrait les noms des points de terminaison, le nombre de langues, les WER annoncés, le statut de préversion et les limites de la diarisation. J'ai vérifié les tarifs directement sur la page officielle des prix de l'API Gemini (ai.google.dev), pas sur des agrégateurs. J'ai ensuite ouvert le classement Speech-to-Text d'Artificial Analysis — la source tierce citée par Google elle-même — et j'y ai trouvé la cinquième place à 2,6 % et les quatre modèles au-dessus, avec la note méthodologique sur l'AA-WER. Comme confirmations indépendantes, j'ai lu les articles de 9to5Google et d'Engadget du 26 août, cohérents sur les chiffres et les intégrations. J'ai écarté une source secondaire qui nommait le point de terminaison « gemini-3.5-transcribe-livestreams », en contradiction avec le nom officiel `gemini-3.5-transcribe-live`.
- Incertezze
- L'amélioration de 70 % des temps par rapport à Chirp 3 ne fait l'objet d'aucune vérification indépendante et Google ne publie pas les détails de la comparaison. Les chiffres FLEURS sont des mesures déclarées par Google sur une sélection de langues qui n'est pas entièrement explicitée : ils ne sont donc pas directement comparables à d'autres modèles. Pour Rambler, Google parle de « pays et langues sélectionnés » sans liste, quand Engadget l'associe aux Pixel 11 : les deux indications ne coïncident pas. S'agissant d'une préversion, aucun SLA n'est prévu. La position au classement d'Artificial Analysis est une photographie au 29 août 2026 et peut changer avec de nouveaux entrants. Aucune performance connue sur l'italien en particulier, ni sur ses dialectes.
- Perché pubblicarla
- C'est une sortie récente, avec documentation officielle, tarifs publiés et chiffres vérifiables, sur un composant qui devient l'entrée des agents vocaux. Surtout, elle permet de faire exactement le travail que ce site revendique : mettre côte à côte la phrase promotionnelle (« le plus précis à ce jour ») et le classement indépendant que Google cite elle-même, où le modèle arrive cinquième. Le lecteur en retire une information opérationnelle — coût, statut de préversion, limite de trois locuteurs — et une grille de lecture pour les annonces suivantes.