Google представила Gemini 3.5 Transcribe в предварительной версии: пятое место в независимом рейтинге, на который сама ссылается
Распознавание речи снова оказалось в центре соперничества поставщиков моделей: это естественная точка входа для ассистентов и голосовых агентов. На этом фоне 26 августа 2026 года Google объявила в своём официальном блоге о публичной предварительной версии Gemini 3.5 Transcribe. Модель, которая должна сменить линейку Chirp, не просто переводит звук в слова, а сразу вычищает и форматирует текст. Формулировка самой компании: "Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text" («В отличие от обычных моделей распознавания речи, которым тяжело даются фоновый шум, сложный жаргон и очистка от речевых сбоев, Gemini 3.5 Transcribe превращает сырой звук напрямую в точный, отшлифованный и оформленный текст»). Технология доступна в публичной предварительной версии через Gemini API в Google AI Studio и на Gemini Enterprise Agent Platform, в вариантах `gemini-3.5-transcribe` для записанного аудио (Interactions API) и `gemini-3.5-transcribe-live` для взаимодействия в реальном времени (Live API).
Google подаёт модель как самый точный свой инструмент распознавания речи на сегодня, однако независимые замеры рисуют более сложную картину. Компания приводит измеренную Artificial Analysis долю ошибок: 2,6% без потоковой передачи и 4,0% в потоковом режиме. В публичном рейтинге AA-WER той же организации, просмотренном 29 августа 2026 года, модель занимает пятое место с долей ошибок в словах (WER) 2,6% — наравне с двумя другими моделями и позади Fun-Realtime-ASR-preview (1,7%), Scribe v2 от ElevenLabs (2,2%), MAI-Transcribe-1.5 от Microsoft Azure (2,4%) и Smallest AI Pulse Pro (2,4%). В методологической заметке Artificial Analysis уточняет, что более низкий AA-WER означает более точную расшифровку и рассчитывается как среднее, взвешенное по длительности аудио, примерно на 8 часах тестового материала. На многоязычном бенчмарке FLEURS Google заявляет WER 5,04% без потоковой передачи и 5,50% в потоке, но это измерения на выборке языков и локальных вариантов, раскрытой не полностью, — прямое сравнение исключено. Кроме того, компания говорит об улучшении времени обработки на 70% по сравнению с Chirp 3, однако независимой проверки нет, а подробности сравнения не публикуются.
Среди заявленных возможностей — поддержка более 85 языков с автоматическим определением, удаление слов-паразитов вроде «э-э» или «ну», и разметка речи до трёх собеседников с временными метками (сверх этого порога функция экспериментальная). Асинхронный вариант стоит 2,00 доллара за миллион входных аудиотокенов и 12,00 доллара за миллион выходных текстовых токенов, live-версия — соответственно 3,50 и 21,00 доллара, у обеих есть бесплатный уровень использования. Что до интеграций, модель питает функцию Rambler в клавиатуре Gboard на Android и приложение Gemini на macOS, запуск в Chrome запланирован. Информационные пробелы, впрочем, остаются: Google описывает доступность Rambler как ограниченную «отдельными странами и языками», не публикуя официального списка, а издание Engadget в материале от 26 августа 2026 года сообщает, что функция работает на устройствах серии Pixel 11 и в будущем предназначена для сервисов вроде Search Live и Google Antigravity. Поскольку речь о предварительной версии, соглашений об уровне обслуживания (SLA) к ней не прилагается, а данных о качестве работы с итальянским языком и его региональными вариантами нет.
Вычищать текст прямо у источника — решение прагматичное: голосовым агентам нужны ясные намерения, а не наши человеческие заминки. И всё же заявленное относительное улучшение на 70% без подробностей сравнения, при том что независимый рейтинг ставит модель на пятое место по точности, говорит: догонять лидеров отрасли ещё придётся. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Я прочитала анонс в официальном блоге Google (26 августа 2026 года) и извлекла из него названия эндпоинтов, число языков, заявленные значения WER, статус предварительной версии и ограничения диаризации. Цены проверила напрямую на официальной странице тарифов Gemini API (ai.google.dev), а не на агрегаторах. Затем открыла рейтинг Speech-to-Text от Artificial Analysis — тот самый сторонний источник, на который ссылается Google, — и нашла там пятое место с 2,6% и четыре модели выше, вместе с методологической заметкой об AA-WER. В качестве независимых подтверждений прочла материалы 9to5Google и Engadget от 26 августа: цифры и продуктовые интеграции совпадают. Отбросила вторичный источник, называвший эндпоинт «gemini-3.5-transcribe-livestreams», что противоречит официальному имени `gemini-3.5-transcribe-live`.
- Incertezze
- Улучшение времени обработки на 70% относительно Chirp 3 никем независимо не проверено, подробностей сравнения Google не публикует. Цифры FLEURS — собственные измерения Google на не до конца раскрытой выборке языков, поэтому их нельзя напрямую сопоставить с другими моделями. По Rambler Google говорит об «отдельных странах и языках» без списка, а Engadget привязывает функцию к Pixel 11: два указания не совпадают. Так как это предварительная версия, SLA отсутствует. Позиция в рейтинге Artificial Analysis — снимок на 29 августа 2026 года, она может измениться с появлением новых моделей. Данных по итальянскому языку и диалектам нет.
- Perché pubblicarla
- Это свежий релиз с официальной документацией, опубликованными ценами и проверяемыми цифрами, касающийся компонента, который становится входной дверью для голосовых агентов. Главное — он позволяет сделать ровно ту работу, которую этот сайт за собой заявляет: поставить рядом рекламную фразу («самый точный на сегодня») и независимый рейтинг, который цитирует сама Google и где модель оказывается пятой. Читатель получает практическую информацию — стоимость, статус предварительной версии, предел в три говорящих — и мерку для чтения следующих анонсов.