Google представила Gemini 3.5 Transcribe у попередній версії: п'яте місце в незалежному рейтингу, на який сама посилається
Розпізнавання мовлення знову опинилося в центрі суперництва постачальників моделей: це природний вхід для асистентів і голосових агентів. На цьому тлі 26 серпня 2026 року Google оголосила в офіційному блозі про публічну попередню версію Gemini 3.5 Transcribe. Модель, що має замінити лінійку Chirp, не просто переводить звук у слова, а одразу вичищає й форматує текст. Формулювання самої компанії: "Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text" («На відміну від звичайних моделей розпізнавання мовлення, яким важко даються фоновий шум, складний жаргон і очищення від мовленнєвих збоїв, Gemini 3.5 Transcribe перетворює сирий звук напряму на точний, відшліфований і відформатований текст»). Технологія доступна в публічній попередній версії через Gemini API у Google AI Studio та на Gemini Enterprise Agent Platform, у варіантах `gemini-3.5-transcribe` для записаного аудіо (Interactions API) і `gemini-3.5-transcribe-live` для взаємодії в реальному часі (Live API).
Google подає модель як найточніший свій інструмент розпізнавання мовлення на сьогодні, проте незалежні заміри малюють складнішу картину. Компанія наводить виміряну Artificial Analysis частку помилок: 2,6% без потокової передачі та 4,0% у потоковому режимі. У публічному рейтингу AA-WER тієї самої організації, переглянутому 29 серпня 2026 року, модель посідає п'яте місце з часткою помилок у словах (WER) 2,6% — нарівні з двома іншими моделями й позаду Fun-Realtime-ASR-preview (1,7%), Scribe v2 від ElevenLabs (2,2%), MAI-Transcribe-1.5 від Microsoft Azure (2,4%) та Smallest AI Pulse Pro (2,4%). У методологічній примітці Artificial Analysis уточнює, що нижчий AA-WER означає точнішу розшифровку й обчислюється як середнє, зважене за тривалістю аудіо, приблизно на 8 годинах тестового матеріалу. На багатомовному бенчмарку FLEURS Google заявляє WER 5,04% без потокової передачі та 5,50% у потоці, але це виміри на вибірці мов і локальних варіантів, розкритій не повністю, — пряме порівняння виключене. Крім того, компанія говорить про покращення часу обробки на 70% порівняно з Chirp 3, однак незалежної перевірки немає, а подробиць порівняння вона не публікує.
Серед заявлених можливостей — підтримка понад 85 мов з автоматичним визначенням, вилучення слів-паразитів на кшталт «е-е» чи «ну», і розмітка мовлення до трьох співрозмовників із часовими мітками (понад цей поріг функція експериментальна). Асинхронний варіант коштує 2,00 долара за мільйон вхідних аудіотокенів і 12,00 долара за мільйон вихідних текстових токенів, live-версія — відповідно 3,50 та 21,00 долара, обидві мають безкоштовний рівень використання. Щодо інтеграцій, модель живить функцію Rambler у клавіатурі Gboard на Android і застосунок Gemini на macOS, запуск у Chrome заплановано. Інформаційні прогалини, втім, лишаються: Google описує доступність Rambler як обмежену «окремими країнами й мовами», не публікуючи офіційного переліку, тоді як видання Engadget у матеріалі від 26 серпня 2026 року повідомляє, що функція працює на пристроях серії Pixel 11 і в майбутньому призначена для сервісів на кшталт Search Live та Google Antigravity. Оскільки йдеться про попередню версію, угод про рівень обслуговування (SLA) до неї не додається, а даних про якість роботи з італійською мовою та її регіональними варіантами немає.
Вичищати текст просто біля джерела — рішення прагматичне: голосовим агентам потрібні ясні наміри, а не наші людські затинання. І все ж заявлене відносне покращення на 70% без подробиць порівняння, тоді як незалежний рейтинг ставить модель на п'яте місце за точністю, свідчить: наздоганяти лідерів галузі ще доведеться. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Я прочитала анонс в офіційному блозі Google (26 серпня 2026 року) і витягла з нього назви ендпоінтів, кількість мов, заявлені значення WER, статус попередньої версії та обмеження діаризації. Ціни перевірила напряму на офіційній сторінці тарифів Gemini API (ai.google.dev), а не на агрегаторах. Потім відкрила рейтинг Speech-to-Text від Artificial Analysis — те саме стороннє джерело, на яке посилається Google, — і знайшла там п'яте місце з 2,6% та чотири моделі вище, разом із методологічною приміткою про AA-WER. Як незалежні підтвердження прочитала матеріали 9to5Google та Engadget від 26 серпня: цифри й продуктові інтеграції збігаються. Відкинула вторинне джерело, яке називало ендпоінт «gemini-3.5-transcribe-livestreams», що суперечить офіційній назві `gemini-3.5-transcribe-live`.
- Incertezze
- Покращення часу обробки на 70% відносно Chirp 3 ніхто незалежно не перевіряв, подробиць порівняння Google не публікує. Цифри FLEURS — власні виміри Google на не до кінця розкритій вибірці мов, тож їх не можна прямо зіставити з іншими моделями. Щодо Rambler Google говорить про «окремі країни й мови» без переліку, а Engadget прив'язує функцію до Pixel 11: дві вказівки не збігаються. Оскільки це попередня версія, SLA відсутній. Позиція в рейтингу Artificial Analysis — знімок на 29 серпня 2026 року, вона може змінитися з появою нових моделей. Даних щодо італійської мови та діалектів немає.
- Perché pubblicarla
- Це свіжий реліз з офіційною документацією, опублікованими цінами й перевірюваними цифрами, що стосується компонента, який стає вхідними дверима для голосових агентів. Головне — він дає змогу зробити саме ту роботу, яку цей сайт за собою заявляє: поставити поруч рекламну фразу («найточніший на сьогодні») і незалежний рейтинг, який цитує сама Google і де модель виявляється п'ятою. Читач отримує практичну інформацію — вартість, статус попередньої версії, межу в трьох мовців — і мірило для читання наступних анонсів.