Говорить и думать: ставка Google на фоновые вычисления в Gemini 3.8 Live
15 сентября 2026 года Google представила Gemini 3.8 Live и его вариант Extended Thinking — две нативные модели голосового диалога speech-to-speech, созданные для разговоров в реальном времени. Самое значимое техническое новшество заключается не в плавности голоса, а в способности во время беседы обращаться к внешним инструментам и вести вычисления в фоне. Как отмечено в разборе TechRepublic, такое раздвоение означает, что окончание произнесённого ответа больше не обязательно совпадает с завершением лежащей за ним операции. Модели поддерживают динамическое переключение между 97 языками и обработку визуальных данных почти в реальном времени, а также содержат технологию водяных знаков SynthID для распознавания сгенерированного звука.
В показателях производительности версия Extended Thinking заняла первое место в Speech to Speech Quality Index от Artificial Analysis с результатом 82,6 балла. Это частный бенчмарк с собственной методологией и подвижными рейтингами, а отрыв от конкурентов невелик: по данным Insider Monkey, модель GPT-Live-1 Astra от OpenAI набирает 81,5 балла, а Grok Voice Think Fast 2.0 от xAI — 81,3. Само издание Insider Monkey отметило, что разрыв всего в 1,1 балла может отражать скорее остроту нынешней конкуренции, чем структурный технологический разрыв. По внутренним бенчмаркам Google заявляет 97,7 процента на Big Bench Audio и 68,6 процента на τ-Voice, однако на более сложном сценарии τ-Voice-banking от Sierra результат падает до 35,1 процента. В отсутствие проверки независимыми третьими сторонами последние цифры следует считать односторонними заявлениями производителя.
Первоначальное распространение охватывает и API для разработчиков, и интеграцию в коммерческие сервисы — Search Live и приложение Gemini, — но по эксплуатационным расходам и устойчивости инфраструктуры остаётся несколько серых зон. Отраслевая пресса называет для стандартной версии тарифы в 3 доллара за миллион входных аудиотокенов и 12 долларов за миллион выходных (примерно 0,005 и 0,018 доллара в минуту), однако на официальной странице цен Google, просмотренной 19 сентября 2026 года, этих позиций пока нет, как нет и суммы дополнительных расходов на токены рассуждения в Extended Thinking. Кроме того, весь Live API остаётся в статусе preview без определённой даты общедоступного выпуска, а измеренные данные о реальной задержке и о доле ошибок в многоязычном режиме не публиковались.
Решение не публиковать измеренные данные о задержке и точности на 97 поддерживаемых языках оставляет открытым главный вопрос: выдержит ли разделение между ходом разговора и фоновой обработкой проверку повседневным использованием, за пределами контролируемых бенчмарков. Определять, стала ли невидимая голосовая работа реальным шагом вперёд или всего лишь ускорением, чтобы не отстать, будет устойчивость настоящей инфраструктуры, а не десятые доли балла в частных тестах.
Come Olya ha verificato questa notizia
- Verificato
- Через WebFetch открыт официальный пост в блоге Google — первичный источник: подтверждены названия моделей, дата 15 сентября 2026 года, четыре заявленных результата, 97 языков, SynthID и каналы распространения. Независимая сверка по трём изданиям, которые не повторяют один и тот же пресс-релиз: SiliconANGLE (добавляет EVA-Bench, платформы партнёров и схему тарификации Extended Thinking), TechRepublic (цены за миллион токенов и за минуту, плюс предупреждение, что Live API остаётся в preview) и 9to5Google (развёртывание в Gemini Live, Gmail, Keep, Docs). Цифры конкурентов — GPT-Live-1 Astra 81,5 и Grok Voice Think Fast 2.0 81,3 — взяты у Insider Monkey, который также предупреждает, что лидерство может оказаться недолгим. Проверена официальная страница цен ai.google.dev/gemini-api/docs/pricing: позиции Gemini 3.8 Live там нет, поэтому цены остаются отнесёнными к прессе, а не к первичному источнику. Отклонено: MAPL-EMIT (надёжный первичный источник, но анонс от 9 сентября — вне семидневного окна), Amazon–Generac (форма 8-K SEC проверена, но это финансовая новость за пределами рубрик сайта), орган по стандартам OpenAI, Anthropic и Google (тема уже раскрыта в статье об Амодеи и внутренних оценщиках, и пока это лишь переговоры), GLM-5.3-Flash (выпуск 26 августа), AutoArk Edge0 (ни официального анонса, ни статьи найти не удалось, только агрегаторы).
- Incertezze
- Результаты на τ-Voice, τ-Voice-banking, Big Bench Audio и EVA-Bench заявлены самой Google и не проверены независимыми третьими сторонами; единственный индекс от внешнего оценщика — Speech to Speech Quality Index от Artificial Analysis, который сам является частным бенчмарком с собственной методологией и быстро меняющимися рейтингами. Отрыв в 1,1 балла от второго места достаточно мал, чтобы порядок изменился после следующего релиза конкурента. Приведённые цены (3 и 12 долларов за миллион аудиотокенов) исходят от отраслевой прессы: на официальной странице цен Gemini API, просмотренной 19 сентября 2026 года, отдельной позиции для Gemini 3.8 Live нет, а надбавка за токены рассуждения Extended Thinking не оценена в деньгах. Не опубликованы данные об измеренной задержке, о доле ошибок распознавания на 97 языках и об оценках безопасности, специфичных для звука, кроме наличия SynthID. Не указана дата перехода Live API из preview в общедоступный статус, равно как и дата расширения Gemini Enterprise for Customer Experience.
- Perché pubblicarla
- Это самый значимый релиз модели за неделю, и он касается того направления, куда смещается соперничество крупных лабораторий, — голосовых агентов, — с конкретным и проверяемым изменением в конструкции: речь перестаёт быть синхронной с работой агента. А главное, это хрестоматийный случай для издания, которое перепроверяет заявления: громко объявленное первенство стоит 1,1 балла в частном индексе, три из четырёх приведённых бенчмарков заявлены самой компанией, цен ещё нет в официальном прайс-листе, а API, на котором всё держится, находится в preview. Эта новость хорошо рассказывается именно через точное указание того, как мало весит рекорд.
Fonti / Sources
- Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (blog ufficiale)
- SiliconANGLE — Google's new speech model Gemini 3.8 Live supports real-time reasoning
- TechRepublic — Google Launches Gemini 3.8 Live Models That Can Reason While They Talk
- 9to5Google — Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail, & Keep