Избирательное зрение Gemini: обещание более дешёвого понимания видео
До сих пор поручить языковой модели проанализировать видео означало заставить её переварить жёсткую последовательность кадров, обычно по одному в секунду. Метод столь же прямолинейный, сколь и расточительный: расход ресурсов растёт вместе с длительностью ролика, а не с реальной значимостью содержания. С появлением агентного понимания видео, о котором Google объявила 1 сентября 2026 года, подход меняется: модель больше не претерпевает поток изображений пассивно, а берёт на себя активную роль и сама решает, какие фрагменты загружать, с какой скоростью и через какую модальность — кадры, звук или расшифровки, — пользуясь предусмотренными для этого нативными инструментами.
Обещанные Google количественные выгоды впечатляют: снижение стоимости анализа до 66 %, сокращение расхода токенов до 88 % и прирост точности до 7 %. Однако разбор технических данных выявляет нюансы, остужающие первоначальный восторг. Официальное объявление называет совместимыми Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite, тогда как документация для разработчиков на ai.google.dev добавляет в список ещё и Gemini 3.8 Flash — по всей видимости, потому что эта модель вышла на следующий день после анонса. Кроме того, как отмечает и разбор MarkTechPost от 4 сентября 2026 года, вся инфраструктура доступна исключительно через API, размещённый в Google AI Studio или на Gemini Enterprise Agent Platform. Открытых весов нет, как нет и возможности запустить систему у себя: именно поэтому никто за пределами Google не может перепроверить эти проценты. Режим включается из конфигурации ('processing': 'agentic') по стандартной цене API, без наценки; Google заявляет, что он появится «скоро» в приложении Gemini и «в ближайшие месяцы» в Ask YouTube — сроки остаются расплывчатыми.
При более внимательном взгляде у метрик эффективности есть теневые зоны. Google не опубликовала ни конкретных данных, ни сравнительных таблиц по стандартным бенчмаркам, на которых рассчитывалась эта максимальная экономия. Более того, сама официальная документация призывает к осмотрительности: для чувствительных к задержке запросов по роликам короче пяти минут и в случаях, когда нужна покадровая точность на всём ролике, она прямо советует оставаться на стандартной статической выборке. Не универсален и прирост точности в 7 %: техническая документация ограничивает его длинным контентом.
Мысль о том, что модель может сама решать, на что смотреть, чтобы сэкономить на вычислениях, — прекрасное упражнение в оптимизации ресурсов. Жаль лишь, что для проверки, не оборачивается ли эта экономия потерей деталей или ожиданием, которое Google так и не измерила, нам приходится верить процентам без публичных бенчмарков. В конце концов, эффективность — отличная метрика, при условии, что испытателем за собственный счёт не приходится работать пользователю. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Открыто официальное объявление на blog.google (1 сентября 2026 года) и сопоставлено с документацией для разработчиков на ai.google.dev: совпадают дата, цифры (до 66 % экономии затрат, 88 % экономии токенов, +7 % точности), список моделей, параметр 'processing': 'agentic' и доступность через Gemini API, AI Studio и Gemini Enterprise Agent Platform. Документация добавляет ограничения по длительности (3 часа в низком разрешении, 1 час в высоком, 8 часов YouTube в сутки на бесплатном тарифе) и относит +7 % только к длинному контенту. Независимое подтверждение на MarkTechPost (4 сентября 2026 года), где отмечено и отсутствие открытых весов. Четвёртый источник (MLQ) ответил 403 и не использовался.
- Incertezze
- Google не называет бенчмарки, на которых измеряет результаты, и не публикует сравнительные таблицы: три процента — самозаявленные величины, поданные как максимумы («до») и не воспроизводимые третьими лицами. Влияние на задержку и число вызовов не измерено: документация не рекомендует агентный режим для роликов короче пяти минут именно из-за задержки, но не говорит, во что он обходится по времени. Сохраняется расхождение между анонсом (3.7 Flash, 3.6 Flash, 3.5 Flash-Lite) и документацией (добавляющей 3.8 Flash, вышедшую на следующий день). Открытых весов нет, а значит, нет и проверки вне API Google; сроки для приложения Gemini и Ask YouTube остаются общими — «скоро» и «в ближайшие месяцы».
- Perché pubblicarla
- Это не анонс продукта, а изменение единицы стоимости видеоанализа: она перестаёт зависеть от длительности записи и начинает зависеть от того, сколько её нужно просмотреть. Если цифры выдержат проверку, час записи станет доступен для анализа за долю прежней цены, и это касается всех, кто работает с видеоархивами. Публиковать стоит именно потому, что числа заявлены поставщиком на бенчмарках, которые он не называет: можно сообщить факт и показать читателю, где именно заканчивается проверка, включая ту строку документации, что сводит выигрыш к длинным видео и отговаривает от режима на роликах короче пяти минут.