1 сентября 2026 года Google DeepMind представила агентное видеопонимание для своих последних моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Новая функция доступна через Gemini API в Google ИИ Studio и Gemini Enterprise Agent Platform, поддерживает загрузку видео и YouTube-ролики. По данным компании, технология сокращает расход токенов до 88%, затраты на анализ — до 66%, а точность повышает до 7%.

Традиционный подход к видеопониманию — статическая обработка, при которой модель анализирует видео с фиксированной частотой кадров (по умолчанию 1 кадр в секунду, параметр можно менять через API). Такой метод заставляет разработчиков выбирать между высокими затратами на токены и пропуском важных деталей, особенно на длинных видео — от 10-минутных инструкций до 90-минутных лекций и многочасовых записей. Агентное видеопонимание решает эту проблему: модель сама решает, какие фрагменты смотреть, с какой скоростью и через какой канал — визуальные кадры, аудио или транскрипт. Вместо того чтобы перерабатывать весь поток, Gemini использует внутренний инструмент для загрузки нужных частей видео, что снижает нагрузку на разработчиков.

МодельСнижение токеновСнижение затратПовышение точности
Gemini 3.7 Flashдо 88%до 66%до 7%
Gemini 3.6 Flashдо 88%до 66%до 7%
Gemini 3.5 Flash-Liteдо 88%до 66%до 7%

Технология основана на принципах агентного зрения (agentic vision), которое уже применялось для комбинирования выполнения кода с нативным пониманием изображений. В случае видео Gemini использует свои нативные видеоинструменты, чтобы активно и целенаправленно искать, сканировать и проверять целевые сегменты. Это позволяет выполнять задачи, которые раньше были сложны или дороги: поиск моментов за доли секунды, точное обнаружение аномалий, подсчёт повторяющихся действий и объектов, а также поиск ответов на сложные запросы в многочасовых видео без затрат миллионов токенов.

Технология использует нативные видеоинструменты Gemini для динамического поиска и анализа нужных фрагментов вместо статической обработки с фиксированной частотой кадров.

Text "Agentic video understanding" next to the Gemini logo, all on a dark blue background
Text "Agentic video understanding" next to the Gemini logo, all on a dark blue background · Источник: Google DeepMind Blog

На стандартных бенчмарках видеопонимания Gemini 3.7 Flash с агентным режимом показал наилучшее сочетание качества и эффективности, находясь на границе Парето по точности и стоимости среди протестированных моделей. Ранние партнёры уже протестировали функцию и отметили улучшения в своих сценариях. Агентное видеопонимание использует стандартные цены на токены Gemini API, без дополнительной платы за функцию. Для включения достаточно установить параметр processing в значение "agentic" в конфигурации API. В ближайшие месяцы функция появится в приложении Gemini для всех пользователей, а также будет использоваться в YouTube в функции «Ask YouTube».