1 сентября 2026 года Google DeepMind представила агентное видеопонимание для своих последних моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Новая функция доступна через Gemini API в Google ИИ Studio и Gemini Enterprise Agent Platform, поддерживает загрузку видео и YouTube-ролики. По данным компании, технология сокращает расход токенов до 88%, затраты на анализ — до 66%, а точность повышает до 7%.
Традиционный подход к видеопониманию — статическая обработка, при которой модель анализирует видео с фиксированной частотой кадров (по умолчанию 1 кадр в секунду, параметр можно менять через API). Такой метод заставляет разработчиков выбирать между высокими затратами на токены и пропуском важных деталей, особенно на длинных видео — от 10-минутных инструкций до 90-минутных лекций и многочасовых записей. Агентное видеопонимание решает эту проблему: модель сама решает, какие фрагменты смотреть, с какой скоростью и через какой канал — визуальные кадры, аудио или транскрипт. Вместо того чтобы перерабатывать весь поток, Gemini использует внутренний инструмент для загрузки нужных частей видео, что снижает нагрузку на разработчиков.
| Модель | Снижение токенов | Снижение затрат | Повышение точности |
|---|---|---|---|
| Gemini 3.7 Flash | до 88% | до 66% | до 7% |
| Gemini 3.6 Flash | до 88% | до 66% | до 7% |
| Gemini 3.5 Flash-Lite | до 88% | до 66% | до 7% |
Технология основана на принципах агентного зрения (agentic vision), которое уже применялось для комбинирования выполнения кода с нативным пониманием изображений. В случае видео Gemini использует свои нативные видеоинструменты, чтобы активно и целенаправленно искать, сканировать и проверять целевые сегменты. Это позволяет выполнять задачи, которые раньше были сложны или дороги: поиск моментов за доли секунды, точное обнаружение аномалий, подсчёт повторяющихся действий и объектов, а также поиск ответов на сложные запросы в многочасовых видео без затрат миллионов токенов.
Технология использует нативные видеоинструменты Gemini для динамического поиска и анализа нужных фрагментов вместо статической обработки с фиксированной частотой кадров.

На стандартных бенчмарках видеопонимания Gemini 3.7 Flash с агентным режимом показал наилучшее сочетание качества и эффективности, находясь на границе Парето по точности и стоимости среди протестированных моделей. Ранние партнёры уже протестировали функцию и отметили улучшения в своих сценариях. Агентное видеопонимание использует стандартные цены на токены Gemini API, без дополнительной платы за функцию. Для включения достаточно установить параметр processing в значение "agentic" в конфигурации API. В ближайшие месяцы функция появится в приложении Gemini для всех пользователей, а также будет использоваться в YouTube в функции «Ask YouTube».



