Google представила агентный анализ видео для своих моделей Gemini, который позволяет сократить расход токенов до 88% на бенчмарках 1H-VideoQA и LVBench. Вместо традиционного покадрового сканирования с фиксированной частотой, модель самостоятельно определяет, какие фрагменты видео важны для выполнения задачи, и загружает только их. Это снижает вычислительные затраты и повышает точность анализа.

Новая функция доступна в моделях Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Она способна обнаруживать события короче одной секунды, такие как смена состояния или монтажные склейки, которые легко пропустить при частоте один кадр в секунду. Система также может находить отдельные сцены в многочасовых записях, не тратя миллионы токенов, и точно подсчитывать повторяющиеся движения или отдельные объекты.

МодельБенчмаркСнижение токеновТочность
Gemini 3.7 Flash1H-VideoQA88%Выше, чем у статического анализа
Gemini 3.7 FlashLVBench88%Небольшой рост
Gemini 3.7 FlashLongVideoBenchНе указаноНаивысшее качество

До этого Gemini использовал статическую обработку: видео разбивалось на кадры с частотой один кадр в секунду по умолчанию, а аудиодорожка транскрибировалась. Агентный подход связывает рассуждения модели с нативными видеоинструментами: модель сама решает, какие участки анализировать, с какой скоростью и через какую модальность — кадры, аудио или транскрипт. Это позволяет загружать только те части видеофайла, которые нужны для ответа.

Модель сама выбирает фрагменты, частоту кадров и модальности (видео, аудио, транскрипт), экономя токены.

On 1H-VideoQA and LVBench, token usage drops by 88 percent while accuracy goes up slightly. | Image: Google
On 1H-VideoQA and LVBench, token usage drops by 88 percent while accuracy goes up slightly. | Image: Google · Источник: The Decoder

Технология основана на «агентном зрении» (agentic vision), которое Google выпустила для Gemini 3 Flash в январе. Эта функция позволяла модели писать и запускать Python-код для масштабирования, обрезки и аннотирования изображений, проверяя результат в цикле «думай-действуй-наблюдай». Хотя на старте она работала не во всех случаях, groundwork был заложен. В декабре, анонсируя Gemini 3 Flash, Google упоминала о планах по развитию визуального и пространственного мышления для видео.

Наибольший эффект агентный анализ дает при работе с длинными видео: от 10-минутных туториалов до 90-минутных лекций и многочасовых записей. При статической обработке разработчикам приходилось выбирать между высокими затратами на токены и методами, теряющими важные детали. На бенчмарке LongVideoBench Gemini 3.7 Flash с агентным анализом показывает наилучшее качество и оптимальное сочетание точности и стоимости. В оценке 1H-VideoQA эта модель достигает самой высокой точности при самой низкой стоимости за запрос.

Функция уже доступна для загрузки видео и YouTube-роликов через Gemini API в Google ИИ Studio и на платформе Gemini Enterprise Agent Platform. Разработчики могут установить режим обработки «agentic» в конфигурации API и платить по стандартным тарифам Gemini API без дополнительной платы. Подробности описаны в Developer Guide. Google планирует распространить улучшения и на свои продукты: в ближайшее время функция появится у всех пользователей приложений Gemini на устройствах с Flash и Flash Lite, а в течение нескольких месяцев агентный анализ будет использоваться в функции Ask YouTube на странице воспроизведения, чтобы давать ответы, более точно связанные с содержимым видео.