До сих пор видео и медиафайлы оставались плохо доступны для поиска по смыслу. Чтобы найти конкретный момент в многочасовой записи, командам в медиа, спортивной аналитике, образовании, безопасности и ритейле приходилось строить сложный конвейер: сервис транскрибации, пайплайн извлечения кадров, модель эмбеддингов, векторная база и логика синхронизации между ними. Каждый компонент нужно было поддерживать отдельно, а результат всё равно плохо связывал визуальный ряд, речь и звук.

Marengo Embed 3.0 решает это на уровне модели: она совместно кодирует видео, аудио, изображения и текст в компактное 512-мерное векторное пространство. Небольшая размерность важна для хранения — векторов получается много, и экономия на каждом из них складывается в заметную разницу по стоимости индекса. Поскольку модель мультимодальная, один и тот же запрос на естественном языке может находить и визуальные сцены, и произнесённые фразы, и звуковые события.

ПараметрЗначение
Модель эмбеддинговTwelveLabs Marengo Embed 3.0
Размерность вектора512
Поддерживаемые типы файловВидео MP4, MOV; изображения JPEG, PNG; аудиодорожки
Источники данныхAmazon S3, SharePoint, Confluence и другие
Сегментация по умолчанию4 секунды для аудио и видео
Метаданные результатаВремя начала и конца чанка, URI источника, тип эмбеддинга

В Amazon Bedrock Knowledge Bases эта модель теперь доступна как опция эмбеддингов. Managed Knowledge Bases — полностью управляемый сервис Retrieval Augmented Generation: он берёт на себя хранение, загрузку, эмбеддинги, реранжирование и извлечение. При синхронизации источника Managed MKB автоматически извлекает кадры, транскрибирует аудио, генерирует эмбеддинги Marengo Embed 3.0 для каждого сегмента и записывает векторы в индекс. Предварительная обработка файлов не требуется. Поддерживаются видео MP4 и MOV, изображения JPEG и PNG, а также аудиодорожки; среди нативных коннекторов — Amazon S3, SharePoint и Confluence.

Managed Knowledge Bases в Amazon Bedrock сам делает сегментацию, сэмплирование кадров, транскрибацию и запись векторов в индекс.

Amazon S3 bucket containing the uploaded soccer video file
Amazon S3 bucket containing the uploaded soccer video file · Источник: AWS Machine Learning Blog

Сценарий из документации AWS показывает, как это работает на практике. В консоли Amazon Bedrock создаётся управляемая база знаний, в настройках эмбеддингов вместо выбранного по умолчанию Amazon Titan Text указывается TwelveLabs/Marengo Embed 3.0, источником данных выбирается S3-бакет с видео. В расширенных настройках можно задать длительность сегментации аудио и видео — по умолчанию 4 секунды для обеих модальностей. После создания базы запускается синхронизация, и сервис сам проходит весь путь от кадров до векторов.

Проверить результат можно прямо в консоли через функцию Test. Запрос вида «покажи пенальти из этого футбольного матча» возвращает ранжированные фрагменты с метаданными: время начала и конца чанка, URI источника и тип эмбеддинга. По этим метаданным нужный отрезок видео легко извлечь и показать. Для команд это означает, что семантический поиск по медиа перестаёт быть отдельным инженерным проектом и становится настройкой управляемого сервиса.

Контекст здесь важен: рынок мультимодальных эмбеддингов растёт вместе с объёмом видео, который компании накапливают в облаках. Раньше подобные задачи закрывали либо специализированные видеоплатформы, либо собственные пайплайны на открытых моделях. Появление Marengo 3.0 в каталоге Bedrock снижает порог входа: не нужно выбирать и обслуживать векторную базу, писать синхронизацию и следить за совместимостью компонентов. Ограничения тоже стоит держать в уме — модель работает в поддерживаемых регионах AWS, а качество поиска зависит от того, насколько удачно выбрана длительность сегментации для конкретного типа контента.