Компании AWS и NVIDIA представили архитектуру Physical ИИ model factory на основе открытой модели Cosmos 3, развертываемой на кластере Amazon SageMaker HyperPod. Подход решает проблему непрерывного цикла разработки систем физического ИИ — от генерации синтетических данных до пост-обучения моделей восприятия и политик действий, а также их оценки в замкнутом цикле симуляции. Вместо отдельных GPU-кластеров для каждого этапа предлагается единый конвейер, работающий на одном пуле ресурсов.

Cosmos 3 — это открытая всеобъемлющая модель мира, которая обрабатывает видео, изображения, действия и звук как единый поток токенов. В отличие от распространенного подхода, где генеративный видео-транформер сочетается с отдельной vision-language моделью для текстового управления, Cosmos 3 использует единый ствол транформера, интегрированный на каждом уровне. Это позволяет одной модели выполнять три функции: генерировать синтетические видео (forward-dynamics world model), размечать действия (inverse-dynamics action labeler) и действовать как политика управления (deployable action policy). Такая унификация упрощает инфраструктуру: вместо трех отдельных пулов GPU для генерации, обучения и оценки достаточно одного общего пула, управляемого единым контроллером.

ЭтапФункцияРежим работы
Генерация синтетических данныхСоздание видео для обученияforward-dynamics world model
Пост-обучениеАдаптация моделей восприятия и политикinverse-dynamics action labeler
ОценкаПроверка в симуляцииdeployable action policy

Ключевая архитектурная особенность Cosmos 3 — Mixture-of-Transformers (MoT) с совместным вниманием на каждом слое. Модель разделяет обработку на два эксперта: reasoner, предсказывающий следующий токен, и generator, выполняющий деноизинг видео, аудио и действий. Двухпоточное внимание связывает их на каждом уровне, обеспечивая более точную генерацию по сравнению с подходом, где diffusion transformer лишь разово обращается к выходу VLM. Кроме того, модель асимметрична при инференсе: во время обучения выполняется полный цикл деноизинга и декодирования видео, тогда как на роботе модель выполняет лишь несколько шагов деноизинга и пропускает декодирование видео, используя только токены действий.

Архитектура Mixture-of-Transformers с совместным вниманием на каждом слое обеспечивает генерацию, пост-обучение и оценку на одном и том же транформере.

Cosmos 3 shared token stream feeding the Reasoner and Generator towers, with the attention mask for the two experts
Cosmos 3 shared token stream feeding the Reasoner and Generator towers, with the attention mask for the two experts · Источник: AWS Machine Learning Blog

Развертывание такой фабрики требует значительных вычислительных мощностей, и AWS предлагает использовать SageMaker HyperPod с Amazon EKS для оркестрации. В блоге описывается настройка кластера и общей многотерабайтной системы хранения, а также распределенное пост-обучение для трех типов задач, включая полный пример обучения политики робота на открытом датасете DROID. Все манифесты и конфигурации доступны в репозитории awsome-distributed-ИИ на GitHub.

Важный аспект — управление затратами. Поскольку GPU-ресурсы резервируются заранее, ключевым показателем становится не пиковая пропускная способность отдельной задачи, а GPU goodput — полезный прогресс конвейера на зарезервированный GPU-час. Такой подход позволяет избежать нестабильности при поэтапном приобретении GPU и снижает общие расходы на инфраструктуру.