4 августа Сбербанк опубликовал под лицензией MIT коды и веса моделей Kandinsky WM 1.0 — первого открытого семейства российских нейросетей для генерации физически достоверных видеоданных. Модели создают короткие ролики длиной около пяти секунд и предназначены для обучения систем Physical ИИ: роботов, беспилотных автомобилей и промышленной автоматизации. В основе лежит Kandinsky 5.0 Video Lite, дообученная на нескольких миллионах реальных видеосцен с камер роботов, беспилотников и промышленных процессов.

Проблема, которую решают модели, — дефицит открытых данных для физического ИИ. Языковые модели можно обучить на текстах из интернета, а для физического мира таких массивов нет. Сбор записей дорог: автомобиль с датчиками накапливает около 5000 часов видео в год, а современным моделям нужны миллионы часов. Редкие и опасные сценарии — ДТП, экстремальная погода, отказы оборудования — вживую воспроизвести почти невозможно. Поэтому синтетические видео становятся ключевым способом закрыть разрыв. Ян Лекун оценил масштаб так: четырехлетний ребенок через зрение получает больше информации, чем содержат все тексты для крупнейших языковых моделей.

Чтобы повысить физическую достоверность, команда дообучила базовую модель на реальных сценах, а автомобильные сюжеты дополнительно отшлифовала обучением с подкреплением: специальные модели оценивали, насколько хорошо сохраняются форма объектов, геометрия и естественность движения. Kandinsky WM 1.0 генерирует короткие «кирпичики» действий — манипуляции с предметами, перестроение на дороге, этапы производственных процессов. Такие данные полезны разработчикам беспилотного транспорта, производителям манипуляторов, промышленных и сервисных роботов, а также исследователям и стартапам. Модели уже применяют Центр робототехники Сбербанка и институт AIRI в дорожном симуляторе.

Модели генерируют 5-секундные видео действий для обучения роботов и беспилотников.

По словам CTO Kandinsky Дениса Димитрова, знание уравнений физики не позволяет предсказать поведение коробки на мокром конвейере или пешехода перед беспилотником. Модели учатся на видео реального мира, как человек накапливает интуицию, и позволяют виртуально прожить опасные сценарии, которые невозможно воспроизвести вживую. Это шаг к моделям мира — системам, которые понимают физическую реальность, предсказывают развитие сцены и могут действовать в ней самостоятельно.