World Labs, компания, основанная Фэй-Фэй Ли, представила Atlas — модель, которая объединяет генерацию, реконструкцию и симуляцию 3D-миров. В отличие от традиционных мультимодальных моделей, которые обрабатывают данные как плоские последовательности, Atlas привязывает каждый входной сигнал к конкретной позиции в трёхмерном пространстве. Это позволяет модели понимать пространственные отношения и генерировать новые виды сцен, что недоступно чистым языковым или видеомоделям.
Проблема, которую решает Atlas, была сформулирована Фэй-Фэй Ли в ноябре 2025 года в эссе: современные модели ломают данные на одномерные или двумерные последовательности, что делает даже простые пространственные задачи сложными. Atlas использует архитектуру, которая организует токенизацию, контекст и память с учётом 3D-пространства. Это позволяет модели выполнять три ключевые функции: генерацию видео с управлением камерой, реконструкцию реальных сцен и симуляцию для робототехники.
| Модель | Доля предпочтений человеческих оценщиков |
|---|---|
| Atlas против MiniMax H3 | 75% |
| Atlas против Gemini 2.5 Pro | 81% |
При генерации видео Atlas принимает одно или несколько изображений и создаёт новые виды с заданными позициями и углами камеры. Управление камерой передаётся как геометрический ввод, а не через текстовые описания, как в видеомоделях. Модель может генерировать до минуты видео в разрешении 1440p, при этом пользователь контролирует каждый кадр, а не полагается на случайность. В демонстрации Atlas постепенно собирает Стэнфордский Главный двор из 2–25 фотографий, сделанных с уровня земли, и создаёт виды с высоты птичьего полёта.
Модель реконструирует реальные сцены из 2–3 фотографий, превосходя специализированные 3D-модели.

Для реконструкции сцен Atlas восстанавливает реальные объекты из нескольких десятков изображений без специального оборудования. С двумя-тремя фотографиями модель даёт точные результаты, превосходя специализированные 3D-модели. В сравнении с системами VGGT и InfiniteVGGT OpenWorldLib Atlas показал геометрическую согласованность и чёткие текстуры, тогда как конкуренты демонстрировали размытость при значительном движении камеры.
Atlas также выводит результаты в виде 3D-данных: point clouds и 3D Gaussian splats, что соответствует формату, используемому в продукте Marble. Это позволяет использовать модель как симулятор: из нескольких видеозаписей она создаёт эффект «пули времени», замораживая сцену и позволяя просматривать её с невозможных ракурсов. Для робототехники Atlas реконструирует комнату и генерирует данные сенсоров для симулированного робота, что позволяет создавать разнообразные обучающие данные без реальных экспериментов. Технология основана на движке real-to-sim-to-real, представленном в августе 2026 года, который создаёт тысячи вариантов задач из одной реальной.
Atlas сочетает подходы языковых моделей и диффузионных моделей: генерирует вывод поэтапно, как языковая модель, но использует диффузию для очистки шума. Это позволяет применять методы ускорения, такие как KV-кэширование, и улучшать качество изображения. По данным World Labs, в тестах с внешними оценщиками Atlas превзошёл специализированные модели: в 75% сравнений с MiniMax H3 и в 81% с Gemini 2.5 Pro. Однако компания признаёт, что ни один бенчмарк не охватывает все возможности Atlas.



