9 декабря 2024 года OpenAI открыла публичный доступ к Sora, что ознаменовало переход к архитектуре Diffusion Transformer и задало новый стандарт для видеогенерации. К 2026 году нейросети выдают кинематографичные ролики в 4K, удерживают консистентность персонажей и позволяют управлять каждым этапом генерации.

Начало 2024 года напоминало гонку вооружений: стандартные диффузионные модели Luma, Runway Gen-2 и Pika 1.0 предлагали ролики длиной не более четырех секунд, с отсутствием консистентности персонажей, слабой физикой предметов и неестественным движением объектов. Пользователи отмечали низкую синхронизацию губ, непонимание трехмерной однородности и массы объектов. Тем не менее, такие генерации вызывали вау-эффект, хотя больше напоминали покадровое оживление фотографий, чем настоящую генерацию видео.

ПериодМоделиДлительностьКлючевые возможности
Начало 2024Luma, Runway Gen-2, Pika 1.0до 4 секундText-to-Video, Image-to-Video, Motion Brush, Director Mode
Конец 2024Sora (OpenAI)до 20 секундDiT-архитектура, улучшенная консистентность, динамичная камера
2025Kling 2.1/2.5, Kling Motion Control 2.6до 20 секундРеференсы, Lip-Sync, генерация звука, управление камерой

ом 2024 года стал выход Sora от OpenAI, которая перешла на архитектуру Diffusion Transformer (DiT). Модель научилась делить кадры на маленькие пространственно-временные патчи, что позволило обрабатывать видео как цельные трехмерные куски пространства, изменяющиеся во времени. В рекламных презентациях заявлялась возможность создавать видео длиной до 1 минуты при 30 FPS, хотя в публичном доступе дали только до 20 секунд. Улучшилась консистентность объектов, камера стала динамичнее, появилось первое понимание базовой физики. Однако Sora путала лево и право и испытывала трудности с причинно-следственными связями.

Sora от OpenAI, вышедшая 9 декабря 2024 года, первой применила архитектуру Diffusion Transformer, обрабатывая видео как пространственно-временные патчи.

В 2025 году, после публикации китайскими разработчиками DiT-моделей с открытым кодом, все компании переписали свои наработки на новую архитектуру. Новый стандарт DiT-видеомоделей привел к борьбе за внимание аудитории. Корпорации сменили философию: вместо простой генерации они стали продавать пользователям полный контроль над каждым этапом. Главным нововведением стала возможность гибко управлять результатом: загружать визуальный референс, задавать единый стиль, тематику, локации, менять ракурс и движение камеры. Маркетологи, дизайнеры и контент-мейкеры сразу подхватили эти инструменты.

Технически модели увеличили длительность генерации до 15 секунд в 720p и 1080p, а Kling 2.1 / 2.5 позволили генерировать до 20 секунд непрерывного видео. Улучшился Lip-Sync, модели стали точнее учитывать законы физики, появилась генерация звука, синхронизированного с видеорядом. Kling Motion Control 2.6 позволила загрузить статичное фото человека и видео-референс, чтобы персонаж в точности повторил сложные движения, походку или танец.

Ажиотажный рост спроса на видеокарты в 2025 году был связан с увеличением экономических и технологических затрат на обучение более умных моделей. Компании столкнулись с необходимостью наращивать вычислительные мощности, что отразилось на рынке оборудования.

К 2026 году ожидается дальнейшее развитие в сторону улучшения физики, консистентности и интерактивности. Возможно, появятся модели, способные генерировать видео в реальном времени, что откроет новые возможности для игр и виртуальной реальности. Однако остаются вопросы регулирования: законодательство в области ИИ активно развивается, и это может повлиять на темпы внедрения технологий.