Рынок генерации видео меняется стремительно. Ещё недавно нормой были ролики длиной в несколько секунд: эффектный кадр, короткий проход камеры, простой product shot. Летом 2026 года планка резко поднялась: ByteDance выпустила Seedance 2.5, Kuaishou усилила Kling 3.0, MiniMax показала H3, Google развивает Veo 3.1. Почти сразу после этого Alibaba представила Wan 3.0.

На первый взгляд, это очередная видеомодель. Но у Wan 3.0 есть две особенности, которые выделяют её на фоне конкурентов. Во-первых, модель генерирует до 30 секунд видео за один проход. Во-вторых, она поддерживает не только text-to-video или image-to-video, а более широкий сценарий: text / image / audio / video / document / webpage → video. Это позволяет превращать разнородные материалы в законченную сцену.

МодельМаксимальная длина за один проходЗвукГлавные особенности
Wan 3.030 секДаtext/image/audio/video/document/webpage → video, editing, extension, акцент на consistency
Seedance 2.530 секДамного референсов, длинные сцены, editing, production-style workflow
Seedance 2.015 секДасильные мультимодальные референсы, editing, extension, в части сценариев до 4K
Kling 3.0 / Omni15 секДаmultimodal workflow, нативный звук, сильный creative / commercial use
MiniMax H315 секДаmultimodal input, stereo audio, прикладной production use
Veo 3.1короче, чем у Wan/SeedanceДаочень сильное качество и 4K, но обычно более короткие ролики
Grok Imagine Video 1.5до 15 секДаimage/reference-based video generation, audio+video

Wan 3.0 доступна через Alibaba Cloud Model Studio в режиме preview. По официальным материалам, модель поддерживает разрешения 480p, 720p и 1080p, умеет редактировать уже созданные ролики без полной перегенерации, продолжать видео через extension, автоматически рекомендовать длину ролика под задачу, а также генерировать нативный звук, включая речь и синхронизацию с изображением. Alibaba подчёркивает стабильность референсов: персонажей, лиц, одежды, предметов, пространства, стиля и интерфейсов.

Модель поддерживает входные форматы: текст, изображения, аудио, видео, документы (doc, xls, ppt, pdf, txt) и веб-страницы.

Возможность генерировать 30 секунд видео за один проход — ключевое отличие. Когда ролик ограничен 4–8 секундами, модель решает задачу отдельного кадра: красивый старт, небольшое движение, один драматический акцент. С 20–30 секундами появляется пространство для непрерывного one-take, нормального развития сцены, работы с несколькими персонажами, перехода от завязки к развязке, более сложного движения камеры и полноценного диалога. Wan 3.0 делает ставку на этот переход: не «сделай один эффектный кадр», а «собери законченную сцену».

Официальные примеры демонстрируют это. В ролике «Пир над морем облаков» на входе только текстовый промпт, а на выходе — 30-секундная фантазийная сцена с несколькими смысловыми фазами: горы-острова, гигантская морская черепаха, золотая птица, ночной пир. Другой пример — «Последние восемь тактов, успеть до занавеса»: один непрерывный проход камеры, героиня в красном платье идёт через закулисье, выходит к занавесу и оказывается перед залом. Такие one-take-сцены — убедительный тест на зрелость видеомодели.

Вторая особенность — поддержка «everything to video». Wan 3.0 принимает не только стандартные модальности, но и документы (doc, xls, ppt, pdf, txt, key, pages, numbers) и веб-страницы. В одном запросе можно передать один файл или одну ссылку, ограничение — до 100 МБ и до 50 страниц. Это открывает сценарии: презентация продукта → рекламный ролик, обучающая презентация → видеоурок, отчёт или бриф → видеосводка, документ с позиционированием бренда → имиджевый ролик, страница сайта → анимированная маркетинговая подача. На демо-странице есть пример «Документ о бренде превратился в тёплый ролик»: на вход подаётся DOC-файл с позиционированием кофейни, на выходе — ролик про место, атмосферу и ощущения.

Alibaba продвигает Wan 3.0 по нескольким направлениям. Стабильность референсов — один из главных вопросов для production-сценариев: модель обещает более точное удержание персонажей, лиц, одежды, предметов, пространства, стиля и интерфейсов. Также модель умеет автоматически рекомендовать длину ролика под задачу, что упрощает работу. Если эти возможности работают не только на идеальных демо, Wan 3.0 может стать одним из самых практичных инструментов для ИИ-видео.