Рынок генерации видео сейчас меняется очень быстро. Ещё недавно нормой были ролики длиной в несколько секунд: эффектный кадр, короткий проход камеры, простой product shot или «оживлённая картинка». Летом 2026 года планка резко поднялась. ByteDance выпустила Seedance 2.5, Kuaishou усилила Kling 3.0, MiniMax показала H3, Google развивает Veo 3.1. И почти сразу после этого Alibaba представила Wan 3.0.
На первый взгляд можно сказать: «ещё одна видеомодель». Но на самом деле у Wan 3.0 есть две особенности, из-за которых релиз стоит рассматривать отдельно.
Во-первых, модель умеет генерировать до 30 секунд видео за один проход. Во-вторых, она делает ставку не только на text-to-video или image-to-video, а на гораздо более широкий сценарий: text / image / audio / video / document / webpage → video.
Именно поэтому Wan 3.0 интересна не только как генератор красивых роликов, но и как инструмент, который пытается превратить набор разнородных материалов в законченную сцену.
Что такое Wan 3.0
Wan 3.0 — это новое поколение семейства видеомоделей Alibaba, доступное через Alibaba Cloud Model Studio в режиме preview. По официальным материалам, модель умеет:
генерировать до 30 секунд видео за один запуск;
работать с разрешениями 480p, 720p и 1080p;
принимать текст, изображения, аудио, видео, документы и веб-страницы;
редактировать уже созданный ролик без полной перегенерации;
продолжать видео через extension;
автоматически рекомендовать длину ролика под задачу;
держать более стабильную согласованность персонажей, объектов, пространства, стиля и интерфейсов;
генерировать нативный звук, включая речь и синхронизацию с изображением.
Если коротко, Alibaba позиционирует Wan 3.0 не как очередной клиповый генератор, а как модель, которая способна собрать более длинный и более управляемый фрагмент.
Главное отличие №1: до 30 секунд за один проход
Это важнее, чем может показаться.
Когда ролик ограничен 4–8 секундами, модель в основном решает задачу отдельного кадра или короткого фрагмента: красивый старт, небольшой motion, иногда один драматический акцент. С 20–30 секундами картина меняется. Появляется пространство для:
непрерывного one-take;
нормального развития сцены;
работы с несколькими персонажами;
перехода от завязки к развязке;
более сложного движения камеры;
полноценного диалога, а не только короткой реплики.
Wan 3.0 как раз делает ставку на этот переход: не «сделай один эффектный кадр», а «собери законченную сцену».
Хорошо это видно уже на официальных примерах.
Текст в чистом виде: от картинки к маленькой истории
Первый показательный пример — «Пир над морем облаков». Здесь на входе нет никаких картинок, только текстовый промпт, а на выходе — 30-секундная фантазийная сцена с несколькими смысловыми фазами: горы-острова, гигантская морская черепаха, золотая птица, ночной пир.
Это хороший тест на то, может ли модель не просто выдать красивую заставку, а удерживать композицию и повествование в течение длинного отрезка.
Второй сильный пример — «Последние восемь тактов, успеть до занавеса». Один непрерывный проход камеры: героиня в красном платье идёт через закулисье, выходит к занавесу и оказывается перед залом. В таком ролике важно не только качество кадра, но и устойчивость движения, сцепка пространства, работа звука и то, насколько не рассыпается персонаж.
Для меня именно такие one-take-сцены — один из самых убедительных тестов на реальную зрелость видеомодели.
Главное отличие №2: «everything to video»
Пожалуй, самая необычная часть релиза — это идея, которую Alibaba фактически продвигает как everything to video.
Wan 3.0 умеет использовать не только стандартные модальности вроде текста, изображения, видео и аудио, но и документы и веб-страницы. По официальному описанию поддерживаются:
doc
xls
ppt
pdf
txt
key
pages
numbers
md
link / webpage
При этом в одном запросе можно передать один файл или одну ссылку, ограничение — до 100 МБ и до 50 страниц.
Это уже не просто «сделай видео по картинке». Это более широкий сценарий:
презентация продукта → рекламный ролик;
обучающая презентация → видеоурок;
отчёт или бриф → видеосводка;
документ с позиционированием бренда → имиджевый ролик;
страница сайта → анимированная маркетинговая подача.
На демо-странице есть хороший пример именно такого класса задач — «Документ о бренде превратился в тёплый ролик». На вход подаётся DOC-файл с позиционированием кофейни, требованиями к зерну и описанием пространства. На выходе — ролик не про героя, а про место, атмосферу и ощущения.
Если эта возможность действительно хорошо работает не только на идеальных демо, то это один из самых интересных шагов в сторону практического, а не только развлекательного AI-видео.
Что Alibaba особенно подчёркивает
Из официальных материалов видно, что Wan 3.0 продвигают сразу по нескольким направлениям.
1. Стабильность референсов
Для production-сценариев один из главных вопросов давно не в том, «красиво ли модель рисует», а в том, насколько она держит идентичность и структуру сцены.
Wan 3.0 обещает более точное удержание:
персонажей;
лиц;
одежды;
предметов;
пространства;
стиля;
интерфейсов;
голоса.
Это особенно важно в reference-to-video, когда модели задают не просто настроение, а конкретных героев, локации и объекты.
Хороший пример — «Схватка в руинах». Здесь на двух картинках задаются герои, а дальше модель должна выдержать их в 30-секундной боевой сцене: полосатая кошка и снежный барс в синем халате, рукопашная у статуи Будды в пещерном храме, движение, прыжки, падение, погоня.
Именно в таких сценах обычно быстрее всего вылезают проблемы: «плывущие» хвосты, съезжающая одежда, исчезающие детали, потеря взаимного положения персонажей. Поэтому это один из самых важных официальных тестов.
2. Работа с несколькими персонажами и диалогом
Wan 3.0 делает явный упор не только на motion, но и на диалоговые сцены, где одновременно нужно выдерживать облик героев, речь, мимику и синхронизацию.
Например, в аниме-демо «Додзё загружается: граница реального и виртуального» три картинки задают двух персонажей и пространство, после чего модель строит сцену противостояния, диалог на японском и согласованное поведение камеры и звука.
Другой показательный пример — «Восемь языков, один бит». Одна и та же вокалистка последовательно переключается между восемью языками, а модель должна удерживать сцену, ось камеры, группу и попадание губ в речь.
Это уже проверка не только visual consistency, но и того, насколько модель справляется с мультиязычной аудиовизуальной согласованностью.
3. Реалистичные лица и микровыражения
Alibaba отдельно пишет о том, что Wan 3.0 должна лучше справляться с человеческими лицами: больше разнообразия, меньше эффекта «одного и того же глянцевого AI-лица», лучше микровыражения и согласованность эмоций с телесным движением.
Проверять это, конечно, лучше не по одному идеальному фрагменту, а на серии реальных пользовательских задач. Но то, что компания акцентирует внимание именно на этом, показательно: рынок уже ушёл от этапа «лишь бы видео двигалось» и всё больше упирается в натуральность.
4. Стабильность текста, UI и графики
Отдельный интересный кейс — «Everything UI: информация входит в кадр». Там проверяется способность модели удерживать чёрно-белую графику, типографику, чертежи, схемы и фактуру. Для генеративного видео это вообще один из самых сложных классов задач.
Если модель действительно уверенно держит надписи и графические элементы, это открывает ей путь не только в киношные или рекламные сцены, но и в более прикладной дизайн-контент.
Что показывают демо: от кинотрейлеров до UGC
Демо-страница Wan 3.0 интересна тем, что там собраны не однотипные ролики, а несколько разных категорий использования модели.
Кинотрейлеры и вертикальные narrative-ролики

Например, «За снегом и ветром начинается эпос» (это видео не вставляется как медиаэлемент на Хабр, смотрите по ссылке)— вертикальный трейлер с героиней, спутником, толпой у алтаря и огромным ледяным драконом. Это тест не только на consistency, но и на способность модели держать атмосферу, монтажное напряжение и закадровую подачу.
Ещё один сюжет такого типа — «Лотосовый мир: нарисованное становится живым». Здесь одновременно используются девять референсов: героиня, локация и семь существ. По сути это тест на мультиобъектную сцепку и переход от плоского рисованного языка к более объёмному экранному миру.
И есть «Встреча в электричке» — японская дорама, построенная на двух временных пластах и эмоциональной связке между взрослыми героями и их школьными версиями.
Наконец, «Бал в английской усадьбе» — хороший тест на массовую сцену, костюмы, работу с несколькими героями и единство персонажей внутри многолюдного пространства.
Комедия, IP и брендовый контент

Есть и более лёгкие, но не менее показательные кейсы.
«В Лэйиньсы за сутрами — тоже по регламенту» (это видео не вставляется как медиаэлемент на Хабр, смотрите по ссылке) — это 3D-комедийный скетч по мотивам «Путешествия на Запад», где важны реплики, характеры и чувство сцены.

«Пусть герой бренда заговорит сам» (это видео не вставляется как медиаэлемент на Хабр, смотрите по ссылке) — пример бренд-креатива, где персонажи разговаривают в студии подкаста. По сути это демонстрация того, как модель может удерживать героев, брендовый тон и разговорный формат.
UGC и product video

Очень практичный пример — «Портативный блендер как премиум-вещь» (это видео не вставляется как медиаэлемент на Хабр, смотрите по ссылке) . Это уже не «фэнтези ради вау-эффекта», а почти готовый product video / UGC-ролик: товар, героиня, кухня, речь в камеру, процесс использования, читаемый логотип на корпусе.
Если смотреть на рынок шире, именно такие кейсы и будут, скорее всего, одним из самых массовых коммерческих применений подобных моделей.
Что по цене
У Wan 3.0 сравнительно простая и понятная тарифная модель.
Для международного контура Alibaba Cloud Model Studio заявлены цены:
$0,05 за секунду для 480p;
$0,10 за секунду для 720p;
$0,20 за секунду для 1080p.
То есть 30-секундный ролик в полном формате стоит примерно:
$1,5 для 480p;
$3 для 720p;
$6 для 1080p.
Есть и интересная деталь: для Wan 3.0 тарифицируется не только выход, но и суммарная длительность входного и выходного видео, если в запросе используется input video. Для failed requests оплата не списывается.
С точки зрения восприятия рынка это сильная позиция: pricing у Wan выглядит достаточно понятным и «читаемым» для разработчиков и команд, которые хотят быстро прикинуть себестоимость.
Насколько это конкурентно на фоне рынка
Если смотреть именно на класс моделей, которые претендуют не просто на short clip, а на более управляемое длинное AI-видео, то Wan 3.0 выходит не в пустоту.
Seedance 2.5
Это, пожалуй, главный прямой конкурент.
Seedance 2.5 тоже работает в логике «длинная сцена за один проход»: до 30 секунд, нативный звук, большое число референсов, редактирование, управление сценой. По этой причине релиз Wan 3.0 выглядит не как случайный шаг, а как очень явная реакция на новый уровень конкуренции.
Seedance 2.0
Её тоже нельзя выкидывать из сравнения только потому, что уже вышла версия 2.5. Seedance 2.0 по-прежнему сильна: 15 секунд, мульти-референсы, совместная генерация видео и звука, редактирование и продление, вплоть до 4K в части сценариев.
Kling 3.0 / Omni
Kling остаётся очень серьёзным игроком, особенно за счёт мультимодального workflow, нативного звука и сильной работы в креативных сценариях. У Kuaishou очень заметная ставка на production-grade видеогенерацию, и игнорировать Kling в такой статье было бы странно.
MiniMax H3, Veo 3.1, Grok Imagine Video 1.5
MiniMax H3 интересна сочетанием мультимодальности, до 15 секунд и native stereo audio. Veo 3.1 сильна качеством и 4K, но пока обычно работает на более коротком хронометраже. Grok Imagine Video 1.5 тоже уже входит в реальный набор актуальных игроков, особенно если смотреть на audio+video generation и reference-based сценарии.
Где на этом фоне выглядит сильнее именно Wan 3.0
Если коротко, то у Wan 3.0 есть три особенно заметных аргумента.
Первый — 30 секунд за один проход.
Второй — очень широкая трактовка input-модальностей, включая документы и веб-страницы.
Третий — понятный pricing.
Именно сочетание этих трёх факторов и делает Wan 3.0 заметным релизом.
Таблица. Wan 3.0 и основные конкуренты: возможности и позиционирование
Модель | Максимальная длина за один проход | Звук | Главные особенности |
|---|---|---|---|
Wan 3.0 | 30 сек | Да | text/image/audio/video/document/webpage → video, editing, extension, акцент на consistency |
Seedance 2.5 | 30 сек | Да | много референсов, длинные сцены, editing, production-style workflow |
Seedance 2.0 | 15 сек | Да | сильные мультимодальные референсы, editing, extension, в части сценариев до 4K |
Kling 3.0 / Omni | 15 сек | Да | multimodal workflow, нативный звук, сильный creative / commercial use |
MiniMax H3 | 15 сек | Да | multimodal input, stereo audio, прикладной production use |
Veo 3.1 | короче, чем у Wan/Seedance | Да | очень сильное качество и 4K, но обычно более короткие ролики |
Grok Imagine Video 1.5 | до 15 сек | Да | image/reference-based video generation, audio+video |
Что здесь действительно важно, а что стоит проверять осторожно
Как и почти во всех релизах AI-видео, демо у разработчика отобраны и подготовлены. Поэтому важно разделять два уровня оценки.
То, что уже можно считать важным фактом релиза
30 секунд за один запуск — это серьёзный шаг.
Работа с документами и web pages как с входом — действительно необычная и потенциально полезная возможность.
Ставка на production consistency — правильное направление.
Нативный звук и диалоговые сценарии становятся нормой, а не экзотикой.
То, что ещё надо проверять в реальных условиях
Насколько хорошо модель держит длинную consistency вне идеально подобранных демо.
Как часто «плывут» персонажи, предметы, UI и текст в пользовательских задачах.
Насколько пригодны document-to-video и webpage-to-video не для вау-эффекта, а для реальной рабочей автоматизации.
Насколько редактирование без полной перегенерации оказывается полезным на практике, а не только в маркетинговом описании.
Именно здесь и проходит граница между красивым релизом и действительно сильным рабочим инструментом.
Почему Wan 3.0 — это не просто «ещё одна новая модель»
На мой взгляд, главный смысл релиза даже не в конкретной цифре «30 секунд».
Сейчас рынок AI-видео постепенно уходит от старой формулы:
«вот картинка — оживи её»
и приходит к новой:
«вот набор материалов, персонажи, документы, брендовые вводные, сцена, звук и задача — собери из этого законченное видео».
Wan 3.0 — один из самых явных представителей именно этого перехода.
Да, впереди ещё много вопросов к устойчивости, качеству и реальной воспроизводимости. Но сама траектория уже понятна. Генеративное видео всё меньше похоже на игрушку для коротких вау-клипов и всё больше — на слой, который пытается взять на себя часть режиссуры, монтажа и production assembly.
И в этом смысле Wan 3.0 — действительно важный релиз.
Краткое резюме
Если совсем коротко, то Wan 3.0 стоит запомнить по четырём вещам:
до 30 секунд за один проход;
нативный звук;
multimodal + document/webpage input;
ставка на consistency и production workflow.
А лучший вопрос к этой модели сейчас звучит не «умеет ли она делать красивые демо», а насколько хорошо она выдержит реальные задачи на длинной дистанции.
Если выдержит — это уже будет не просто очередной генератор роликов, а действительно сильный рабочий инструмент для новой волны AI-видео.
Эдуард Ланчев — разработчик AI-first решений, автор «Ланчев PRO ИИ».
Работаю с AI-агентами, автоматизацией и практическим применением генеративного ИИ.
Telegram: «Ланчев PRO ИИ»

