Два года назад несколько секунд мыльной генерации считались прорывом. Сегодня нейросети выдают кинематографичные ролики в 4K качестве, держат консистентность персонажей и работают с референсами — и это активно применяется в работе.

В статье разобрал, какие технологические скачки произошли с 2024 по 2026 год, как они повлияли на рынок и какие направления будут определять развитие рынка дальше.

Начало 2024 — низкая консистентность, плавающая физика объектов

Этот год стал определяющим и напоминал больше начало гонки вооружений на рынке AI. Не рассматриваем 2022 и 2023, так как в те года только-только проходили закрытые тестирования у крупных корпораций, таких как Google и Meta.

Зарождение нейросетей началось именно в 2024 году с выходом стандартных диффузионных моделей (Luma, Runway Gen-2, Pika 1.0). Принято считать, что до публичного выхода Sora от OpenAI в конце года эти трое забирали на себя всё основное внимание пользователей. В частности, именно модель Runway Gen-2 стала новаторским решением с возможностью генерировать в Text-to-Video и Image-to-video с инструментами Motion Brush и Director Mode.

Какие же технические возможности были тогда? Пользователи получали:

  • Ролики длиной не более четырёх секунд,

  • Отсутствие консистентности персонажей,

  • Слабую физику предметов и совсем неестественное движение объектов в кадре.

Также на форумах пользователи отмечали у моделей низкую синхронизацию губ, непонимание трёхмерной однородности и массы объектов.

Тем не менее, такие генерации вызывали вау-эффект, и каждому было интересно попробовать сгенерировать что-то своё. В своей основе это всё напоминало больше покадровое оживление фотографий, нежели настоящую генерацию видеороликов.

На мой взгляд, прорывом 2024 года официально можно считать выход модели Sora от OpenAI. Публичный доступ пользователи получили только под конец года — 9 декабря 2024 года.

Эффект инновации случился, когда компания перешла на архитектуру Diffusion Transformer (DiT): модель научилась делить кадры на маленькие пространственно-временные патчи. Это позволило обрабатывать видео как цельные трёхмерные куски пространства, которые могут длиться и изменяться во времени.

Помимо этого, в рекламных презентациях показали возможность создавать видео длиной до 1 минуты при 30 FPS! Хотя по итогу в публичном доступе дали только до 20 секунд, что тоже немало.

Прокачали консистентность объектов в кадре, камера стала более динамичной, улучшилась причинно-следственная связь (об этом ещё вспомним) и появилось первое понимание базовой физики.

Несмотря на очевидные плюсы и успех Sora, модель также сталкивалась с некоторыми недочётами. Компания на официальном сайте заявляла, что модель может путать лево и право, а также имеет небольшие трудности с пониманием причинно-следственных связей.

2025 год — видео до 15 секунд, motion control, использование референсов

Когда в 2024 году во всеобщий доступ китайские разработчики опубликовали DiT-модели с открытым кодом, то сразу же все компании ринулись переписывать свои старые наработки на новую архитектуру. Так появился новый стандарт DiT-видеомоделей.

В 2025 вспыхнула борьба за внимание аудитории и попытки компаний отличиться от своих же оппонентов. Сам по себе год оказался довольно динамичным с точки зрения выхода новых AI и предложения новых решений. Так корпорации поменяли философию и начали продавать пользователям возможность полного контроля над каждым этапом генерации.

Главным нововведением года стала возможность гибко управлять и настраивать результат. Теперь можно было добавить визуальный референс, задать единый стиль, тематику, локации и получить нужную композицию без обучения модели и тонкой настройки параметров. Загрузить изображение как референс, поменять ракурс, указать движение с расположением камеры — и на выходе уже можно получить готовую короткометражку либо хороший рекламный видеоролик. Маркетологи, дизайнеры, контент-мейкеры это сразу подхватили, начали осваивать и применять в работе.

Технически также стало всё куда интереснее:

  • Модели увеличили длительность генерации до 15 секунд в 720p и 1080p. Некоторые модели, такие как Kling 2.1 / 2.5, дали возможность генерировать до 20 секунд непрерывного видео абсолютно любому пользователю!

  • Улучшили Lip-Sync.

  • Модели стали точнее учитывать законы физики на основе изучения огромных массивов данных.

  • Появилась возможность генерации звука, которая сама синхронизируется с видеорядом.

  • Пользователи начали активно обсуждать консистентность и сравнивать, какие нейросети справляются лучше с этой задачей; говорить про управляемость камеры в сложных сценах.

Далее выходит модель Kling Motion Control 2.6, позволяющая загрузить статичное фото человека и видео-референс, чтобы персонаж на фотографии в точности повторил любые сложные движения, походку или танец.

Возможно, многие вспомнят ажиотаж с резким ростом спроса на видеокарты, который случился в 2025 году. Так как модели становились все умнее, нужно было увеличить экономические и технологические затраты на их обучение. Компании стали придумывать, как снизить себестоимость генераций, чтобы не потерять свою аудиторию.

По итогу разработчики смогли оптимизировать и «сжать» прожорливые модели в компактные Turbo-версии. Эти модели копировали поведение своей основной версии, выполняя те же задачи в два раза быстрее и дешевле, но с небольшой потерей в качестве. Такой подход позволил снизить себестоимость генерации и сделать саму технологию доступнее для пользователей.

2026 год — мультимодальность, гибкое редактирование и создание кино

Сейчас практически каждая модель способна сделать мультфильм, по уровню графики сравнимый с Disney, сгенерировать короткометражный фильм или собрать промо-ролик, имея для этого всего одно изображение, хорошо продуманный промпт и оплаченную подписку на нужную LLM. Разработчики уверенно заявляют нам, что ещё есть, к чему стремиться, и это не предел.

Теперь главными задачами на 26-й год ставят снизить порог входа, то есть:

  • Сделать их доступными и понятными каждому,

  • Интегрировать нейросети во все цифровые продукты и соцсети,

  • А также дать ещё больше контроля над процессом генерации.

Уже существуют модели, которым достаточно вкратце объяснить суть, а вникнуть в контекст и детальнее изучить тему они смогут самостоятельно. Можно менять ракурс камеры, фон или добавить подпись без необходимости заново генерировать всю сцену.

Компания ByteDance 23 июня 2026 года на конференции в Пекине анонсировала Seedance 2.5, где заявили, что в качестве исходных данных можно будет использовать до 50 комбинированных изображений, видео и аудио. И всё для того, чтобы модель могла ещё точнее координировать персонажей, локации, примеры движения, звуковые ссылки и визуальный стиль.

Помимо этого, разработчики LumaLabs выпустили модель Ray 3.2, которая сможет чётко передать мимику до 8 человек в одном кадре. Вместе с высокой точностью, нейросеть зафиксирует скелетную позу, тело, жесты и осанку на протяжении всего видеоролика. Кроме обычного 8-битного формата .mp4 появляется возможность генерировать видео в 16-битном HDR и экспорт в формат .exr. Такое решение даёт буст в цветопередаче и насыщенности цветов без потери качества. Особенно это будет полезно для киностудий, которым важно работать с высококачественными видео.

Более ранние модели просто брали один начальный или конечный кадр и самостоятельно генерировали все промежуточные. Теперь же можно пошагово установить до 16 ключевых кадров в любой последовательности, чтобы точнее описать движение объекта, сцену или ракурс. И всё для того, чтобы снизить неудачные генерации к минимуму без необходимости генерировать по-новой.

Это и есть тот контроль, о котором нам заявляют разработчики. Здесь мы выступаем в роли режиссёров и в качестве раскадровки указываем нужные моменты, а нейронка действует по ТЗ, не придумывая ничего лишнего.

Три основные проблемы современных видеомоделей

По последним отчётам бенчмарка T2VPhysBench, даже топовые коммерческие модели в среднем набирают меньше 0.60 баллов из 1.0 по шкале точного соблюдения физических законов. Они всё ещё ошибаются в неочевидной физике. Сюда же можно добавить проблемы с биомеханикой, с распределением веса тела и плавностью шагов.

Но как наиболее показательные, мы хотели бы выделить три основные проблемы, с которыми до сих пор сталкиваются DiT-видеомодели в 2026 году.

Общие результаты физических ограничений. Источник: https://arxiv.org/pdf/2505.00337
Общие результаты физических ограничений. Источник: https://arxiv.org/pdf/2505.00337
  1. Нарушается причинно-следственная связь. Это связано с тем, что нейросеть генерирует видео, оптимизируя всю сцену целиком, а не последовательно во времени, путая причину и следствие. Из-за этого ИИ часто может нарисовать результат до совершения действия. Например, дверь откроется до того, как к ней прикоснётся рука. Чтобы это решить, разработчики применяют технологию причинно-следственных графов. То есть нейросети задаётся сценарий в чёткой последовательности по шагам, чтобы не оставить ни единого шанса выполнить Шаг 2 перед Шагом 1.

  2. Искажается постоянство объектов. Проблема напрямую связана с понятием окклюзии. То есть, когда один предмет загораживает другой. Когда чашка заслоняется рукой, ИИ удаляет из памяти информацию про этот объект. Когда рука уходит, модель сверяется с текстовым промптом («чашка на столе»), но забывает точную форму, цвет и рисунок старой чашки, из-за чего создаёт похожую, другую, либо вообще стирает её. Новейшие модели учатся применять эмбеддинги трёхмерных масок и скрытые буферы памяти. Чтобы объект твёрдо фиксировался, даже когда он скрыт, ему присваивается уникальный ID. Как только рука сдвигается в сторону, модель ничего заново не придумывает. Она берёт из буфера памяти сохранённые математические параметры именно той чашки, которая там стояла секунду назад.

  3. Создаётся эффект неуместного успеха. Ещё это называют эффектом голливудского монтажа. Приведём наглядный пример: когда футболист бьёт по мячу по заведомо неудачной траектории, модель исправляет удар и мяч идеально попадает в свою цель. Так как нейросети обучались по сотням терабайтам самых удачных и правильных видео, они искренне верят, что промахнуться человек не может. То есть отрисовать неудачу и физическую ошибку у ИИ получается не очень.Этот недочёт устранить сложнее всего, так как он зашит в сами данные, на которых учился ИИ. Но инженеры придумали один из вариантов — через «негативное обучение». Нейросетям специально показывают видео с фейлами и неудачами, чтобы приучить распознавать слова «промах», «падение» и т.д.

Куда дальше движется рынок

Чтобы это понять и собрать цельную картинку, стоит взглянуть, что об этом говорят в широких кругах:

  1. Ассоциации и профсоюзы голливудских актёров с выходом модели Seedance 2.0 сорвались с цепи, как только увидели, что видео со звёздами генерируются на уровне сверхреализма. Больше, конечно, их смутило авторское право с применением звёздных лиц. Это было показано настолько реалистично и кинематографично, что мимо не смогли пройти даже сценаристы и монтажёры известных киностудий. Такое событие повлекло за собой долгие судебные разбирательства в пользу этих же профсоюзов.

  2. В Китае всё в точности до наоборот. Компании заявили, что AI-генерация поможет проявиться молодым авторам и сможет обойти дорогие голливудские эффекты без сильных затрат на производство. Кроме этого, уже одобрены проекты с ИИ для создания телевизионного контента, а также было анонсировано масштабное фэнтези-аниме, где 70% хронометража и фонов сгенерировано нейросетями.

Можно сделать вывод, что почти все обновления последних моделей объединяет одна цель — увеличить длительность видео и сохранить его целостность:

  • Модели будут всё лучше понимать намерение пользователя. Вместо длинных промтов достаточно будет описать саму суть, а система сама предложит варианты, как сделать лучше.

  • Усилится тренд мультимодальности и свободного редактирования. Предпосылки и анонсы говорят, что скоро сможем настраивать и подгонять каждый отдельный объект без повторных перегенераций.

  • В проекты сможем добавлять ещё больше видео- аудио- исходников для точности результата.

Одновременно развивается консистентность, подтягивается логика движения, фиксятся недочёты с основными законами физики и улучшается единый визуальный стиль. Я убеждён, что в ближайшем будущем заменить операторов, дизайнеров, режиссёров и операторов видеомоделям не суждено. Зато у них точно есть все шансы интегрироваться и стать для них таким же инструментом, каким сегодня являются программы для монтажа и цветокоррекции.

Заключение

Наблюдаем чёткую динамику: в 2024 модели конкурировали в самом факте генерации, в 2025 — в управлении и качестве, а в 2026 эксперты уже обсуждают мультимодальность, снижение порога входа и интеграцию нейросетей в рабочие процессы.

Если прогресс продолжится без снижения темпа, то в 2027 году мы сможем увидеть первые автономные AI-агенты, которые будут закрывать задачи на всех этапах — от идеи до реализации, и при необходимости ставить задачи другим нейросетям.