ИИ видео с толпой это формат, где десятки людей в кадре двигаются абсолютно одинаково, а один человек посередине живёт отдельно. Разбираю, как он собирается технически: сначала опорный кадр, потом перенос движения с видео-образца, потом замена персонажей. Все модели ниже открываются из одного окна на Umnik.AI.

Материал практический: пошаговая сборка, готовые промты, список того, что ломается, и честная оценка по времени и токенам. Если вы уже пробовали повторить такой ролик и получали кашу вместо синхронной толпы, причины почти наверняка в этом тексте.
Тренд Storm II и ИИ видео в толпе: почему синхронное движение так действует
У эффекта есть инженерная иллюстрация, которую в Лондоне получили случайно. 10 июня 2000 года открыли пешеходный мост Миллениум через Темзу, и он начал заметно раскачиваться вбок. Причина оказалась не в конструкции как таковой: люди, идущие по качающемуся настилу, бессознательно подстраивают шаг под колебание, чтобы удерживать равновесие, и этим усиливают его. Явление назвали синхронным боковым возбуждением. Мост закрыли через два дня, добавили демпферы и открыли заново только в феврале 2002 года.
Важное здесь вот что: синхронизация возникла сама, никто никого не просил идти в ногу. Человеческая моторика подстраивается под общий ритм автоматически, и наблюдатель считывает такую синхронность мгновенно, ещё до того как разберёт лица. Поэтому ИИ видео в толпе работает не за счёт количества людей в кадре, а за счёт того, насколько точно их движение совпадает по фазе.
Из этого следует практический вывод для генерации: синхронность нельзя описать словами вроде «толпа танцует вместе». Её нужно переносить с реального видео, где фаза уже задана. Именно поэтому основной инструмент здесь не текстовый промт, а Motion Control, и именно его я разбираю дальше. Все нужные модели лежат в одном аккаунте на Umnik.AI, переключаться между сервисами не придётся, а токены оплачиваются рублями картой РФ без зарубежных карт. За подписку на Telegram-канал Umnik.AI начисляют 50 токенов бесплатно.
Тренд Storm II: откуда он взялся

Тренд Storm II вырос из клипа на одноимённый трек проекта GENER8ION совместно с Yung Lean, вышедший в апреле 2026 года. GENER8ION это дуэт продюсера Surkin и режиссёра Romain Gavras, Yung Lean это шведский музыкант Jonatan Leandoer. Хореографию ставил Damien Jalet, продакшн вёл Iconoclast.
Действие происходит в британской школе-интернате для мальчиков, класс выпуска 2034 года. Весь класс двигается единой массой, резко и синхронно, а камера идёт длинными проходами без монтажных склеек. Esquire отмечал, что хореография отталкивалась от школьного скандирования, и это заметно: движение построено на ударных акцентах, а не на плавных переходах.
Для повторения тренда Storm II важны три технические особенности оригинала, которые и нужно воспроизводить. Первое: длинные непрерывные планы, а не быстрая нарезка. Второе: масса двигается как один организм, отклонений по фазе почти нет. Третье: выделенный герой либо не двигается вообще, либо двигается против общего ритма. Третий пункт критичен, без контраста тренд читается просто как групповой танец.
ИИ видео среди толпы людей: пошаговая сборка

ИИ видео среди толпы людей собирается строго в таком порядке, менять шаги местами бессмысленно: каждый следующий опирается на результат предыдущего.
Шаг 1. Готовим портрет. Берём фронтальное фото в полный рост или по пояс, при ровном свете. Если исходник слабый, прогоняем его через улучшение качества фото. На вход в видеомодель должен идти уже чистый кадр: любой шум и размытие на этом этапе потом размножатся по всем кадрам ролика.
Шаг 2. Собираем опорный кадр со сценой. В генераторе изображений делаем статичную картинку: трибуна, школьный зал или улица, толпа в одинаковой одежде, ваш герой на переднем плане. Это ключевой момент, который многие пропускают. Видеомодель, получив готовый кадр, тратит ресурс на движение, а не на придумывание сцены с нуля, и результат стабильнее на порядок.
Шаг 3. Оживляем опорный кадр. Отправляем картинку в видеомодель и получаем базовый ролик на 5-6 секунд. На этом этапе движение ещё приблизительное, синхронности нет. Это нормально, задача шага только в том, чтобы получить корректную геометрию сцены в динамике.
Шаг 4. Переносим движение через Kling Motion Control. Берём видео-образец с нужной хореографией, скармливаем его как источник движения, а наш кадр как источник внешности. Только на этом шаге появляется та самая синхронность, ради которой всё затевалось.
Шаг 5. Заменяем персонажей. Универсальный промт на замену героя и толпы приведён ниже отдельным блоком. Он нужен, если вы хотите поставить в кадр себя и знакомых, а не обобщённых людей.
Шаг 6. Добавляем звук и собираем итог. Либо генерируем дорожку вместе с видео, либо накладываем отдельно.
ИИ клип с толпой: сборка через Kling Motion Control
Разберу механику, потому что без понимания принципа шаг 4 выполняется наугад.
Motion Control работает с двумя входами: видео-источник движения и изображение-источник внешности. Модель извлекает из видео представление движения, то есть последовательность поз и траекторий, и генерирует новый ролик, где это движение исполняют объекты с вашей картинки. Текстовый промт при этом остаётся, но его роль вспомогательная: он уточняет детали, а не задаёт хореографию.
Отсюда три следствия, которые определяют результат.
Образец решает всё. Качество синхронности в вашем ролике не может быть выше, чем в исходном видео. Если в образце толпа двигается вразнобой, Motion Control честно перенесёт этот разнобой.
Геометрия должна совпадать. Если в образце люди стоят плотными рядами, а на вашей картинке они разбросаны по площади, модель будет вынуждена достраивать позиции сама, и там появляются артефакты. Опорный кадр из шага 2 лучше собирать уже под композицию образца.
Идентичность дрейфует по кадрам. Каждый следующий кадр генерируется с оглядкой на предыдущий, и мелкие ошибки накапливаются. На шестой секунде лицо героя заметно отличается от первого кадра. Практический ответ: держать ролик коротким и собирать длинную сцену из нескольких проходов, а не просить восемь секунд одним куском.
Storm Starring: универсальный промт на замену героя и толпы
Storm Starring это рабочее название приёма, при котором герой и толпа разведены на две независимые сущности в одном промте, и это принципиально. Если не развести их явно, модель применит референс героя ко всем людям в кадре и вы получите сотню своих копий.
CHARACTER REPLACEMENT INPUTS Source video = @video1 Lead reference = @image1 Crowd reference = @image2 SOURCE Replace people frame by frame. Motion, speed and timing stay identical to @video1. Do not re-choreograph anything. LEAD Identify the single person who [действие героя: стоит неподвижно / идёт против движения массы / поворачивается к камере]. Replace ONLY this person with @image1. Keep the face from @image1 identical in every frame. CROWD Replace EVERY person in [признак толпы: заднем ряду / на трибуне / в школьной форме] with identical copies of @image2. All copies keep the same phase of movement as in @video1. ENVIRONMENT AND CAMERA Keep the location, architecture, signage and lighting 100% untouched. Camera path stays exactly as in @video1. AVOID applying @image1 to anyone except the identified lead, crowd members drifting out of phase, face morphing between frames, extra limbs, duplicated heads, watermark
В промте Storm Starring блоки в квадратных скобках меняются под вашу сцену, остальное лучше не трогать. Строка про фазу в блоке CROWD выглядит избыточной, но без неё толпа начинает расползаться по таймингу уже к третьей секунде.
Kling V3 Motion Control: основной инструмент под ИИ клип с толпой
Что делает лучше всех. Единственная модель в подборке, которая переносит хореографию с образца, а не пытается придумать её по описанию. Фаза движения массы сохраняется, длинный проход камеры повторяется без склеек.
Ограничение. Обязателен видео-образец. Без него это обычный генератор видео, и вся ценность теряется. Плюс образец должен быть достаточно чистым: дрожащая съёмка с телефона переносится вместе с дрожанием.
Промт. Use the reference video motion. Apply it to the still frame. Keep the crowd in phase and the lead face identical through the whole sequence.
Собрать ИИ клип с толпой можно в разделе генерации, где Kling открывается вместе с остальными видеомоделями по одной подписке.
Nano Banana Pro: опорный кадр для ИИ видео в толпе
Что делает лучше всех. Строит статичную сцену с массовкой: ровные ряды, одинаковая одежда, правильный масштаб людей в глубину. И, что важнее, сохраняет лицо героя без искажений при большом количестве людей в кадре.
Ограничение. Это генератор изображений, движения он не делает. Его результат это вход для шага 3, а не готовый ролик.
Промт. School assembly hall, rows of students in identical uniforms facing camera, one person from @image1 standing in the front row, even overhead light, 35mm, photorealistic
Опорный кадр под ИИ видео в толпе быстрее всего собирается в генераторе изображений на Umnik.AI.
Seedance 2.5: ИИ видео среди толпы людей без образца
Что делает лучше всех. Держит синхронность лучше остальных генеративных моделей, когда видео-образца под рукой нет и хореографию приходится задавать текстом. Не разваливает массу на отдельных людей в первые же секунды.
Ограничение. Текстом можно задать характер движения, но не точную фазу. Для полного совпадения с оригиналом всё равно нужен Motion Control.
Промт. Crowd of people in identical uniforms performing the same sharp movement in perfect unison, one person in the centre standing completely still, continuous camera move, 6 seconds
Для ИИ видео с толпой без образца Seedance 2.5 открывается там же, в разделе генерации.
Veo 3.1: звук и удары в такт для тренда с толпой
Что делает лучше всех. Генерирует аудиодорожку вместе с картинкой, и в этом формате это важнее, чем кажется: синхронная толпа без звукового акцента на каждом движении читается наполовину слабее.
Ограничение. Точно совместить удар в звуке с кадром движения с первой попытки не выходит, обычно нужно два или три захода.
Промт. Crowd moving in unison, sharp percussive hit on every movement, room reverb of a large hall, 6 seconds with audio
Звуковую дорожку под тренд с толпой удобно собирать в том же разделе генерации, не выходя из проекта.
Объединить фото: лица знакомых в толпе
Что делает лучше всех. Готовый инструмент, который сводит несколько портретов в одно изображение с сохранением каждого лица. Нужен, если в толпе должны стоять конкретные люди, а не копии одного человека.
Ограничение. Чем больше лиц, тем сильнее падает сходство по каждому. Практический предел это четыре-пять человек на кадр.
Использование. Загружаете портреты, получаете общий кадр, дальше он идёт как @image2 в блок CROWD из промта выше.
Собрать ИИ видео среди толпы людей с реальными лицами помогает инструмент объединить фото.
Улучшить качество фото: подготовка портрета
Что делает лучше всех. Поднимает детализацию и убирает шум на исходнике. Звучит как мелочь, но в видеогенерации любой дефект входного кадра размножается по всем шестидесяти кадрам ролика и становится заметным артефактом.
Ограничение. Информацию, которой в исходнике нет, инструмент не восстановит. Из фото 200 на 200 пикселей студийный портрет не получится.
Использование. Прогоняете портрет перед шагом 2, а не после сборки сцены.
Портрет под ИИ видео с толпой готовится инструментом улучшить качество фото.
Тренд с толпой: что ломается чаще всего
Тренд с толпой ломается предсказуемо. Собрал по итогам разборов, в порядке частоты.
Толпа расползается по фазе. К третьей-четвёртой секунде люди перестают двигаться синхронно. Причина в том, что фаза не зафиксирована явно. Лечится строкой про сохранение фазы в блоке CROWD.
Герой размножается. Референс лица применяется ко всем людям в кадре. Причина в том, что герой не выделен признаком. Лечится блоком LEAD с явным описанием того, чем герой отличается от остальных.
Лицо дрейфует к концу ролика. Накопление ошибки по кадрам. Лечится сокращением длительности и сборкой из нескольких проходов.
Толпа теряет объём в глубину. Дальние ряды становятся плоскими или исчезают. Причина в опорном кадре: если в нём глубина не выстроена, видеомодель её не придумает.
Камера начинает дёргаться. Переносится дрожание из образца. Лечится выбором стабилизированного образца.
Ноги проваливаются в пол. Классический артефакт при плотной массовке. Помогает явное указание на уровень пола и тени под каждым человеком в опорном кадре.
Сколько стоит ИИ клип с толпой по времени и токенам
Честный расчёт на один готовый ролик, если делать по шагам выше.
подготовка портрета: 1 генерация, меньше минуты
опорный кадр: 3-4 генерации, потому что композиция с первого раза почти никогда не выходит
базовое оживление: 2 генерации
перенос движения через Motion Control: 2-3 генерации
замена персонажей: 2-3 генерации
звук: 2 генерации
Итого порядка 12-15 генераций на один чистый ролик. По времени это примерно полтора-два часа с учётом ожидания очереди и отбраковки. Стоимость каждой генерации указана рядом с моделью в интерфейсе, видеомодели заметно дороже картиночных, поэтому экономить имеет смысл на опорном кадре, а не на видео.
Тренд Storm II: что не получится
Стоит сказать прямо, чтобы не тратить время на заведомо нерешаемое.
Смонтировать длинный клип целиком в одном месте не выйдет: генеративные модели выдают короткие фрагменты, и склейка остаётся ручной работой в стороннем редакторе. Точно повторить оригинальную хореографию Storm II без видео-образца тоже не выйдет, текстовое описание даёт только похожий характер движения. Добавить субтитры или перевести звуковую дорожку в рамках этого пайплайна нельзя. И отдельно: сходство лица в толпе из двадцати человек будет заметно хуже, чем у героя на переднем плане, это ограничение самой архитектуры, а не настроек.
Частые вопросы про ИИ видео с толпой
Обязателен ли видео-образец для тренда с толпой? Для точной синхронности да. Без образца можно получить похожий по характеру ролик, но фаза движения совпадать не будет.
Какой длины делать ролик? Пять-шесть секунд. Дальше начинается заметный дрейф лица и фазы, длинную сцену собирают из нескольких проходов.
Можно ли поставить в толпу конкретных знакомых? Да, через инструмент объединения фото, но с потерей сходства при большом количестве лиц. Практический предел четыре-пять человек.
Почему все люди в кадре получаются с моим лицом? Референс героя применился ко всей массе. В промте должен быть отдельный блок LEAD с признаком, по которому герой опознаётся.
Нужен ли мощный компьютер? Нет, вся генерация идёт на стороне сервиса, локально нужен только браузер.
Подойдёт ли вертикальный формат? Да, но плотную массовку в вертикали видно хуже. Для этого тренда горизонталь или квадрат работают лучше.
Можно ли использовать оригинальный трек в своём ролике? Права на запись принадлежат правообладателям, для публикации с монетизацией вопрос решается отдельно. Для личного контента обычно достаточно правил самой площадки.
Нужна ли карта иностранного банка? Нет, оплата проходит рублями картой российского банка.
Итог
ИИ клип с толпой держится на одной технической идее: синхронность нельзя описать текстом, её переносят с реального видео. Отсюда весь пайплайн, в котором генерация картинки и генерация движения разведены на разные шаги, а Motion Control стоит между ними.
Если убрать всё лишнее, рабочая последовательность такая: чистый портрет, статичный опорный кадр со сценой, базовое оживление, перенос движения с образца, замена персонажей, звук. Двенадцать-пятнадцать генераций, полтора часа, и получается ролик, который в ленте не отличить от постановочного. Все шесть инструментов из разбора открываются из одного аккаунта на Umnik.AI, а свежие сцены под похожие тренды лежат в разделе трендов.