Кажется, что GenAI сделал производство контента почти бесплатным: открыл ChatGPT — готов сценарий, открыл генератор картинок — есть визуал, добавил видео, голос и музыку — и вот голливудская студия помещается в браузере.

На практике всё сложнее: у каждой нейросети свой интерфейс, тариф, лимиты и представление о задаче. Поэтому я решила посчитать, сколько реально стоит сделать 25-секундный рекламный ролик с помощью ИИ.

Спойлер: 25-секундный ролик обошёлся в 2 126 ₽, или 85 ₽ за секунду. Почти 90% бюджета съела генерация видео — так что ИИ‑продакшн не такой равномерно дешёвый, как кажется. А сценарий, озвучка и музыка стоили буквально копейки. Генерила всё через BotHub.

В эксперименте использовались:

  • GPT-6 Astra — для сценария и доработки промптов (справится и модель попроще, но почему бы не пощупать новинку);

  • Nano Banana 2 — для генерации исходных изображений;

  • Kling v3 — для превращения изображений в видео;

  • ElevenLabs Flash v3 — для закадровой озвучки;

  • Suno v5.5 — для музыкального сопровождения.

О новой v6 писала здесь, на момент эксперимента она еще не вышла, но если вы возьмёте версию новее, глобально ничего не изменится.

Рекламировать решила гербарий. Никаких скрытых интеграций, заказчиков и продуктовых размещений. Просто буквально рекламируем осень. Задача была следующей: создать ролик, используя генеративные модели для сценария, изображений, видео, озвучки и музыки.

Как я считала стоимость ИИ‑рекламы и какие инструменты использовала

Сразу оговорюсь: я не учитывала неудачные генерации, чтобы посчитать чистую стоимость результата. На итоговую цену рекламы с ИИ сильно влияют навык промптинга и уровень перфекционизма: чем больше перегенераций, тем выше бюджет.

Если начать учитывать все возможные эксперименты, случайные перегенерации и попытки добиться «атмосферки», стоимость ролика будет расти вместе с уровнем вашего перфекционизма и навыка объяснять, чего вы хотите.

Во время эксперимента я использовала BotHub, потому что так удобнее. Не пришлось постоянно прыгать между отдельными приложениями и вкладками, да и часть задач выполнять дешевле. Ещё есть момент, что так проще посчитать именно стоимость генераций, не только благодаря тому, что сервис отображает, сколько токенов «съест» конкретный промпт.

Себестоимость генерации и стоимость доступа: две разные цифры в ИИ‑продакшене

В эксперименте я считала marginal cost — стоимость конкретных генераций, которые вошли в финальный ролик. Для заказчика это не всегда совпадает с реальной стоимостью производства рекламы.

При работе через API или, как я выбрала, через BotHub, можно относительно точно считать стоимость отдельных вызовов: токены, секунды аудио, изображения или видеокредиты. В пользовательских сервисах экономика устроена иначе: подписка даёт определённый объём вычислительного ресурса, а пользователь платит за доступ к нему независимо от того, использовал ли весь лимит.

Поэтому две цифры здесь нужно разделять:

  • стоимость генерации результата — сколько вычислений потребовал конкретный ролик;

  • стоимость доступа к инфраструктуре — сколько денег пришлось заплатить, чтобы вообще получить возможность выполнить эти генерации. Для одного ролика вторая величина может оказаться существенно выше первой.

Конечно, всегда можно пойти по пути хардового LLM‑щика: найти открытые модели под каждую задачу, скачать веса, развернуть всё локально и почувствовать себя независимым от индустрии. Но для этого желательно иметь компьютер, который способен всё это запускать. Мой ПК, к сожалению, подходит скорее для офиса, а не локального дата‑центра. За это спасибо тем же дата‑центрам.

ИИ не отменяет профессиональный продакшн

Фотографов, операторов, дикторов и музыкантов не стоит заменять вкладками в браузере. У генеративного контента есть нюансы, особенно в коммерческом использовании: права, лицензии, голоса, стабильность персонажей, контроль результата и требования бренда. И да, ИИ‑контент всё ещё довольно легко превращается в нейрослоп, за который вас захейтят. С предисловиями закончили, приступаем.

Шаг 1. Сценарий рекламы с помощью ИИ

Начинать сразу с генерации красивых видео бессмысленно. Сначала нужно понять, что мы рекламируем и что зритель должен увидеть за 25 секунд. Для этого я использовала GPT-6: модель выступила креативным продюсером и сценаристом, а затем помогла разбить ролик на сцены и подготовить промпты.

Первоначальный запрос был примерно таким: дать модели роль креативного продюсера и сценариста, специализирующегося на рекламе, а затем попросить разработать подробный сценарий 25-секундного ролика для гербария. Важное условие — весь контент должен быть создан нейросетями, поэтому сценарий сразу должен учитывать ограничения генерации и содержать промпты для каждого элемента.

Промпт для генерации сценария рекламного ролика

Роль: Ты — опытный креативный продюсер и сценарист, специализирующийся на создании рекламы с помощью нейросетей.
Задача: Разработай детальный сценарий для 25-секундного рекламного ролика для Гербария (альбом с коллекцией засушенных растений/трав).
Важное условие: Весь контент (видео, фото, аудио) будет сгенерирован ИИ. Поэтому твоя задача — дать не просто сценарий с описанием картинки, а сценарий, дополненный промптами для каждого элемента.
Атмосфера: теплая, осенняя, уют

Отдельно пришлось несколько раз возвращаться к модели за мелкими доработками и уточнениями промптов. Это, пожалуй, наиболее реалистичный сценарий использования LLM в подобных задачах: не «один запрос — готовая реклама», а несколько итераций, пока идея не начинает нормально раскладываться на конкретные технические задания.

На сценарную часть и дальнейшие корректировки ушло около 102 рублей.

Шаг 2. Генерация изображений для рекламы: почему image‑to‑video точнее

Следующая задача — получить изображения, которые станут основой будущих видеосцен. Для этого я использовала Nano Banana 2. Всего для ролика потребовалось восемь базовых изображений. Именно они задавали композицию кадра, атмосферу, освещение, объекты и визуальную стилистику будущего ролика.

Стоимость восьми базовых изображений составила 128,29 рубля. В среднем — около 16 рублей за изображение.

При этом именно на этом этапе особенно хорошо видно значение промпта. Большинство результатов были пригодными, но иногда приходилось не менять модель, а просто точнее объяснить, чего от неё требуется.

Почему image‑to‑video удобнее для контролируемого продакшна

В этом эксперименте изображение выполняло роль промежуточного состояния между генерацией идеи и генерацией движения. Это важный момент: вместо того чтобы каждый раз генерировать сцену с нуля, мы сначала фиксируем пространственную структуру кадра, а затем просим видеомодель изменить её во времени.

Подробнее про text‑to‑video и image‑to‑video

У text‑to‑video больше степеней свободы: модель одновременно должна интерпретировать описание сцены, выбрать композицию, сформировать объекты и их внешний вид, а затем добавить движение. В image‑to‑video большая часть этих переменных уже зафиксирована исходным изображением.

Для рекламного ролика это особенно важно. Нам не нужен каждый раз новый красивый кадр — нам нужна последовательность кадров, которые выглядят как части одного продакшна. Исходная картинка становится своеобразным условием для видеомодели: она ограничивает пространство возможных результатов и переносит на следующий этап композицию, объекты, освещение и визуальный стиль. Поэтому в подобных задачах image‑to‑video — механизм контроля над вариативностью модели.

Самая сложная задача — не сгенерировать красивый кадр, а сохранить состояние сцены

Помимо симпатичной картинки, для ИИ‑видео важна согласованность между сценами. Если в одном кадре объект имеет одну форму, положение и освещение, а в следующем модель интерпретирует его уже иначе, зритель быстро замечает артефакт.

Поэтому модель изображений в таком воркфлоу выполняет ещё одну функцию — предварительно фиксирует состояние сцены. Чем больше параметров удаётся задать до передачи изображения в видеомодель, тем меньше переменных остаётся на этапе анимации.

Шаг 3. Генерация видео: самая дорогая часть ИИ‑рекламы

Дальше начинается самая дорогая часть эксперимента. Статичные изображения нужно превратить в полноценные видеосцены. Для этого я использовала Kling v3 Video.

Всего было сгенерировано семь видеосцен. На этом этапе модель должна была сохранить исходную композицию и при этом добавить естественную динамику, движение камеры и прочее. Стиль был коммерческий, поэтому обошлись без невероятных переходов и замудрёных промптов.

Генерация видео оказалась самым дорогим этапом. Одна сцена — около 268 ₽, семь — 1 878 ₽.

Почти 90% бюджета 25-секундного ролика ушло именно сюда. Сценарий, изображения, музыка и голос на этом фоне стоят копейки. Так что ИИ-реклама — не такая равномерно дешёвая штука, как кажется.
Почти 90% бюджета 25-секундного ролика ушло именно сюда. Сценарий, изображения, музыка и голос на этом фоне стоят копейки. Так что ИИ‑реклама — не такая равномерно дешёвая штука, как кажется.

Почему генерация видео дороже изображения

При генерации изображения модель должна получить один пространственный результат. Для видео необходимо дополнительно обеспечить временную согласованность: объекты должны перемещаться между кадрами непротиворечиво, камера — сохранять заданную траекторию, а освещение и геометрия сцены — не «прыгать» от кадра к кадру.

Для 25-секундного ролика это превращается в большое количество вычислений: даже короткая видеосцена состоит из множества последовательных кадров или латентных представлений, которые нужно согласовать между собой.

Поэтому в текущем ИИ‑продакшне видео остаётся вычислительно более дорогим звеном цепочки. В моём эксперименте это напрямую отразилось на экономике: именно генерация видео сформировала подавляющую часть стоимости готового ролика.

Шаг 4. Озвучка рекламы с ElevenLabs: дешево и со вкусом

Когда визуальная часть была готова, ролику понадобился голос. Для озвучки я использовала ElevenLabs. Задача была утилитарной: получить закадровый голос для рекламного ролика. Озвучка обошлась в 6,04 ₽ — один из самых дешёвых этапов.

И это довольно показательный результат. Профессиональная запись голоса обычно требует найти диктора, согласовать текст, выбрать голос, записать материал, получить и проверить результат. В случае с TTS часть этого процесса исчезает. Текст уже есть, голос выбирается в интерфейсе, результат появляется практически сразу.

Это не значит, что ИИ‑голос автоматически заменяет профессионального диктора. В коммерческой работе важны права на использование голоса, особенности лицензирования, интонационная управляемость и множество других нюансов. Но для небольшого ролика, прототипа, презентации или тестовой рекламной концепции стоимость в несколько рублей выглядит очень заманчиво и практично.

Почему голос оказался почти бесплатным

TTS в этом пайплайне имеет принципиально другую экономику. На вход модели поступает короткая последовательность текста, а результатом становится аудиопоток. При этом нам не требуется генерировать и согласовывать несколько секунд визуального состояния сцены.

Для нашего сценария это разумный компромисс: нам нужен достаточно естественный закадровый голос с минимальной стоимостью и временем генерации.

Мелодию и озвучку сгенерила в одном чате. Для озвучки решила не использовать Suno, так как мне нужен был все-таки диктор, а не пение.
Мелодию и озвучку сгенерила в одном чате. Для озвучки решила не использовать Suno, так как мне нужен был все‑таки диктор, а не пение.

Шаг 5. Музыка для рекламы в Suno: бюджет и ограничения

Последний обязательный элемент — музыка. Для неё я использовала Suno v5.5. Она хорошо подходит для таких экспериментов именно потому, что позволяет описывать не конкретную композицию, а её настроение. Вместо работы с нотами можно задать жанр, инструменты, темп, атмосферу и общий характер трека.

Для рекламного продакшна это удобнее, ведь ТЗ: нот нет, нужна немного грустная, немного уютная, но не слишком медленная музыка.

Музыкальная генерация в Suno обошлась в 11,82 ₽. Это ещё один пример, как генеративный ИИ меняет экономику небольших продакшн‑задач: музыка для ролика больше не требует поиска стока или заказа оригинального трека. Но полный контроль над результатом не гарантирован.

Сколько стоит ИИ‑реклама: таблица расходов

Этап

Инструмент

Стоимость

Сценарий и промпты

GPT-6 Astra

102,09 ₽

Базовые изображения

Nano Banana 2 

128,29 ₽

Генерация видео

Kling v3 Video

1 878,17 ₽

Озвучка

ElevenLabs Flash

6,04 ₽

Музыка

Suno v5.5

11,82 ₽

Итого

2 126,41 ₽

Базовый 25-секундный рекламный ролик, созданный с помощью ИИ, стоит около 2 126 ₽, или 85 ₽ за секунду. Расходы распределились неравномерно: 88% съела генерация видео, сценарий и изображения обошлись дешевле, а музыка и озвучка — буквально несколько рублей.

Вот что у меня вышло:

В этом эксперименте использовались модели, которые можно запускать напрямую. Если покупать доступ к каждому сервису отдельно, расчёт становится менее удобным. Для одного ролика обычно приходится оплачивать не конкретный результат, а месячные подписки или минимальные пакеты кредитов. В моём случае прямые расходы на использованные генерации составили около 2,1 тысячи рублей, сэкономить удалось 1 465 ₽, ведь при работе напрямую пришлось бы оплачивать доступ к нескольким сервисам:

Сервис

Минимальная стоимость

ChatGPT (Plus)

$20 (~1 729 ₽)

Nano Banana 2

~$0,54 (~47 ₽)

Kling

$6,99 (~604 ₽)

ElevenLabs Flash

$6 (~519 ₽)

Suno

$8 (~692 ₽)

Итого

~$41,53 (~3 591 ₽)

Расчёт по курсу $1 = 86,4 ₽.

Тут выводы делаем сами. Прямые тарифы обычно включают гораздо больше кредитов, чем понадобилось именно для этого ролика. Поэтому 3 500 ₽ — скорее стартовый капитал, чем стоимость за один ролик. Но можно и попробовать влезть в бесплатные лимиты или максимально полно использовать оплаченные лимиты. Позвольте мне эту шалость: не просчитывать экономику на десятки юзерских сценариев.

Главная проблема ИИ‑продакшена: модели не видят ролик целиком

У каждой модели есть собственное представление о входных и выходных данных. LLM оперирует текстовым контекстом, модель изображений — визуальным представлением, видеомодель — визуально‑временным, TTS — речевым, а музыкальная модель — аудиальным. У них нет общего пространства, в котором можно было бы задать: «вот ролик целиком, сохрани его персонажа, стиль, драматургию и синхронизацию между всеми дорожками».

Поэтому связность приходится обеспечивать внешним воркфлоу: промптами, референсными изображениями, ручным монтажом, именованием версий и выбором результатов.

Именно это отличает демонстрацию возможностей отдельных моделей от продакшн‑системы. В демо достаточно получить пять впечатляющих результатов. В продакшне эти пять результатов должны ещё и работать вместе. Да, можно сгенерить все и через одну модель, но все мы видели, что чаще всего из этого получается, и слышали фразу «ты клубника, я клубника — как у нас получился банан».

Вот такой эксперимент, делитесь впечатлениями. Если кто‑то продаёт гербарии — напишите мне. Ну а если вам зашло, то заходите еще. Больше статей и новостей об ИИ — в нашем блоге.