
Последние недели у меня в рабочих чатах через слово мелькает фраза «а давай Гэндальф сварит зелье со Скуби‑Ду». Не потому что корпоратив затянулся. Просто мы в GPTunneL запустили штуку, которая заставляет весь офис вести себя как дети, которым выдали пульт от телевизора и сказали: «крути любой канал, какой захочешь — только этого канала ещё не существует, придумай сам».
Штука называется Grom TV — «Гром Телевизор». Это генеративный онлайн‑ТВ, куда заходит любой желающий, пишет промпт (буквально текстом, как в чат) и через 20–25 секунд видит на экране свой собственный видеоролик, сгенерированный нейросетью прямо по этому запросу.
Причём видит не один: на канале одновременно крутятся ролики других зрителей, а под телевизором — чат, куда можно отправлять промпты.
Попробовать можно прямо сейчас: gptunnel.ru/lab?section=tv. Регистрация простая, промпт пишется в поле справа от экрана — и дальше вы, по сути, режиссёр в прямом эфире. Собственно, вот как это выглядит вживую...
Как всем этим пользоваться
Заходите на сайт;
Регистрируетесь;
Пишете промпт в чат от телека;
Ждёте 20–25 секунд;
Смотрите, как ваше творение крутится в эфире на глазах у всех.
Ввод промпта на сайте — от заявки до появления ролика в эфире проходит чуть более 20 секунд, а время генерации составляет лишь около ~8 сек.:
Что вообще происходит на экране
Несколько примеров:
Кроссовер, который сам напрашивался последние лет двадцать, просто никто не решался:
«Уолтер Уайт варит зелья на уроке Снейпа»
Кто‑то ушёл в эстетику нуара, и нейросеть переобулась в чёрно‑белое:
«Микки Маус в стиле Noir»
Концерт KISS x TBBT:
«Теория большого взрыва — концерт KISS, шелдон купер, радж, эмми играют на инструментах»
«Гуфи и Гомер Симпсон вдвоём собирают гриль по инструкции»
Нейросеть уверенно обращается с диснеевской пластикой и чёрно‑белым нуаром. Модели не нужно объяснять, «как выглядит Гомер Симпсон» — она уже знает. Задача пользователя — формулировать, а не рисовать.
Генеративка в прямом эфире
Обычная видеогенерация — асинхронный процесс: отправил запрос, подождал, получил файл, посмотрел когда удобно.
Прямой эфир — физика совсем другая. Тут нельзя «подождать чуть дольше»: если генерация начинает отставать от скорости просмотра хоть на полсекунды, эфир либо заикается, либо останавливается насмерть.
Сравним с конвейером, где деталь должна появляться на ленте быстрее, чем предыдущая уезжает, иначе вся линия встаёт.
Мировых примеров у формата, на самом деле, немного.
Самый известный — Nothing, Forever запущенный студией Mismatch Media в конце 2022-го на «Твитче». Это бесконечный «Сайнфелд», где фразы актёров генерировались LLM, а озвучка шла через синтез речи. Проект мгновенно обрёл популярность.
Как устроено внутри. 8 сек. видео/7,8 сек. генерации
Один видеоролик Grom TV длится восемь секунд — со звуком, а когда есть речь — нейросеть синхронизирует движения губ и реплику (липсинк).
На то, чтобы такой клип сгенерировать, у модели уходит около 7,8 секунды. Это значит, что коэффициент реального времени — 0,97. Генерация опережает эфир, хотя и с небольшим запасом. Всё это крутится не на кластере из десятков видеокарт, а через один чип Nvidia B200 (иногда подключается второй, чтобы оптимизировать скорость).
Параметр | Значение |
|---|---|
Длина клипа | 8 секунд видео + синхронный звук |
Время генерации | ~7,8 секунды |
Частота кадров | ~24 fps |
Коэффициент реального времени | 0,97 (генерация быстрее эфира) |
Задержка «промпт зрителя → экран» | ~8–25 секунд |
Запас видео впереди зрителя | всегда не менее ~8 секунд |
Чтобы оценить масштаб задачи: Blackwell (то самое поколение, к которому относится и топовый B200) — архитектура Nvidia, спроектированная в первую очередь под обучение и инференс больших моделей, а не под потоковую генерацию в реальном времени.
Дальше в дело идёт классика — ffmpeg, который в одном проходе (за какие‑то ~0,3 секунды на CPU) успевает сделать сразу несколько вещей:
подогнать темп воспроизведения ровно под скорость генерации (это тот самый механизм, который не даёт эфиру догнать модель),
наложить фирменный «плёночный» стиль канала — зерно, виньетку, мягкую цветность,
и нарезать всё на двухсекундные сегменты с ключевым кадром на каждой границе, чтобы плеер стартовал за две секунды и переключался между клипами без рывков.
Схематично конвейер выглядит так:
зритель ──► очередь ──► GPU: генерация 8 с видео + звука │ ▼ ffmpeg: темп, плёночный стиль, нарезка на 2-секундные сегменты │ ▼ HLS-плейлист (скользящее окно, непрерывный) │ ┌─────────────┴─────────────┐ браузер (hls.js) VLC / любой HLS-плеер
HLS выбрали, а потому что его понимает буквально всё: браузер, VLC, любой смарт‑телевизор.
Даже один лишний кадр в хвосте ролика вызывал заметное зависание на стыке двух клипов — и такие вещи можно отловить только по факту реального эфира, когда множество зрителей смотрят одновременно.
Что происходит, когда очередь пуста
Grom TV вообще не простаивает. Если очередь пользовательских промптов пустеет, в дело вступает Grom GPT — LLM‑модель нашей компании GPTunneL, которая сама придумывает сюжеты и подкидывает их в эфир, чтобы канал не молчал.
Архитектурно это построено так, что нейросеть способна генерировать порядка 10 000 уникальных клипов в сутки без единого повтора.
Кстати, похожая мысль была реализована в Nothing, Forever — там сценарии для стендапа и диалогов тоже писала языковая модель — только это была текстовая GPT-3, а не LLM + видеогенератор.
Модерация: фильтр стоит до генерации, а не после
Прямой эфир нельзя «отмотать назад» — если что‑то вышло на экран, это уже произошло у всех на глазах. Именно поэтому вся система фильтрации выстроена так, чтобы отсекать неприемлемый контент ещё до того, как он доберётся до видеомодели, чтобы не разгребать последствия постфактум.
запрос зрителя ──► GromMod ──► Grom (сценарист) ──► GPU ──► эфир отсекает убирает чувствительное явную жесть из промпта, переписывает сцену безопасно
Работает это в два независимых рубежа:
GromMod — собственный модератор GPTunneL, первый фильтр. Он смотрит на промпт целиком и сразу отклоняет откровенно недопустимое (насилие и так далее). Отказ зритель получает мгновенно, и здесь в GPU даже ничего не передаётся.
Grom на этапе сценария — второй рубеж. Превращая короткое пожелание зрителя в сценарий для видеомодели (сцена, реплики, звук, музыка), Grom попутно вычищает из него чувствительные детали и смягчает формулировки, сохраняя при этом сам творческий замысел. До модели промпт доходит уже в безопасном виде.
Два независимых этапа страхуют друг друга. То, что случайно проскочило первый фильтр, ловит второй.
GPTunneL — площадка, где всё это работает
Grom TV — лабораторный эксперимент внутри GPTunneL, российской ИИ‑платформы. Сервер физически расположен в России.
Это сервис, который объединяет больше сотни ИИ‑инструментов для генерации текста, изображений, видео, музыки и голоса в одном окне. Начинался проект в 2023 году как внутренний инструмент для собственной команды разработчиков, а вырос к 2026 году в платформу с более чем полутора миллионами зарегистрированных пользователей.
Изначально прототип вообще был продуктом для видеоконференций — но появились нейросети, и всё резко закрутилось в другую сторону.
Grom TV в этом смысле — пример того, что происходит, когда у платформы есть собственные модели (видео, LLM‑модератор, LLM‑сценарист) и собственное железо: перед нами эксперимент, который показывает, куда движется технология.
Технически можно поднять качество генерации выше и уйти в сторону полноценных стримов с цифровыми аватарами — с более стабильной картинкой, без малейшего дрейфа между кадрами, в честном HD‑разрешении.
Если у бизнеса есть интерес (например, B2B‑сценарии, где нужен именно живой генеративный видеоканал, а не предзаписанный ролик), такое решение реализуемо на серверном чипе B200 в реальном времени. Путём большего числа проходов генерации на кадр можно убрать дрейф картинки и выдавать HD в потоке.
Тут вся суть эксперимента: чем больше людей попробует, чем разнообразнее промпты — тем интереснее общий эфир.
Как нам известно, это первый в России подобный формат генеративного общего онлайн‑телевидения — открытого, куда заходит любой желающий и в реальном времени видит своё творение в общем эфире.
Grom TV для нас — это не финальный продукт, а скорее демонстрация принципа: генеративное видео можно поставить в прямой эфир на одной видеокарте, и это работающий канал, который вы можете открыть прямо сейчас. Мы продолжаем докручивать пайплайн, следить за качеством дословной речи, стабильностью склеек и модерацией.
Если хочется попробовать самому — заходите в «Гром Телевизор», пишите промпт и ждите 20–25 секунд до эфира.

