Обновить
64K+

Работа с видео *

Все о создании и обработке видео

82,29
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Почему Seedance 2.5 и Hailuo H3 игнорируют промпт и как это исправить 3D-сценой

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели3.8K

Привет, «Хабр»!

Я Илья Трикоз, сооснователь и разработчик GPTunneL. И сегодня расскажу вам про вещь, которую мы сделали, когда задолбались смотреть, как дорогая видеомодель раз за разом придумывает свою режиссуру вместо той, что мы просили.

Но теперь ролик можно собрать иначе:
1) сгенерить 3D-сцену из примитивов, расставить камеры;
2) получить рендер-референс, по которому Seedance 2.5 или Hailuo H3 повторят все движения один в один.

Ракурс, тайминг, каты – всё предсказуемо, всё остаётся на холсте, и любой шаг можно переиграть. Вместо того чтобы уговаривать модель текстом, мы показываем ей на пальцах (точнее, на кубиках).

Итак, встречайте: нода «3D-сцена» в конструкторе воркфлоу.

Читать далее

Новости

Как программа для записи ужимается в 40 МБ ОЗУ, пока OBS ест полгига

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели7.2K

На Windows для захвата экрана есть два классических пути: GDI (медленно и печально) и DXGI Desktop Duplication API. HomRec использует второй вариант.

Смысл DXGI Desktop Duplication в том, что видеокарта сама отдаёт вам текстуру рабочего стола — не нужно постранично вычитывать пиксели через GDI. Вызов AcquireNextFrame возвращает GPU‑текстуру с очередным кадром, а если на экране ничего не изменилось — честно говорит «нечего отдавать» (таймаут), и можно просто повторно использовать прошлый кадр вместо лишней работы.

Проблема в том, что эта GPU‑текстура недоступна напрямую из CPU‑памяти — её сначала нужно скопировать в «staging‑текстуру» и замапить. А вот тут прячется первая интересная деталь.

Читать далее

Как я сделал ремастер «Том и Джерри» в 4K за два года: дубль два

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели98K

Два года назад я выпустил свой дебютный гайд по ремастерингу классических «Тома и Джерри» в 2K. Статья собрала сотню тысяч просмотров и сотни плюсов, но в комментариях меня справедливо разнесли профессионалы.

Картинка перестала мерцать, покрываться кучей царапин — взамен «эффект мёртвой долины» и вагоны нейросетевого мыла. Я решил, что мой любимый мультсериал детства достоин большего. За два года — пять повторных попыток; выстрадывание рабочих инструментов с последующим выбрасыванием тысяч часов завершённых наработок в мусорку. Новый старт и наконец финальная попытка.

Мяу-мяу

Как рабочая задача с трансляциями превратилась в небольшую утилиту для VK Video

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели5K

Однажды мне понадобилось удалённо продублировать региональную трансляцию. Выпускающая группа работала на площадке и отправляла эфир во VK Video, а я находился дома. Нужно было забрать готовый поток из VK, добавить его в OBS и передать дальше — например, на YouTube.

В процессе выяснилось, что прямые ссылки VK временные и могут перестать работать прямо во время эфира. Так для решения своей рабочей задачи я сделал небольшую Windows‑утилиту VK Stream URL. Она получает прямую ссылку на трансляцию, при необходимости обновляет её и предоставляет постоянный локальный адрес для OBS или VLC.

Проект бесплатный, исходный код открыт. Возможно, он пригодится тем, кто тоже работает с региональными и удалёнными трансляциями.

Читать далее

Grom TV: первый в России бесконечный онлайновый ИИ‑телевизор

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели9.9K

Последние недели в рабочих чатах через слово мелькает фраза «а давай Гэндальф сварит зелье со Скуби-Ду». Не потому что корпоратив затянулся. Просто мы в GPTunneL запустили штуку, которая заставляет весь офис вести себя как дети, которым выдали пульт от телевизора и сказали: «крути любой канал, какой захочешь – только этого канала ещё не существует, придумай сам».

Штука называется Grom TV. Это генеративный онлайн-ТВ, куда заходит любой желающий, пишет промпт (буквально текстом, как в чат) и через 20–25 секунд видит на экране свой собственный видеоролик, сгенерированный нейросетью прямо по этому запросу.

Причём видит не один: на канале одновременно крутятся ролики других зрителей, а под телевизором – чат, куда можно отправлять промпты.

Попробовать можно прямо сейчас: «Гром Телевизор». Регистрация простая, промпт пишется в поле справа от экрана – и дальше вы, по сути, режиссёр в прямом эфире. Собственно, вот как это выглядит вживую...

Читать далее

Operation CameraSwarm: как один набор инструментов добрался до 14 500 камер Dahua

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели6.2K

18 августа 2026 года исследователи Hunt.io опубликовали разбор Operation CameraSwarm. За 35 дней один оператор получил доступ более чем к 14 500 камерам Dahua. 

Источник здесь необычно подробный: исследователи нашли открытый HTTP-каталог самого оператора и забрали 2 616 файлов общим объёмом 407 МБ: исходники, журналы запусков, результаты сканирования и служебные скрипты. Затем находки сверили с собственной сетевой телеметрией.

Здесь не было какой-то одной волшебной уязвимости, которая открывала доступ ко всем 14 500 камерам. В одной кампании сошлись старые пароли, непропатченные прошивки и служебная P2P-инфраструктура. Каждый из этих рисков по отдельности известен уже давно. Но когда они собираются вместе…это превращается в конвейер.

Читать далее

Plllay / собственный браузер для видео — спорно?

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели6.1K

Если вы любите образовательный контент также, как его люблю я, вы обязательно оцените мои революционные решения в управлении видеопотоком, которые я упаковал в собственный браузер для мобильных устройств.

Когда пытаешься осмыслить Семихатова переходящего с кораблей бороздящих просторы космоса на эрмитовы операторы в гильбертовом пространстве. Когда вглядываешься в расположение пальцев каждого слайда “Dark Blues Music To Escape To...” в скользящей технике Justin Johnson. Когда разучиваешь каждое движение праздничного танца пятницы в жизнектвеождпющем стейтменте — выжил. Ну или просто ресечишь техники массажа и упражнений в зале…

Читать далее

iPhone, два светильника и OBS: как устроена моя домашняя YouTube-студия

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели9.2K

У меня есть YouTube-канал с примерно полумиллионом подписчиков (адрес не указываю: не чтобы набрать аудиторию пишу). Видео выкладываю почти каждый день, работы много. И у меня сложилась «блогерская сборка», то есть железо для записи, анализа и обработки видео. В статье расскажу, какое оборудование использую, зачем каждый элемент и на чем сэкономить без заметной потери качества.

Если у вас есть собственные советы — велкам в комментарии, обсудим.

Поехали!

AgenticFocus — пайплайн переработки любого видео от первого лица в датасет для обучения гуманоидных роботов

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели7.5K

Развитие Physical AI сегодня уткнулось в отсутствие достаточного количества данных. Если для обучения VLM мы могли взять огромный объем текстовой информации, который годами копился в интернете, то VLA и world‑action-модели кормить практически нечем, создавать новые датасеты для обучения этих моделей оказалось чуть ли не сложнее, чем разработать конструкцию робота. Хотя люди сняли и выложили в открытый доступ огромное количество видео от первого лица, где руками делают что угодно — готовят, собирают, крутят, хватают, но использовать их в таком виде пока невозможно.

Я Артём Лыков, руководитель R&D-направления Physical AI в MWS, и сегодня я расскажу вам о том, с какими проблемами сталкивается отрасль, и о том, как мы разработали и протестировали AgenticFocus — пайплайн, который берет любое FPV-видео и превращает его в полноценный датасет для обучения гуманоидных роботов тонкой моторике. Ключевая идея AgenticFocus — разделить видеоряд на несколько полноценных слоев информации — фон, объекты и кинематику конкретного робота.

Читать далее

Alpha канал и конвертация изображений в пиксельный формат ARGB. Конвертация форматов gif, webp, mov, mp4, png через Bash

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели8.6K

В этой статье приведены: паттерны команд Bash в формате скрипта make_window_icon_txt.sh, а также добавление alpha канала с помощью Bash-скрипта утилитами imagemagick (convert) и ffmpeg. Скрипт имеет размер 290 строк. Эти команды bash отвечают на вопросы:

— Как удалить фон из анимированных форматов gif, webp, mov?
— Как добавить alpha канал в форматы gif, webp, mov, mp4 и png?
— Как конвертировать форматы gif, webp, mov, mp4 в отдельные png изображения?
— Как собрать форматы gif, webp, mov, mp4 из отдельных png изображений?
— Как конвертировать изображения в формат ARGB иконок оконных менеджеров?
— Как попиксельно обрабатывать форматы gif, webp, mov, mp4 и png?

Также в статье приведены оптимальные параметры команд imagemagick (convert) и ffmpeg для обработки форматов gif, webp, mov, mp4 и png.

Читать далее

Я написал программу для записи экрана, которой не нужен мощный ПК

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели10K

Представьте что вы — индус на отшибе мира у которого старенький ноутбук 2016-2017 года. Вам захотелось записать на YouTube видео с вашего компа, но вот незадача — OBS заставляет ваш ноутбук задыхаться. Bandicam платный, а бесплатной версией себя долго не помучаешь. Как насчет других аналогов? а вот фигушки! Если брать тот же ShareX то он не идёт с играми и жрёт кадры.

Принципе любой рекордер жрёт кадры, это неизбежно, в любом случае мораль проста - OBS идеален, если у тебя стоит хороший ПК. а если нет то... ну, тут ничего не поделаешь. Это не вина OBS — он решает другие задачи. Но для слабого железа нужен другой инструмент

И после одной такой мысли я подумал - а как решить эту проблему? Я живу по принципу "Критикуешь - предлагай" и я предлагаю свою программу - HomRec, которая решила мою проблему с OBS. Она полностью опенсурсна, есть на GitHub и бесплатна для каждого. Я написал её полностью на C++, она работает с помощью ffmpeg и, как мне кажется, вообще ничем не уступает по записи. А вот интерфейс знатно хромает.

Настройки помогают указать то как запись будет вестись, оверлеи исполняют базовые потребности по типу прикрепления картинки на экран или действий на клавиатуре. Так же я вошел в азарт и заделал туда свой терминал для различных задач (например — там есть свой пакетный менеджер для плагинов, а точнее их установки). подробнее я позже напишу в документации.

Кстати по поводу плагинов — они тоже присутствуют (как вы, скорее всего, уже поняли). Пишутся они на Lua 5.4, изначально я планировал сделать для этого Python но решил, что Lua больше подходит для этого.

Читать далее

Машина времени уже доступна всем или техника путешествия в прошлое

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели14K

Понимаю, заголовок очень похож на кликбейт, но таковым не является. С другой стороны описана немного другая машина времени.

Всё просто, вот краткое описание требований для «машины времени»:

— Старая фотография знакомого места.
— Реставрация старой фотографии: добавить цветов в ч/б фото и возможно, атмосферности.
— Оживление старой фотографии Minimax H3 и добавление одного или нескольких современных персонажей в старый оживленный мир.

Всего два небольших промпта в процессе.

Подробное описание магии с примерами.

Эволюция генерации видео с 2024 по 2026 год. Разобрал, чего ожидать в ближайшем будущем

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели5.5K

Два года назад несколько секунд мыльной генерации считались прорывом. Сегодня нейросети выдают кинематографичные ролики в 4K качестве, держат консистентность персонажей и работают с референсами — и это активно применяется в работе.

В статье разобрал, какие технологические скачки произошли с 2024 по 2026 год, как они повлияли на рынок и какие направления будут определять развитие рынка дальше.

Читать далее

Ближайшие события

Wan 3.0: Alibaba выводит AI-видео из режима «короткого клипа» в режим «законченной сцены»

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели7.9K

30 секунд за один проход, нативный звук, несколько персонажей — и даже DOC, PDF, PowerPoint или веб-страница на входе.

Alibaba открыла preview Wan 3.0, и это уже заметно больше похоже не на «оживление картинки», а на попытку собрать законченную сцену из разных исходных материалов.

Я подробно разобрал возможности и цены новой модели, посмотрел официальные демо и сравнил её с Seedance 2.5 и 2.0, Kling 3.0, MiniMax H3, Veo 3.1 и Grok Imagine.

Внутри статьи также — сами ролики: 30-секундный one-take, схватка кошки со снежным барсом, восемь языков в одной песне, document-to-video, UGC и другие примеры.

Пять красивых секунд сегодня умеют уже многие. Следующая планка — получить 20–30 секунд действительно управляемой сцены: с теми же героями, теми же предметами, нормальным звуком, развитием действия и без развала всего этого по дороге.

Wan 3.0 — ещё один очень заметный шаг именно туда.

Читать далее

Подсчет транспорта в видеопотоке: пять мест, где я ошибся

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели5.8K

Счетчик показал десятки проездов за одну красную фазу светофора. Машина была одна, и она стояла.

Нейросеть при этом отработала правильно. Она видела машину и держала ее рамку все это время. Ошибка была в семидесяти строках обычного Python, которые я написал сам.

Система считает машины, автобусы и трамваи на видео с неподвижной камеры… Готовых наборов данных не брал: хотел пройти весь путь от съемки до обученной модели сам и посмотреть, где он ломается.

Ломался он пять раз. Метрики тоже будут, вместе с разбором, почему верить им нельзя.

Читать далее

ICO — как я осмелел и написал свой типизированный ML-фреймворк на Python

Уровень сложностиСложный
Время на прочтение6 мин
Охват и читатели5.8K

Последние годы я работал разработчиком в области машинного обучения, компьютерного зрения и 3D-реконструкции. Писал и видел множество вариантов организации вычислений и обработки потока данных. Но в них мне не хватало системы и организованности, прозрачности и гибкости. Поэтому я набрался решимости и воплотил самые мои смелые — и, как оказалось, вполне рабочие — идеи в новом фреймворке, который я назвал ICO.

Читать далее

Скролл-фильм на лендинге весил 84 МБ. WebCodecs ужал его до 18 — вот что сработало, а что нет

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели4.9K

Скролл-фильм на лендинге — это обычно сотни WebP и десятки мегабайт. Рассказываю, как заменил секвенции кадров сырым H.264-потоком без контейнера и WebCodecs-декодером: 84 → 18 МБ на мобиле. С параметрами кодирования и тремя честными тупиками: почему HEVC оказался хуже x264, зачем шумодав не нужен и как B-кадры сломали фильм на живом iPhone так, что валидация этого не увидела.

Читать далее

Как внедряется ИИ на стройке: особенности масштабирования, данных и обучения моделей под российские реалии

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели5.6K

Процесс внедрения ИИ на стройке имеет свою специфику. Дело в том, что здесь есть свои подводные камни при масштабировании обработки видеопотоков, при самом процессе обработки данных и при дополнительном обучении модели YOLO под наши российские реалии. Расскажу обо всём по порядку.

Читать далее

Шоу должно продолжаться. Сценарный пульт для одного шоу

Время на прочтение6 мин
Охват и читатели12K

Лет 10 назад, когда я работал в банке в Сибири, был у нас отдел - малая автоматизация. Делали ПО для местных. Потом отдел расформировали и перешли на централизованное ПО.

Сейчас каждый может стать таким небольшим отделом малой автоматизации. Для себя, для личных нужд или для своих.

ИИ помогает делать проекты, которые раньше ты бы никогда не сделал. Или дорого по времени, или по ресурсам. А сейчас.... Давно уже не испытывал такой личной упоротости в маленькие проекты. Про один я уже писал, теперь расскажу про другой.

Итак, добро пожаловать на шоу!

Читать далее

Как разобрать и собрать заново видеоплатформу Okko, пока ей пользуются миллионы

Уровень сложностиСредний
Время на прочтение23 мин
Охват и читатели5.7K

Иногда легаси нельзя постепенно улучшить: его приходится разбирать, переосмысливать и заменять, пока основной продукт продолжает работать. Именно в такой ситуации оказались мы в Okko. Нам нужно было отделить воспроизведение от монолита, переписать транскодинг, заменить единовременно старую CMS и сохранить непрерывную работу онлайн-кинотеатра. В результате мы получили единую Видеоплатформу с документированными API, собственным кодированием 4K и HDR, управляемой аналитикой и возможностью разворачивать отдельные инсталляции для внешних партнёров.

Привет! Меня зовут Юлия, я представляю компанию Okko — один из крупнейших и старейших онлайн-кинотеатров России. Сервис появился в 2011 году и за это время вырос в сложный технологический продукт, ежедневно работающий с большими объемами видеоконтента и высокой нагрузкой.

В Okko я руковожу отделом discovery продуктов и сервисом «Видеоплатформа», и именно о нем пойдет речь в этой статье. Я расскажу, почему мы решили создать сервис, какие задачи перед собой поставили, с какими техническими и организационными вызовами столкнулись и как внедрили новую платформу без даунтайма основного продукта.

Читать далее
1
23 ...