Обновить
128K+

Обработка изображений *

Работаем с фото и видео

180,02
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Генератор музыкальных видео на Python: зерно раздуло файл в 13 раз, спектр врал на тишине, AV1 выиграл втрое

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.4K

Я отрендерил трёхминутный ролик из одной статичной картинки и получил файл на 472 МБ. Виновным оказалось плёночное зерно: шум амплитудой меньше 2 % шкалы, который почти не видно, умножает размер видео на тринадцать, а попиксельный — на тридцать три.

Разбираюсь, почему межкадровое сжатие ломается именно о шум, чиню это тремя способами (зерно блоками, другой кодек, синтез зерна в AV1) и меряю результат по VMAF: при одинаковом качестве x264 просит 15.2 Мбит/с, а AV1 — 4.4. Заодно ловлю собственный визуализатор спектра на вранье — на цифровой тишине он бодро плясал на 0.885 от полной высоты — и разбираю три грабли, включая пустую строку в argparse, которая вписала слово «использование» внутрь prog.

Читать далее

Новости

Дизайн интерьера нейросетью: 4 сервиса для ремонта по фото комнаты

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели3.8K

Чтобы сделать дизайн интерьера нейросетью, не обязательно сначала строить 3D-модель квартиры. Для быстрой визуальной примерки достаточно сфотографировать комнату, загрузить снимок в AI-сервис и объяснить, что нужно изменить: стиль, отделку, мебель, свет или отдельные предметы.

Короткий ответ: Nano Banana 2 лучше всего подошёл для свободного редизайна с сохранением исходного ракурса, Homestyler — для быстрого варианта по готовому стилю, а Planner 5D — для перехода от картинки к редактируемому плану. GPT Image 2 уверенно передал настроение, но заметно изменил геометрию комнаты. 

Читать далее

Как сделать коллаж из фото с помощью нейросети бесплатно: пошаговая инструкция

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели1.8K

Несколько удачных фотографий сами по себе ещё не становятся коллажем. Их нужно расположить на одном холсте, подобрать фон, выровнять размеры, добавить рамки и решить, какой снимок будет главным. В обычном редакторе всё это приходится делать вручную, а нейросеть может предложить готовую композицию по текстовому описанию.

В этой инструкции соберём классический фотоколлаж из четырёх женских портретов — каждый исходник останется самостоятельной карточкой, а нейросеть добавит компоновку, рамки, эффект бумажных слоёв и декоративные детали.

Читать далее

Ключ к безопасной идентификации: дайджест недели сканеров с технологиями Smart Engines

Время на прочтение9 мин
Охват и читатели8.4K

При работе с документами бизнесу необходимо решение, которое, с одной стороны, эффективно выявляет попытки мошенничества с использованием поддельных документов, а с другой — не замедляет обслуживание добросовестных клиентов. Сегодня наши технологии позволяют решать обе задачи одновременно.

Совместно с ГК «Интек» Smart Engines разработала линейку российских программно-аппаратных комплексов для автоматического ввода данных и проверки подлинности документов.

За Неделю сканеров мы рассказали и показывали, как сканеры Smart Engines помогают выявлять подделки, встраиваются в полностью автоматизированные процессы и применяются в банках, аэропортах, государственных учреждениях, системах контроля доступа и роботизированных комплексах. 

Собрали главное за Неделю сканеров в одном дайджесте👇

Читать далее

Как я собрал охранника для комнаты на YOLO и подключил его к Telegram

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели10K

Я живу один, и обычно знаю, кто может быть у меня дома. Но во время отъезда в голову иногда лезут неприятные мысли. «А вдруг кто-то всё-таки заходил, пока меня не было?». Это мог быть сосед, родственник или мастер, но без камеры остаётся только гадать.

И захотелось закрыть этот вопрос одним простеньким скриптом. Камера видит человека у двери, а в Telegram приходит сообщение и кадр. В процессе немного перестарался. Получился бот с поддержкой нескольких камер, тревогой, голосом, распознаванием лиц и возможностью вынести обработку данных на отдельный сервер.

В этой статье расскажу, зачем здесь вообще нужна YOLO и почему простого детектора движения оказалось мало. Как я проверял работоспособность проекта в реальных условиях, почему не отправляю в чат обычные фотографии людей и как организована приватность. А также как подключить телефон в качестве камеры и вынести тяжёлую обработку на удалённый сервер.

Смотреть дальше

Следующими можете быть вы: почему злоумышленники так любят облачные KYC‑сервисы

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели8K

Привет, Хабр! В начале сентября 2026 года на киберпреступном форуме появился сервис Nexus, предлагавший доступ к огромному массиву удостоверений личности граждан США и Канады. По утверждению его операторов, в базе находились сведения более чем о 170 млн человек: 153 млн водительских удостоверений, 10 млн ID-карт, 3 млн паспортов и 579 тыс. медицинских карт. В открытом доступе данные оказались из-за утечки компании IDScan.net, предоставляющей решения для проверки документов и личности. 

По данным IDScan.net, неавторизованная третья сторона могла получить доступ к информации, хранившейся в облачных аккаунтах, и скопировать ее. По состоянию на середину сентября расследование продолжается. Однако сам факт возможного копирования клиентских данных из облачной среды компания признала.

Эта статья не является разбором ошибок IDScan и тем более попыткой обвинить пострадавшую компанию. IDScan стала жертвой преступников, как до нее становились жертвами банки, государственные учреждения, медицинские организации и технологические корпорации. Но сейчас важно задать вопрос: почему у внешнего участника KYC-процесса вообще оказался массив документов, который можно было похитить?

Читать далее

Сжимаем флаги стран в 11 бит

Время на прочтение11 мин
Охват и читатели7.4K

Недавно я посмотрел интересное видео YouTube‑канала «Physics for the Birds». Это видео посвящено матрицам, но для объяснения некоторых операций с матрицами автор использовал флаги. Он показал, как можно разбить флаги по осям, чтобы представить их в виде матриц и сэкономить место на диске. В конце этот пример был применён к реальным матрицам и вычислениям с ними.

Однако это видео дало мне вдохновение: часто флаги бывают очень простыми — несколько разноцветных полос, распространённые элементы наподобие звезды, полумесяца или креста. Если использовать какую‑нибудь схему кодирования, то удастся ли описать флаг Франции

в формате «три полосы: синяя, белая, красная», чтобы декодеру и рендереру достаточно было всего нескольких бит? Как может выглядеть такое кодирование?

Я решил создать нечто подобное.

Читать далее

Как работать с GPT Image 2.5: что советует OpenAI и что уже выяснили пользователи Reddit

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели13K

OpenAI выпустила подробный гайд по промптам для GPT Image 2.5. Я прочитал его, а потом полез на Reddit смотреть, что происходит с этими рекомендациями в реальной жизни. Оказалось, пользователи уже успели не только проверить многие советы, но и найти несколько довольно полезных обходных путей.

Читать далее

Как мы засунули геометрию квартиры в обычный PNG

Уровень сложностиСложный
Время на прочтение22 мин
Охват и читатели8.1K

Туры Getfloorplan рендерятся в Unreal Engine с трассировкой пути, и в браузер уходит готовая панорама — по сути скриншот из игры. Грузится быстро и выглядит как фотография, но геометрии у картинки нет: курсору не во что попасть. А линейку в проптехе рано или поздно просят все — измерить комнату, проверить, пройдёт ли шкаф в проём.

В статье — как мы получили и картинку, и линейку. Рядом с панорамой рендерим карту глубины, по экранным координатам курсора восстанавливаем точку в мире и нормаль к поверхности. Расстояния упаковываем в обычный PNG: EXR, в котором карта рождается, браузер нативно не читает. Разбираем, чем за это платим: точностью, размером файла и парой грабель с CORS и цветовыми профилями.

Читать далее

Почему VLM галлюцинирует объекты, которых нет: zero-shot детекция дыма и решение с помощью промпта

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели5.9K

Как я попробовала решить задачу детекции огня и дыма без обучения, zero-shot детекцией на VLM. О том, как модель нашла «дым» на 70 % моих данных: рисовала боксы на машинах, знаках и светофорах, часто с confidence 0% и пояснением, что дыма нет. Почему bbox-формат вывода провоцирует ложные детекции и какое изменение промпта снизило долю ложных тревог с 70 % кадров до нуля при recall выше 80%.

Читать далее

Как я сделал ремастер «Том и Джерри» в 4K за два года: дубль два

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели105K

Два года назад я выпустил свой дебютный гайд по ремастерингу классических «Тома и Джерри» в 2K. Статья собрала сотню тысяч просмотров и сотни плюсов, но в комментариях меня справедливо разнесли профессионалы.

Картинка перестала мерцать, покрываться кучей царапин — взамен «эффект мёртвой долины» и вагоны нейросетевого мыла. Я решил, что мой любимый мультсериал детства достоин большего. За два года — пять повторных попыток; выстрадывание рабочих инструментов с последующим выбрасыванием тысяч часов завершённых наработок в мусорку. Новый старт и наконец финальная попытка.

Мяу-мяу

GPT Images 2.5: новая нейросеть для генерации изображений от OpenAI

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели10K

Как же за всем этим успевать?

За это время вышли ещё и обновлённый DeepSeek, и результаты по Навье-Стоксу. На этом фоне у GPT Images 2.5 были все шансы потеряться. Не потерялся.

Разве что реддит-модер ненадолго снёс официальный пост OpenAI из-за «вторника без картинок»...

Так вот, 8 сентября 2026 года OpenAI выпустила обновлённую версию своего генератора изображений – ChatGPT Images 2.5. Официально это не «тройка», хотя по объёму изменений можно было бы и замахнуться. Впрочем, это и в самом деле скорее «версия 2.0, доведённая до ума», чем революция. Но именно это доведение до ума и есть самое интересное.

Если в двух словах: генерация стала быстрее почти на 50%, редактирование – более хирургическим, а сама модель – заметно менее забывчивой в длинных диалогах. Дальше – details, details, details.

Спойлер: пеликана на этот анимировали в 96 кадрах и прокатили на велосипеде. Но обо всём по порядку.

Читать далее

Полтора месяца я учился закрашивать подписи. Рассказываю, что из этого не сработало

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели9.5K

Документы надо отдать наружу, персональные данные из них убрать: фамилии, телефоны, адреса, подписи. Всё в закрытом контуре, без интернета, на одной машине с одной видеокартой.

С фамилиями я разобрался за неделю. С подписями за полтора месяца, и половина времени ушла на то, чтобы похоронить очевидные решения.

Читать далее

Ближайшие события

Дендрохронология своими руками

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели20K

Посчитай кольца на пне и поймешь сколько лет дереву - это мы знаем с детства. Однако полезная информация, записанная в кольцах, не исчерпывается их количеством. Теплое и влажное лето оставляет широкое кольцо, а холодное и сухое - узкое. Это наблюдение дает две возможности: определять возраст археологических находок (дендрохронология) и восстанавливать климат прошлого (дендроклиматология).

Оба направления очень трудозатратны. Как правило, дендрохронология работает с цилиндрическими образцами древесины (кернами). Каждый керн полируется, затем годичные кольца измеряются с помощью микроскопа. Датировка требует значительного перекрытия между последовательностью годичных колец образца и установленной хронологией, составленной из многих других датированных образцов того же вида древесины в том же регионе. Наращивание такой хронологии - это работа, которая может занимать десятилетия.

Мне стало интересно, можно ли все это ускорить с помощью современного компьютерного зрения. Можно ли уместить всю дендрохронологию в одно приложение на смартфоне? Видимо нельзя, но вот что я узнал в процессе.

Читать далее

«Аниме-завод» открыт: выкладываю код конвейера, который сам режет эпизоды на Shorts

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели7.5K

За последнее время я написал три статьи про систему, которая превращает длинные видео в вертикальные клипы: общий обзор «аниме-завода», разбор виртуальной камеры с face tracking и рассказ о том, почему связка «транскрипт + LLM» почти всегда даёт мусор.

Комментарий, который повторялся под всеми тремя, был один и тот же: «покажи код».

Показываю.

github.com/ialakey/shorts-factory

Это витринная ветка большого приватного проекта: MVP, в котором оставлен полный путь «взял длинное видео → получил готовый вертикальный клип», а всё остальное вырезано. Ниже — что именно внутри, как код соотносится с тремя предыдущими статьями и что пришлось выкинуть.

Заглянуть на производство

Омнимодель для Алисы AI: как нам удалось подружить VLM и LLM

Время на прочтение16 мин
Охват и читатели10K

Ещё недавно Алиса отвечала на текст и на картинку будто двумя разными голосами. Под капотом и правда жили две генеративные модели: текстовая LLM и визуальная VLM, а между ними — стена из непрозрачного роутинга, разных форматов ответов и разной вёрстки. 

Почти год мы сводили их в одну омнимодель — такую, которая воспринимает текст и изображения как единое целое, без переключений за кадром. Получилось не всё и не сразу, но путь вышел поучительным, и в этой статье я хочу поделиться тем, что мы поняли про обучение таких моделей. Попутно — несколько неочевидных поворотов: почему за два года до этого та же затея разваливалась, что изменила MoE‑архитектура, почему омнипретрейн пришлось собирать с конца и почему один вид RL переезжает на большую модель легко, а другой рассыпается прямо на глазах.

Меня зовут Алексей Григорьев, я представляю большую команду разработки омнимодели Яндекса. Вместе с моим коллегой Данилой Кашиным я расскажу про все технические грабли не со стороны наблюдателя, а как их непосредственный собиратель. Но рассказывать я буду с акцентом не на красивом замысле, а на самой болезненной части — алайнменте.

Читать далее

Вверх ногами: как научить OCR понимать, что документ перевернут

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели9.5K

Всем привет! 

В своих постах мы часто пишем о разных этапах систем распознавания документов (например, тут и тут). Настало время рассказать о еще одной задаче (и нашем решении для нее), которая часто опускается из подробного рассмотрения.

Наверняка каждый из вас хоть раз клал лист в сканер перевернутым (ну или вы очень везучи). Человек в случае такой оказии может повернуть изображение в редакторе или немного повертеть головой, а что делать системе распознавания? 

Просто взять и проигнорировать перевернутые изображения нельзя, ведь при обработке больших объемов данных, например, цифровизации архивов, таких изображений может быть множество. При этом попытки запустить OCR-модели на перевернутых строках обычно заканчиваются плачевно – мы получаем случайные последовательности символов.

Давайте разбираться по порядку!

Читать далее

Борьба за каждую десятую секунды: как мы ускоряли цветокоррекцию на планшете

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели12K

Сделать фотографию ярче несложно. Сделать это естественно и быстро прямо на планшете — уже интереснее. Именно такую задачу мы решали для камеры KVADRA_T. Нужно было усилить цвета и контраст, не получить перенасыщенную картинку или артефакты и при этом обработать полноразмерный снимок достаточно быстро, чтобы пользователь практически не замечал задержки.

Привет, Хабр! Меня зовут Денис Смирнов, я старший инженер по разработке ПО искусственного интеллекта KVADRA AI в YADRO. В этой статье расскажу, как мы искали нейросеть для автоматической цветокоррекции на планшете KVADRA_T, почему выбрали MSLTNet и как довели ее до работы на реальном устройстве.

Читать далее

Беспилотный трамвай в Петербурге: что изменилось за 4 года промышленной эксплуатации

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели99K

Шесть лет назад мы уже писали на Хабре про беспилотный трамвай — тогда это был один экспериментальный вагон, который иногда выезжал на маршрут в Москве, а автопилот тестировался в основном на закрытой территории. С тех пор много воды утекло — в буквальном смысле, учитывая петербургскую погоду.

Стоит сразу оговориться: та статья была про московский проект, и он на самом деле не имеет почти ничего общего с тем, что сейчас работает в Петербурге. Питерский проект стартовал в 2022 году фактически с нуля — с сильно обновленными составом команды, парка трамваев, другими протоколами и, чего уж там, без 2D‑детекции и лидара, которые использовались в Москве. Поэтому эта статья — не столько «было/стало» одной и той же системы, сколько рассказ о том, куда доросла история, начавшаяся почти с чистого листа четыре года назад.

Читать далее

Я распознал паспорт. Чем я могу это доказать?

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели7.2K

Система работает и разбирает документы. Претензия у меня к ней одна, зато неустранимая изнутри: я не могу доказать ни одно из полученных значений.

Ниже — опись. По каждому полю: как оно читается, чем проверяется и чего эта проверка стоит. Последняя строка описи самая интересная, потому что напротив неё не стоит ничего.

Читать далее
1
23 ...