Обновить
128K+

Обработка изображений *

Работаем с фото и видео

107,53
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Периферийное распознавание — будущее работы с документами: дайджест недели Smart Document Engine

Время на прочтение10 мин
Охват и читатели6.2K

В бизнесе важна каждая минута. Но если документ сначала нужно передать на обработку, проверить его и только потом внести данные в учетную систему, между реальной операцией и ее отражением в системе возникает разрыв. Все это время собственник не видит актуальной картины и вынужден принимать решения на основе уже устаревшей информации. Поэтому распознавать документы нужно непосредственно там и тогда, где происходит операция.

Эту задачу решает периферийное распознавание, реализованное в Smart Document Engine. Платформа позволяет обрабатывать документы прямо в точке их появления — например, на складе или рабочем месте сотрудника — с помощью смартфона, планшета или другого устройства и сразу передавать готовые данные в корпоративные системы. В результате бизнес получает актуальную картину происходящего, а разрыв между реальной операцией и ее отражением в учете сокращается до минимума.

Собрали главное за Неделю Smart Document Engine в одном дайджесте 👇

Читать далее

Flow Matching: обучение и дистилляция

Уровень сложностиСложный
Время на прочтение29 мин
Охват и читатели6.6K

Flow Matching — один из главных подходов к генерации изображений. Его используют, например, Stable Diffusion 3.5 и FLUX.2.

Но есть нюанс: чтобы сгенерировать одну картинку, модель приходится запускать десятки, а иногда и сотни раз.

В новой статье разбираемся, как устроен Flow Matching и как дистиллировать обученную модель в быстрый одношаговый генератор 🏎

Разберём, что такое Flow Matching и при чём здесь векторные поля 🌾, почему генерация требует множества шагов и чем это мешает, а также как устроена дистилляция в одношаговый генератор — и при чём тут игра двух моделей 🎲.

P. S. Будет много интуиции, математики и практических деталей обучения 🧠

Читать далее

Томограф в чемодане: одна съемка от начала до конца (часть 2)

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели9.3K

В первой части мы, исследователи Smart Engines, представили наш портативный томограф и рассказали про его устройство. Судя по вопросам после докладов, самой убедительной части в той истории как раз и не хватало: а как это выглядит вживую? Поэтому сегодня никаких аксиальных коллинеаций. Мы включили запись на телефоне и сняли одно исследование целиком, от первого кадра до 3D‑картинки.

Читать далее

Pillow вместо Photoshop: как за 20 строк кода делать мультяшные и Minecraft-текстуры

Время на прочтение8 мин
Охват и читатели6.7K

Изучая Adobe Photoshop (в частности любимый мною CS6 – так как запросто устанавливается на любой чайник), программы по монтажу (VSDC Video Editor, Wondershare Filmora, Movavi и Capcut), и другого типа редакторы мне не могла не прийти мысль об автоматизации. Как минимум потому, что я ленивый, а в общем и целом – для автоматического создания материалов и текстур. Создавая игры любой разработчик уткнётся носом в одну простую вещь: у него есть готовый и расписанный лор, персонажи и их дизайны, может даже саундтрек и примеры кода, но нет второстепенных текстур. Под второстепенными текстурами я имею в виду то, что не влияет на лор, но влияет на игровой опыт (к примеру, блок земли в Minecraft не поможет нам убить дракона, но данная текстура жизненно необходима игре).

Следовательно, нужно было научиться автоматизировать процессы обработки графических материалов. Последовательная обработка подразумевает код, а автоматизация – наличие функций. Желательно было всё это оформить на Python. Идея понятна: хочу обрабатывать визуал таким образом, чтобы целый ряд фильтров и сопутствующих преобразований накладывались по одному клику, без упорного затирания UI Photoshop до дыр. И что делать? Здесь на помощь приходит один известный форк PIL (Python Imaging Library) под названием Python Pillow.

Как оказалось, сообщество Python уже давно задумалось над тем, как можно через код работать с графикой. PIL – древняя библиотека для работы с растровой графикой, поддержка которой давно прекращена. Потому на её основе возник форк под названием Pillow, о котором сейчас и поговорим. Стоит отметить, что на мой субъективный взгляд Pillow лучше всего работает именно с форматом PNG, потому рассматривать работу библиотеки с файлами иных расширений мы не станем, по крайней мере в этой статье. Также отмечу, что это не совсем образовательная статья, а скорее Roadmap, потому что доступ к каким угодно учебным материалам сегодня есть из любой точки земного шара, и гораздо важнее поговорить именно про последовательность действий при освоении данной технологии – какой она должна быть, чтобы иметь достаточное понимание для выполнения определённого рода задач.

Читать далее

Как мы автоматизировали контроль сборки заказов для сети ресторанов быстрого питания

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.5K

Рассказываем о кейсе внедрения компьютерного зрения в ресторане быстрого питания. Ценность кейса для бизнеса: запись с камеры длиной в 24 часа превращается в 30-секундный эпизод, который проверяющий может разобрать за минуту.

В ресторане быстрого питания есть два источника данных: касса и камера. Касса знает, что продали. Камера видит, что положили на поднос. Не всегда касса и камера фиксируют одно и то же. 

Из‑за этого разрыва возникает масса неприятностей: недостачи, жалобы покупателей на забытые блюда и споры о реальном времени обслуживания. Получается, что бизнес QSR (Quick Service Restaurants) становится не таким уж быстрым и гостеприимным, как должен быть.

Для нашего клиента из QSR мы собрали систему, которая связывает чеки с видеопотоком и нарезает для проверяющего готовые эпизоды с ошибками. 

По причине NDA, все фотографии и схемы в статье созданы искусственно и служат только примерами: это не съёмка ресторана заказчика и не снимки рабочего интерфейса. Названия блюд, номера заказов и время на иллюстрациях условные. Числовые результаты испытаний взяты из материалов проекта.

Читать далее

Smart Engines представляет: портативный компьютерный томограф в чемодане (Часть 1)

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели6.9K

Сегодня мы бы хотели представить сообществу Хабра футуристичную технологию, в которую за последние годы вложили все силы и душу. Речь пойдет о портативной томографии.

Рассказываем, как мы в Smart Engines  создали первый в мире носимый томограф свободного позиционирования. Устройство весит менее 5 кг, помещается в чемодан, его можно фактически держать в руках и при этом получать полноценную 3D‑реконструкцию исследуемого объекта — без привычного для КТ массивного кольца и сложной стационарной механики. Благодаря этому нам удалось реализовать принцип «не пациент идет к томографу, а томограф — к пациенту».

Читать далее

Olympus E-450 — зеркалка‑малышка

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели19K

Я люблю фотографию и люблю фототехнику. Мне нравится снимать на всякое цифровое старьё и изучать линейку фотокамер фирмы Olympus. Пару лет назад на известной онлайн-барахолке попался лот — устаревшая цифрозеркалка со штатным зумом и фотосумкой за небольшие деньги, сравнимые с суммой разовой покупки в продуктовом магазине. Конечно же, я в тот же день поехал за ней. Встретил радушного мужчину моего возраста, он мне всё передал, и я, довольный, сразу пошёл снимать.

Камера была в неплохом состоянии, но объектив и байонет были залиты брызгами чего-то сладкого. Эта жидкость высохла и склеила части байонета и кольцо зуммирования. Но я всё размочил спиртовым раствором и удалил без остатка и проблем. Хочу с вами поделиться опытом фотосъёмки на данное чудо техники.

Читать далее

Генератор музыкальных видео на Python: зерно раздуло файл в 13 раз, спектр врал на тишине, AV1 выиграл втрое

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели8.4K

Я отрендерил трёхминутный ролик из одной статичной картинки и получил файл на 472 МБ. Виновным оказалось плёночное зерно: шум амплитудой меньше 2 % шкалы, который почти не видно, умножает размер видео на тринадцать, а попиксельный — на тридцать три.

Разбираюсь, почему межкадровое сжатие ломается именно о шум, чиню это тремя способами (зерно блоками, другой кодек, синтез зерна в AV1) и меряю результат по VMAF: при одинаковом качестве x264 просит 15.2 Мбит/с, а AV1 — 4.4. Заодно ловлю собственный визуализатор спектра на вранье — на цифровой тишине он бодро плясал на 0.885 от полной высоты — и разбираю три грабли, включая пустую строку в argparse, которая вписала слово «использование» внутрь prog.

Читать далее

Дизайн интерьера нейросетью: 4 сервиса для ремонта по фото комнаты

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели6K

Чтобы сделать дизайн интерьера нейросетью, не обязательно сначала строить 3D-модель квартиры. Для быстрой визуальной примерки достаточно сфотографировать комнату, загрузить снимок в AI-сервис и объяснить, что нужно изменить: стиль, отделку, мебель, свет или отдельные предметы.

Короткий ответ: Nano Banana 2 лучше всего подошёл для свободного редизайна с сохранением исходного ракурса, Homestyler — для быстрого варианта по готовому стилю, а Planner 5D — для перехода от картинки к редактируемому плану. GPT Image 2 уверенно передал настроение, но заметно изменил геометрию комнаты. 

Читать далее

Как сделать коллаж из фото с помощью нейросети бесплатно: пошаговая инструкция

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели2.7K

Несколько удачных фотографий сами по себе ещё не становятся коллажем. Их нужно расположить на одном холсте, подобрать фон, выровнять размеры, добавить рамки и решить, какой снимок будет главным. В обычном редакторе всё это приходится делать вручную, а нейросеть может предложить готовую композицию по текстовому описанию.

В этой инструкции соберём классический фотоколлаж из четырёх женских портретов — каждый исходник останется самостоятельной карточкой, а нейросеть добавит компоновку, рамки, эффект бумажных слоёв и декоративные детали.

Читать далее

Ключ к безопасной идентификации: дайджест недели сканеров с технологиями Smart Engines

Время на прочтение9 мин
Охват и читатели8.9K

При работе с документами бизнесу необходимо решение, которое, с одной стороны, эффективно выявляет попытки мошенничества с использованием поддельных документов, а с другой — не замедляет обслуживание добросовестных клиентов. Сегодня наши технологии позволяют решать обе задачи одновременно.

Совместно с ГК «Интек» Smart Engines разработала линейку российских программно-аппаратных комплексов для автоматического ввода данных и проверки подлинности документов.

За Неделю сканеров мы рассказали и показывали, как сканеры Smart Engines помогают выявлять подделки, встраиваются в полностью автоматизированные процессы и применяются в банках, аэропортах, государственных учреждениях, системах контроля доступа и роботизированных комплексах. 

Собрали главное за Неделю сканеров в одном дайджесте👇

Читать далее

Как я собрал охранника для комнаты на YOLO и подключил его к Telegram

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели12K

Я живу один, и обычно знаю, кто может быть у меня дома. Но во время отъезда в голову иногда лезут неприятные мысли. «А вдруг кто-то всё-таки заходил, пока меня не было?». Это мог быть сосед, родственник или мастер, но без камеры остаётся только гадать.

И захотелось закрыть этот вопрос одним простеньким скриптом. Камера видит человека у двери, а в Telegram приходит сообщение и кадр. В процессе немного перестарался. Получился бот с поддержкой нескольких камер, тревогой, голосом, распознаванием лиц и возможностью вынести обработку данных на отдельный сервер.

В этой статье расскажу, зачем здесь вообще нужна YOLO и почему простого детектора движения оказалось мало. Как я проверял работоспособность проекта в реальных условиях, почему не отправляю в чат обычные фотографии людей и как организована приватность. А также как подключить телефон в качестве камеры и вынести тяжёлую обработку на удалённый сервер.

Смотреть дальше

Следующими можете быть вы: почему злоумышленники так любят облачные KYC‑сервисы

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели8.4K

Привет, Хабр! В начале сентября 2026 года на киберпреступном форуме появился сервис Nexus, предлагавший доступ к огромному массиву удостоверений личности граждан США и Канады. По утверждению его операторов, в базе находились сведения более чем о 170 млн человек: 153 млн водительских удостоверений, 10 млн ID-карт, 3 млн паспортов и 579 тыс. медицинских карт. В открытом доступе данные оказались из-за утечки компании IDScan.net, предоставляющей решения для проверки документов и личности. 

По данным IDScan.net, неавторизованная третья сторона могла получить доступ к информации, хранившейся в облачных аккаунтах, и скопировать ее. По состоянию на середину сентября расследование продолжается. Однако сам факт возможного копирования клиентских данных из облачной среды компания признала.

Эта статья не является разбором ошибок IDScan и тем более попыткой обвинить пострадавшую компанию. IDScan стала жертвой преступников, как до нее становились жертвами банки, государственные учреждения, медицинские организации и технологические корпорации. Но сейчас важно задать вопрос: почему у внешнего участника KYC-процесса вообще оказался массив документов, который можно было похитить?

Читать далее

Ближайшие события

Сжимаем флаги стран в 11 бит

Время на прочтение11 мин
Охват и читатели7.9K

Недавно я посмотрел интересное видео YouTube‑канала «Physics for the Birds». Это видео посвящено матрицам, но для объяснения некоторых операций с матрицами автор использовал флаги. Он показал, как можно разбить флаги по осям, чтобы представить их в виде матриц и сэкономить место на диске. В конце этот пример был применён к реальным матрицам и вычислениям с ними.

Однако это видео дало мне вдохновение: часто флаги бывают очень простыми — несколько разноцветных полос, распространённые элементы наподобие звезды, полумесяца или креста. Если использовать какую‑нибудь схему кодирования, то удастся ли описать флаг Франции

в формате «три полосы: синяя, белая, красная», чтобы декодеру и рендереру достаточно было всего нескольких бит? Как может выглядеть такое кодирование?

Я решил создать нечто подобное.

Читать далее

Как работать с GPT Image 2.5: что советует OpenAI и что уже выяснили пользователи Reddit

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели14K

OpenAI выпустила подробный гайд по промптам для GPT Image 2.5. Я прочитал его, а потом полез на Reddit смотреть, что происходит с этими рекомендациями в реальной жизни. Оказалось, пользователи уже успели не только проверить многие советы, но и найти несколько довольно полезных обходных путей.

Читать далее

Как мы засунули геометрию квартиры в обычный PNG

Уровень сложностиСложный
Время на прочтение22 мин
Охват и читатели8.4K

Туры Getfloorplan рендерятся в Unreal Engine с трассировкой пути, и в браузер уходит готовая панорама — по сути скриншот из игры. Грузится быстро и выглядит как фотография, но геометрии у картинки нет: курсору не во что попасть. А линейку в проптехе рано или поздно просят все — измерить комнату, проверить, пройдёт ли шкаф в проём.

В статье — как мы получили и картинку, и линейку. Рядом с панорамой рендерим карту глубины, по экранным координатам курсора восстанавливаем точку в мире и нормаль к поверхности. Расстояния упаковываем в обычный PNG: EXR, в котором карта рождается, браузер нативно не читает. Разбираем, чем за это платим: точностью, размером файла и парой грабель с CORS и цветовыми профилями.

Читать далее

Почему VLM галлюцинирует объекты, которых нет: zero-shot детекция дыма и решение с помощью промпта

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели6K

Как я попробовала решить задачу детекции огня и дыма без обучения, zero-shot детекцией на VLM. О том, как модель нашла «дым» на 70 % моих данных: рисовала боксы на машинах, знаках и светофорах, часто с confidence 0% и пояснением, что дыма нет. Почему bbox-формат вывода провоцирует ложные детекции и какое изменение промпта снизило долю ложных тревог с 70 % кадров до нуля при recall выше 80%.

Читать далее

Как я сделал ремастер «Том и Джерри» в 4K за два года: дубль два

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели110K

Два года назад я выпустил свой дебютный гайд по ремастерингу классических «Тома и Джерри» в 2K. Статья собрала сотню тысяч просмотров и сотни плюсов, но в комментариях меня справедливо разнесли профессионалы.

Картинка перестала мерцать, покрываться кучей царапин — взамен «эффект мёртвой долины» и вагоны нейросетевого мыла. Я решил, что мой любимый мультсериал детства достоин большего. За два года — пять повторных попыток; выстрадывание рабочих инструментов с последующим выбрасыванием тысяч часов завершённых наработок в мусорку. Новый старт и наконец финальная попытка.

Мяу-мяу

GPT Images 2.5: новая нейросеть для генерации изображений от OpenAI

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели11K

Как же за всем этим успевать?

За это время вышли ещё и обновлённый DeepSeek, и результаты по Навье-Стоксу. На этом фоне у GPT Images 2.5 были все шансы потеряться. Не потерялся.

Разве что реддит-модер ненадолго снёс официальный пост OpenAI из-за «вторника без картинок»...

Так вот, 8 сентября 2026 года OpenAI выпустила обновлённую версию своего генератора изображений – ChatGPT Images 2.5. Официально это не «тройка», хотя по объёму изменений можно было бы и замахнуться. Впрочем, это и в самом деле скорее «версия 2.0, доведённая до ума», чем революция. Но именно это доведение до ума и есть самое интересное.

Если в двух словах: генерация стала быстрее почти на 50%, редактирование – более хирургическим, а сама модель – заметно менее забывчивой в длинных диалогах. Дальше – details, details, details.

Спойлер: пеликана на этот анимировали в 96 кадрах и прокатили на велосипеде. Но обо всём по порядку.

Читать далее

Полтора месяца я учился закрашивать подписи. Рассказываю, что из этого не сработало

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели9.6K

Документы надо отдать наружу, персональные данные из них убрать: фамилии, телефоны, адреса, подписи. Всё в закрытом контуре, без интернета, на одной машине с одной видеокартой.

С фамилиями я разобрался за неделю. С подписями за полтора месяца, и половина времени ушла на то, чтобы похоронить очевидные решения.

Читать далее