Обновить
128K+

Обработка изображений *

Работаем с фото и видео

191,52
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Компьютерное зрение для контроля качества на линии: гречка, брак и бесплатная платформа для разметки и обучения модели

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели9.2K

Компьютерное зрение для контроля качества на линии: гречка, брак и бесплатная платформа для разметки и обучения модели. Отдал заказчику один HTML-файл. Модель внутри, интернет не нужен.

Читать далее

Новости

Экспресс-лаборатория внутри комбайна: как научить технику оценивать зерно каждые 6 секунд

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели9K

Во время уборки зерно в комбайне проходит долгий путь: от жатки через барабан, решётку и домолот до зернового элеватора и бункера. Весь этот путь нужен не просто так, а для того, чтобы максимально очистить зерно и при этом сохранить его целостность, ведь от этого напрямую зависит цена продажи. Но узнать, насколько хорошо прошла очистка, обычно можно только постфактум: на элеваторе или в лаборатории, когда повлиять на результат уборки уже нельзя.

Рассказываю, как мы создали систему Crop Control, которая доустанавливается на комбайн (даже если раньше на нём не было никакой автоматики) и позволяет мониторить качество и количество зерна прямо во время движения. Мониторинг количества нужен, чтобы понимать, сколько урожая собрано с конкретного поля: урожайность - одна из ключевых метрик оценки продуктивности уборочной кампании в целом. А мониторинг качества нужен для того, чтобы вовремя повлиять на собираемую продукцию, например скорректировать настройки комбайна, и не дать испортить уже намолоченное зерно.

Читать далее

Pillow для обработки изображений: все фильтры от А до Я

Время на прочтение8 мин
Охват и читатели11K

Это вторая часть разбора библиотеки Python Pillow. В прошлой статье был сделан упор на общее направление и примеры, теперь же давайте разберём конкретный инструментарий: отвечу на вопросы, что вообще можно использовать и каким образом. Можно назвать это так: прошлая статья – введение в ремонт, эта – хранилище инструментов. Стоит учесть, что всю более подробную информацию можно найти в сети, а с целями (зачем, для чего) придётся определяться самим. Впрочем, это и так очевидно.

Вся суть, благодаря которой нога моя ступила на территорию Pillow, можно описать следующим образом: желание автоматизации однотипной обработки нескольких файлов подряд. Через Photoshop можно обработать одно фото, но если у вас есть определённый шаблон, придётся долго возиться с каждым отдельным изображением. Нужен был инструмент, который был бы достаточно гибким, чтобы при желании и менять параметры, и создавать из последовательностей – функции. Таким инструментом оказалась библиотека Python, форк PIL, – Python Pillow.

Как и в программах для редактирования визуальных объектов данная библиотека работает по принципу фильтров: есть определённые фильтры, которые делают что-то с изображением, и можно задать определённое значение таким образом, чтобы указать программе, насколько сильно стоит это применить. И да, абсолютно весь тот шикарный визуал, который вы когда-либо видели в сети, был обработан, описан и создан именно по такой цепочке: ввод, наложение некоторых фильтров в каком-то соотношении, вывод.

Разобьём инструментарий на типы: равно как и отвёртки лежат отдельно от болтов... В Pillow есть три типа фильтров: готовые пресеты (те, что не требуют указания дополнительных значений), регулируемые фильтры (те, что требуют указания), и «ImageEnhance» (для регуляции контраста, яркости, резкости). Первые два типа объединены в единое семейство: «ImageFilter». Рассмотрим сначала их.

Читать далее

Конвейеры формирования изображений. Часть 3: Программная обработка изображения

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7K

Всем привет! Это Егор Ершов, руководитель группы «Цветовая вычислительная фотография» в AIRI и заведующий сектором репродукции и синтеза цвета ИППИ РАН, и мы продолжаем разговаривать про конвейеры формирования изображений. Такие конвейеры запускаются каждый раз, когда вы нажимаете на кнопку спуска вашей камеры.

В первых двух статьях этого цикла мы в подробностях разобрали подготовку сырого RAW‑изображения: почитать про соответствующие шаги можно здесь и здесь. Их продуктом является картинка, приведённая к пространству стандартного наблюдателя. Это отправная точка для последующей обработки уже на программном уровне. Сегодня мы разберёмся, что происходит с ним дальше вплоть до сохранения изображения в памяти устройства в рамках того или иного стандарта сжатия — в качестве примера мы рассмотрим JPEG.

Приятного чтения!

Читать далее

Периферийное распознавание — будущее работы с документами: дайджест недели Smart Document Engine

Время на прочтение10 мин
Охват и читатели5.9K

В бизнесе важна каждая минута. Но если документ сначала нужно передать на обработку, проверить его и только потом внести данные в учетную систему, между реальной операцией и ее отражением в системе возникает разрыв. Все это время собственник не видит актуальной картины и вынужден принимать решения на основе уже устаревшей информации. Поэтому распознавать документы нужно непосредственно там и тогда, где происходит операция.

Эту задачу решает периферийное распознавание, реализованное в Smart Document Engine. Платформа позволяет обрабатывать документы прямо в точке их появления — например, на складе или рабочем месте сотрудника — с помощью смартфона, планшета или другого устройства и сразу передавать готовые данные в корпоративные системы. В результате бизнес получает актуальную картину происходящего, а разрыв между реальной операцией и ее отражением в учете сокращается до минимума.

Собрали главное за Неделю Smart Document Engine в одном дайджесте 👇

Читать далее

Flow Matching: обучение и дистилляция

Уровень сложностиСложный
Время на прочтение29 мин
Охват и читатели6.2K

Flow Matching — один из главных подходов к генерации изображений. Его используют, например, Stable Diffusion 3.5 и FLUX.2.

Но есть нюанс: чтобы сгенерировать одну картинку, модель приходится запускать десятки, а иногда и сотни раз.

В новой статье разбираемся, как устроен Flow Matching и как дистиллировать обученную модель в быстрый одношаговый генератор 🏎

Разберём, что такое Flow Matching и при чём здесь векторные поля 🌾, почему генерация требует множества шагов и чем это мешает, а также как устроена дистилляция в одношаговый генератор — и при чём тут игра двух моделей 🎲.

P. S. Будет много интуиции, математики и практических деталей обучения 🧠

Читать далее

Томограф в чемодане: одна съемка от начала до конца (часть 2)

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели9K

В первой части мы, исследователи Smart Engines, представили наш портативный томограф и рассказали про его устройство. Судя по вопросам после докладов, самой убедительной части в той истории как раз и не хватало: а как это выглядит вживую? Поэтому сегодня никаких аксиальных коллинеаций. Мы включили запись на телефоне и сняли одно исследование целиком, от первого кадра до 3D‑картинки.

Читать далее

Pillow вместо Photoshop: как за 20 строк кода делать мультяшные и Minecraft-текстуры

Время на прочтение8 мин
Охват и читатели6.4K

Изучая Adobe Photoshop (в частности любимый мною CS6 – так как запросто устанавливается на любой чайник), программы по монтажу (VSDC Video Editor, Wondershare Filmora, Movavi и Capcut), и другого типа редакторы мне не могла не прийти мысль об автоматизации. Как минимум потому, что я ленивый, а в общем и целом – для автоматического создания материалов и текстур. Создавая игры любой разработчик уткнётся носом в одну простую вещь: у него есть готовый и расписанный лор, персонажи и их дизайны, может даже саундтрек и примеры кода, но нет второстепенных текстур. Под второстепенными текстурами я имею в виду то, что не влияет на лор, но влияет на игровой опыт (к примеру, блок земли в Minecraft не поможет нам убить дракона, но данная текстура жизненно необходима игре).

Следовательно, нужно было научиться автоматизировать процессы обработки графических материалов. Последовательная обработка подразумевает код, а автоматизация – наличие функций. Желательно было всё это оформить на Python. Идея понятна: хочу обрабатывать визуал таким образом, чтобы целый ряд фильтров и сопутствующих преобразований накладывались по одному клику, без упорного затирания UI Photoshop до дыр. И что делать? Здесь на помощь приходит один известный форк PIL (Python Imaging Library) под названием Python Pillow.

Как оказалось, сообщество Python уже давно задумалось над тем, как можно через код работать с графикой. PIL – древняя библиотека для работы с растровой графикой, поддержка которой давно прекращена. Потому на её основе возник форк под названием Pillow, о котором сейчас и поговорим. Стоит отметить, что на мой субъективный взгляд Pillow лучше всего работает именно с форматом PNG, потому рассматривать работу библиотеки с файлами иных расширений мы не станем, по крайней мере в этой статье. Также отмечу, что это не совсем образовательная статья, а скорее Roadmap, потому что доступ к каким угодно учебным материалам сегодня есть из любой точки земного шара, и гораздо важнее поговорить именно про последовательность действий при освоении данной технологии – какой она должна быть, чтобы иметь достаточное понимание для выполнения определённого рода задач.

Читать далее

Как мы автоматизировали контроль сборки заказов для сети ресторанов быстрого питания

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.4K

Рассказываем о кейсе внедрения компьютерного зрения в ресторане быстрого питания. Ценность кейса для бизнеса: запись с камеры длиной в 24 часа превращается в 30-секундный эпизод, который проверяющий может разобрать за минуту.

В ресторане быстрого питания есть два источника данных: касса и камера. Касса знает, что продали. Камера видит, что положили на поднос. Не всегда касса и камера фиксируют одно и то же. 

Из‑за этого разрыва возникает масса неприятностей: недостачи, жалобы покупателей на забытые блюда и споры о реальном времени обслуживания. Получается, что бизнес QSR (Quick Service Restaurants) становится не таким уж быстрым и гостеприимным, как должен быть.

Для нашего клиента из QSR мы собрали систему, которая связывает чеки с видеопотоком и нарезает для проверяющего готовые эпизоды с ошибками. 

По причине NDA, все фотографии и схемы в статье созданы искусственно и служат только примерами: это не съёмка ресторана заказчика и не снимки рабочего интерфейса. Названия блюд, номера заказов и время на иллюстрациях условные. Числовые результаты испытаний взяты из материалов проекта.

Читать далее

Smart Engines представляет: портативный компьютерный томограф в чемодане (Часть 1)

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели6.6K

Сегодня мы бы хотели представить сообществу Хабра футуристичную технологию, в которую за последние годы вложили все силы и душу. Речь пойдет о портативной томографии.

Рассказываем, как мы в Smart Engines  создали первый в мире носимый томограф свободного позиционирования. Устройство весит менее 5 кг, помещается в чемодан, его можно фактически держать в руках и при этом получать полноценную 3D‑реконструкцию исследуемого объекта — без привычного для КТ массивного кольца и сложной стационарной механики. Благодаря этому нам удалось реализовать принцип «не пациент идет к томографу, а томограф — к пациенту».

Читать далее

Olympus E-450 — зеркалка‑малышка

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели19K

Я люблю фотографию и люблю фототехнику. Мне нравится снимать на всякое цифровое старьё и изучать линейку фотокамер фирмы Olympus. Пару лет назад на известной онлайн-барахолке попался лот — устаревшая цифрозеркалка со штатным зумом и фотосумкой за небольшие деньги, сравнимые с суммой разовой покупки в продуктовом магазине. Конечно же, я в тот же день поехал за ней. Встретил радушного мужчину моего возраста, он мне всё передал, и я, довольный, сразу пошёл снимать.

Камера была в неплохом состоянии, но объектив и байонет были залиты брызгами чего-то сладкого. Эта жидкость высохла и склеила части байонета и кольцо зуммирования. Но я всё размочил спиртовым раствором и удалил без остатка и проблем. Хочу с вами поделиться опытом фотосъёмки на данное чудо техники.

Читать далее

Генератор музыкальных видео на Python: зерно раздуло файл в 13 раз, спектр врал на тишине, AV1 выиграл втрое

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели8.3K

Я отрендерил трёхминутный ролик из одной статичной картинки и получил файл на 472 МБ. Виновным оказалось плёночное зерно: шум амплитудой меньше 2 % шкалы, который почти не видно, умножает размер видео на тринадцать, а попиксельный — на тридцать три.

Разбираюсь, почему межкадровое сжатие ломается именно о шум, чиню это тремя способами (зерно блоками, другой кодек, синтез зерна в AV1) и меряю результат по VMAF: при одинаковом качестве x264 просит 15.2 Мбит/с, а AV1 — 4.4. Заодно ловлю собственный визуализатор спектра на вранье — на цифровой тишине он бодро плясал на 0.885 от полной высоты — и разбираю три грабли, включая пустую строку в argparse, которая вписала слово «использование» внутрь prog.

Читать далее

Дизайн интерьера нейросетью: 4 сервиса для ремонта по фото комнаты

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели5.5K

Чтобы сделать дизайн интерьера нейросетью, не обязательно сначала строить 3D-модель квартиры. Для быстрой визуальной примерки достаточно сфотографировать комнату, загрузить снимок в AI-сервис и объяснить, что нужно изменить: стиль, отделку, мебель, свет или отдельные предметы.

Короткий ответ: Nano Banana 2 лучше всего подошёл для свободного редизайна с сохранением исходного ракурса, Homestyler — для быстрого варианта по готовому стилю, а Planner 5D — для перехода от картинки к редактируемому плану. GPT Image 2 уверенно передал настроение, но заметно изменил геометрию комнаты. 

Читать далее

Ближайшие события

Как сделать коллаж из фото с помощью нейросети бесплатно: пошаговая инструкция

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели2.5K

Несколько удачных фотографий сами по себе ещё не становятся коллажем. Их нужно расположить на одном холсте, подобрать фон, выровнять размеры, добавить рамки и решить, какой снимок будет главным. В обычном редакторе всё это приходится делать вручную, а нейросеть может предложить готовую композицию по текстовому описанию.

В этой инструкции соберём классический фотоколлаж из четырёх женских портретов — каждый исходник останется самостоятельной карточкой, а нейросеть добавит компоновку, рамки, эффект бумажных слоёв и декоративные детали.

Читать далее

Ключ к безопасной идентификации: дайджест недели сканеров с технологиями Smart Engines

Время на прочтение9 мин
Охват и читатели8.8K

При работе с документами бизнесу необходимо решение, которое, с одной стороны, эффективно выявляет попытки мошенничества с использованием поддельных документов, а с другой — не замедляет обслуживание добросовестных клиентов. Сегодня наши технологии позволяют решать обе задачи одновременно.

Совместно с ГК «Интек» Smart Engines разработала линейку российских программно-аппаратных комплексов для автоматического ввода данных и проверки подлинности документов.

За Неделю сканеров мы рассказали и показывали, как сканеры Smart Engines помогают выявлять подделки, встраиваются в полностью автоматизированные процессы и применяются в банках, аэропортах, государственных учреждениях, системах контроля доступа и роботизированных комплексах. 

Собрали главное за Неделю сканеров в одном дайджесте👇

Читать далее

Как я собрал охранника для комнаты на YOLO и подключил его к Telegram

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели12K

Я живу один, и обычно знаю, кто может быть у меня дома. Но во время отъезда в голову иногда лезут неприятные мысли. «А вдруг кто-то всё-таки заходил, пока меня не было?». Это мог быть сосед, родственник или мастер, но без камеры остаётся только гадать.

И захотелось закрыть этот вопрос одним простеньким скриптом. Камера видит человека у двери, а в Telegram приходит сообщение и кадр. В процессе немного перестарался. Получился бот с поддержкой нескольких камер, тревогой, голосом, распознаванием лиц и возможностью вынести обработку данных на отдельный сервер.

В этой статье расскажу, зачем здесь вообще нужна YOLO и почему простого детектора движения оказалось мало. Как я проверял работоспособность проекта в реальных условиях, почему не отправляю в чат обычные фотографии людей и как организована приватность. А также как подключить телефон в качестве камеры и вынести тяжёлую обработку на удалённый сервер.

Смотреть дальше

Следующими можете быть вы: почему злоумышленники так любят облачные KYC‑сервисы

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели8.4K

Привет, Хабр! В начале сентября 2026 года на киберпреступном форуме появился сервис Nexus, предлагавший доступ к огромному массиву удостоверений личности граждан США и Канады. По утверждению его операторов, в базе находились сведения более чем о 170 млн человек: 153 млн водительских удостоверений, 10 млн ID-карт, 3 млн паспортов и 579 тыс. медицинских карт. В открытом доступе данные оказались из-за утечки компании IDScan.net, предоставляющей решения для проверки документов и личности. 

По данным IDScan.net, неавторизованная третья сторона могла получить доступ к информации, хранившейся в облачных аккаунтах, и скопировать ее. По состоянию на середину сентября расследование продолжается. Однако сам факт возможного копирования клиентских данных из облачной среды компания признала.

Эта статья не является разбором ошибок IDScan и тем более попыткой обвинить пострадавшую компанию. IDScan стала жертвой преступников, как до нее становились жертвами банки, государственные учреждения, медицинские организации и технологические корпорации. Но сейчас важно задать вопрос: почему у внешнего участника KYC-процесса вообще оказался массив документов, который можно было похитить?

Читать далее

Сжимаем флаги стран в 11 бит

Время на прочтение11 мин
Охват и читатели7.7K

Недавно я посмотрел интересное видео YouTube‑канала «Physics for the Birds». Это видео посвящено матрицам, но для объяснения некоторых операций с матрицами автор использовал флаги. Он показал, как можно разбить флаги по осям, чтобы представить их в виде матриц и сэкономить место на диске. В конце этот пример был применён к реальным матрицам и вычислениям с ними.

Однако это видео дало мне вдохновение: часто флаги бывают очень простыми — несколько разноцветных полос, распространённые элементы наподобие звезды, полумесяца или креста. Если использовать какую‑нибудь схему кодирования, то удастся ли описать флаг Франции

в формате «три полосы: синяя, белая, красная», чтобы декодеру и рендереру достаточно было всего нескольких бит? Как может выглядеть такое кодирование?

Я решил создать нечто подобное.

Читать далее

Как работать с GPT Image 2.5: что советует OpenAI и что уже выяснили пользователи Reddit

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели13K

OpenAI выпустила подробный гайд по промптам для GPT Image 2.5. Я прочитал его, а потом полез на Reddit смотреть, что происходит с этими рекомендациями в реальной жизни. Оказалось, пользователи уже успели не только проверить многие советы, но и найти несколько довольно полезных обходных путей.

Читать далее

Как мы засунули геометрию квартиры в обычный PNG

Уровень сложностиСложный
Время на прочтение22 мин
Охват и читатели8.3K

Туры Getfloorplan рендерятся в Unreal Engine с трассировкой пути, и в браузер уходит готовая панорама — по сути скриншот из игры. Грузится быстро и выглядит как фотография, но геометрии у картинки нет: курсору не во что попасть. А линейку в проптехе рано или поздно просят все — измерить комнату, проверить, пройдёт ли шкаф в проём.

В статье — как мы получили и картинку, и линейку. Рядом с панорамой рендерим карту глубины, по экранным координатам курсора восстанавливаем точку в мире и нормаль к поверхности. Расстояния упаковываем в обычный PNG: EXR, в котором карта рождается, браузер нативно не читает. Разбираем, чем за это платим: точностью, размером файла и парой грабель с CORS и цветовыми профилями.

Читать далее
1
23 ...