Обновить
128K+

Обработка изображений *

Работаем с фото и видео

62,02
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Рубрика «Читаем статьи за вас». Сентябрь — октябрь 2020 года

Время на прочтение15 мин
Охват и читатели4.9K

Генетический алгоритм для сегментаций строк в рукописном документе

Время на прочтение9 мин
Охват и читатели4.3K

Генетический алгоритм (GA)

Генетический алгоритм - это классический эволюционный алгоритм, основанный на случайной переборе параметр. Под случайным здесь мы подразумеваем, что для поиска решения с использованием ГА, случайные изменения применялись к текущим решениям для генерации новых. GA основан на теории эволюции Дарвина. Это медленный постепенный процесс, который работает путем внесения небольших и медленных изменений. Кроме того, GA медленно вносит небольшие изменения в свои решения, пока не получит лучшее решение. Подробнее можете узнать здесь

Цель

Реализовать алгоритм для сегментаций строк в рукописном документе(рис. 1 взял из интернета), чтобы при обрезаний строк, не обрезали нижнюю или верхнюю часть букв (Например: рукописные буквы р, в, б, д, з).

Читать далее

Как превратиться в суперзвезду Zoom-звонков за 15 минут

Время на прочтение10 мин
Охват и читатели46K

Я работаю продакт-менеджером двух команд в Wrike на удалёнке и каждую неделю провожу примерно 20 часов на созвонах. В таких условиях контекст часто теряется из-за отсутствия физического контакта, а если ещё и камера так себе, то вместо лица человека видишь «кашу» без эмоций. Особенно обидно видеть тренинги или выступления именитых спикеров со стандартной камерой в тёмной комнате на фоне обоев, в то время как стоимость подобных тренингов  в разы превышает стоимость нормального оборудования. 

Я решил использовать свой опыт фотографирования и работы со светом и потратить время, чтобы улучшить свои Zoom-звонки «по-быстрому». И теперь хочу научить этому вас! В этой статье попробуем разобраться, какие технические средства можно использовать, чтобы онлайн-встреча напоминала встречу вживую и радовала и вас, и собеседника.

Читать далее

Как машинное обучение помогает открыть мир Древней Японии

Время на прочтение10 мин
Охват и читатели3.6K


Богатая история человечества оставила после себя огромное количество исторических документов и артефактов. Однако практически все документы, содержащие рассказы и записанный опыт, имеющие существенное значение для нашего культурного наследия, понятны только специалистам по причине языковых и письменных изменений, происходящими со временем. Специально к старту нового потока курса по Машинному Обучению делимся статьёй Алекса Лэмба – аспиранта Монреальского университета и Монреальского института алгоритмов обучения (MILA), посвящённой использованию ML для распознавания древних рукописных текстов.
Приятного чтения!

Как скопировать стиль Уорхола с помощью нейросети VGG-19, трансферного обучения и TensorFlow

Время на прочтение6 мин
Охват и читатели11K

То что мы сделаем ещё называется Нейронный перенос стиля – это метод смешивания двух изображений и создания нового изображения из изображения-контента путём копирования стиля другого изображения, которое называется изображением стиля. Созданное изображение часто называют стилизованным изображением.

В этой статье мы скопируем стиль Энди Уорхола с «Мэрилин Диптих» на наши фотографии. Уорхол создал диптих Монро в 1962 году, сначала раскрасив холст разными цветами, а затем разместив теперь знаменитое изображение Мэрилин поверх холста. Хотя Уорхол не является основателем поп-арта, он – одна из самых влиятельных фигур в этом жанре.
Начнем творить!

История интерпретируемости в распознавании изображений

Время на прочтение10 мин
Охват и читатели3.7K


Распознавание изображений (т. е. классификация того, какой объект отображается на изображении) является основной задачей в области компьютерного зрения, так как она позволяет использовать различные последующие приложения (автоматическая маркировка фотографий, помощь слабовидящим людям и т. д.) и стала стандартной задачей, по которой можно проводить сравнение алгоритмов машинного обучения (ML). Алгоритмы глубокого изучения (DL) за последнее десятилетие стали наиболее конкурентоспособными алгоритмами распознавания образов. Однако по умолчанию это алгоритмы «чёрного ящика»: трудно объяснить, почему они делают конкретный прогноз. Почему это является проблемой? Пользователи моделей ML часто хотят иметь возможность интерпретировать, какие части изображения привели к прогнозу алгоритма, по многим причинам:

  • Разработчики машинного обучения могут анализировать интерпретации к отладочным моделям, идентифицировать заблуждения и прогнозировать, обобщается ли модель на новые изображения.
  • Пользователи моделей машинного обучения могут больше доверять модели, если модели объясняют, почему был сделан конкретный прогноз.
  • Законодательное регулирование относительно ML, такое как GDPR, требует некоторых алгоритмических решений, которые можно объяснить с человеческой точки зрения.

Мотивированные такими условиями, в течение последнего десятилетия исследователи разработали множество различных методов для открытия «чёрного ящика» глубокого обучения с целью сделать базовые модели более объяснимыми. Некоторые методы специфичны для определённых видов алгоритмов, в то время как другие являются общими. В этой статье представлен обзор методов интерпретации, изобретённых для распознавания образов, а также примеры и код, чтобы попробовать их самостоятельно с помощью Gradio. Автор статьи Али Абдалла — сооснователь Gradio и инженер по машинному обучению. До этого он работал в Tesla, iRobot и MIT. Он опубликовал несколько научных статей  и участвовал во многих проектах с открытым исходным кодом.
Приятного чтения!

Кейс: автоматизация тестирования верстки сайта с помощью скриншотов

Время на прочтение7 мин
Охват и читатели14K

Привет, меня зовут Фахридин Джамолидинов, я специалист департамента тестирования в «Ростелеком ИТ». Занимаюсь автоматизацией тестирования основного сайта компании rt.ru. Наш сайт – это не только витрина для информирования клиентов и продаж услуг и товаров для сегментов B2C, B2B и B2O, он ещё предназначен для обслуживания текущих клиентов: FAQ, чат, формы обратной связи, платежные формы и т.п. Он постоянно обновляется, и каждый раз после выпуска новой версии нужно проверять сотни страниц с богатым, динамичным UI на работоспособность в браузерах и адаптивность вёрстки.

Конечно же на этапе разработки применяется практика design review со стороны наших продуктовых дизайнеров, но нет-нет да проблемы всплывали: где-то элементы перекрываются, съезжаются, не сохраняется единый стиль.

Осознавая, что ручное регрессионное тестирование существующего UI превращается в кошмар и отнимает кучу времени, мы решили автоматизировать данный процесс. Сегодня мы покажем, как работает автотестирование по скриншотам – будем акцентировать внимание на функционал aShot, или как помочь автотестам «видеть» ошибки.

Читать далее

Зачем нужна еще одна система распознавания баркода?

Время на прочтение4 мин
Охват и читатели5.6K

В сегодняшней статье на Хабре мы расскажем про очередную задачу распознавания. Рассмотрим проблему распознавания штрихкодов, которая очень актуальна в связи с непрерывным развитием системы маркировки и системы оплаты товаров по QR-коду в 2021 году.

Читать далее

Рынок тепловизоров развивается и на него выходит компания Owl

Время на прочтение10 мин
Охват и читатели5.3K
image

Teledyne объявила о приобретении Flir Systems, занимающейся тепловизорами. Сумма сделки составила 8 миллиардов долларов наличными и акциями, и она дала четкий сигнал всем автопроизводителям: тепловидение набирает обороты.

Этот шаг со стороны Teledyne хоть и несколько внезапен, не должен вызывать удивления.

2020 год научил нас тому, что ни в беспилотных автомобилях (многие из которых сейчас тестируются на публичных дорогах), ни в ADAS-решениях пока нет систем «зрения», которые работали бы в любых погодных условиях, в любой местности, на протяжении всего дня и в темноте.

С одной стороны, разработчикам беспилотных автомобилей удалось собрать объемные логи о поездках беспилотных автомобилей с посадкой и высадкой пассажиров в солнечной Аризоне, тест-драйвах в Флориде и круизах по центру Сан-Франциско (как правило машины заезжали только в определенные районы и только в определенное время). С другой стороны, никто не показывает роликов, в которых машины-роботы ездят в условиях тумана, дождя, снега, метели, низкой освещенности и в полной темноте.

Именно поэтому на рынке сейчас есть большие возможности для компаний, занимающихся датчиками – включая тепловизоры.
Читать дальше →

Поиск изображений с помощью AffNet

Время на прочтение3 мин
Охват и читатели3.9K
Перед нами стояла задача сравнения изображений (image matching) для поиска изображения максимально подобного данному изображению из коллекции. В этой статье я расскажу как мы использовали для этой задачи подход на основе нейронных сетей под названием AffNet. Кому интересно, прошу под кат.
Читать дальше →

Azure Custom Vision без Azure, или «где у них маска». Как мы распознавали маску на лице (и других частях тела)

Время на прочтение15 мин
Охват и читатели1.7K

Среди набора примеров для Azure на GitHub был найден один очень интересный: распознавание образов на Raspberry Pi, в офлайне. Авторами предлагается подготовить модель машинного обучения в одном из облачных сервисов Azure, затем перенести ее на компьютер, у которого большую часть времени нет подключения к Интернет, после чего распознавание образов будет работать автономно. Разработчики подготовили проект для двух платформ: ARM32 (собственно Raspberry Pi) и AMD64 (но без поддержки веб-камеры).


На волне коронавирусного хайпа мы решили адаптировать пример для распознавания, надета маска на человеке или нет. Сразу выяснилось, что шаги по адаптации примера не вполне очевидны. В этом материале рассмотрим последовательно, как этот пример, во-первых, модифицировать для работы со своей моделью машинного обучения, во-вторых, перенести его на платформу AMD64. Будем считать, что наш компьютер, на котором работает модель, управляет турникетом: если человек пришел в маске, турникет открывается, если нет — остается закрытым.

Читать дальше →

Как автоматизировать оповещения о статусе заказов через Telegram-бота, Computer Vision и SQL Anywhere

Время на прочтение13 мин
Охват и читатели10K

В современном мире услуги доставки становятся всё более популярными и востребованными, поэтому любая возможность автоматизации в этой сфере принесёт большую пользу как бизнесу, так и пользователям. В прошлых статьях нашего блога мы рассказывали о применении машинного зрения и нейронных сетей для распознавания ценников товаров в магазине, а также для распознавания комплектующих деталей. В этой статье мы расскажем о менее амбициозной (но не менее интересной) задаче – автоматизации оповещения клиентов о статусе их заказов с использованием чат-бота в Telegram, QR-кодов и реляционной СУБД SAP SQL Anywhere

Читать далее

OpenCV в Python. Часть 3

Время на прочтение4 мин
Охват и читатели62K

Привет, Хабр! Это продолжение туториала по библиотеке opencv в python. Для тех кто не читал первую и вторую части, сюда: Часть 1 и Часть 2, а всем остальным — приятного чтения!


Читать дальше

Ближайшие события

А ну-ка, сгруппировались, или как отделить фото котиков от счетов ЖКХ

Время на прочтение6 мин
Охват и читатели5.3K
Удобно сфотографировать на смартфон страницу из паспорта, визитку коллеги, договор с банком или чек из ресторана. Важные документы всегда будут под рукой, и их можно распечатать или переслать. Но быстро найти нужные файлы в галерее мобильного телефона становится все сложнее. Как правило, у пользователей копится целая коллекция мемчиков и картинок с котиками вперемешку с фотографиями счетов на оплату электричества, СНИЛС и др. У сотрудников компаний, например, выездных менеджеров банка или юридической фирмы, тоже бывают похожие ситуации. Только вместо изображений пушистиков – сотни фотографий клиентских договоров и других документов. Как отыскать необходимый экземпляр, чтобы отправить коллегам в офис, или как распечатать фото водительского удостоверения в правильном масштабе, а не на весь А4? Придется повозиться.

Гораздо проще решать все эти задачи с помощью одного приложения. Поэтому мы и обновили ABBYY FineScanner AI. Теперь он умеет автоматически сортировать фотографии из галереи смартфона на 7 групп документов и быстро ищет нужные фото по текстовым запросам.

Сегодня мы подробно расскажем, как создавали каждую из этих фич, какие технологии при этом использовали и как в этом помог фреймворк ABBYY NeoML. Также покажем, как это работает в приложении. А в конце – поделимся нашими планами по развитию FineScanner и зададим вам несколько вопросов.
Читать дальше →

Миллион домашних фотографий: лица, лица, лица

Время на прочтение11 мин
Охват и читатели20K

Итак, все фотографии разложены по папкам и находить фотографии Новых годов или дней рождения стало быстро и удобно. Фотографии из отпусков тоже можно найти относительно быстро, но хотелось большего. А именно, искать по людям и не просто по людям, а по набору людей, например, найти все совместные фотографии детей или фотографии с бабушкой и т.д.

Поэтому я решил немного углубиться в так называемый Face Recognition.

Поехали!

Демонстративно вертим массивы для новичков

Время на прочтение3 мин
Охват и читатели18K

Каждый кто изучает программирование сталкивается с массивами и рано или поздно сталкивается с задачей, которую не в силах решить.

В этом посте я расскажу о некоторых алгоритмах обработки массивов, которые объяснят новичку суть работы с этой не такой уж и страшной структурой.

Читать далее

Миллион домашних фотографий: наводим порядок

Время на прочтение5 мин
Охват и читатели39K

После покупки цифрового фотоаппарата и рождения детей стало появляться большое количество фотографий, а учитывая, что жена с фотоаппаратом почти не расставалась и старалась запечатлеть все «важные» детские моменты, фотографий стало появляться ОЧЕНЬ много.

Пришло время навести порядок.

Teledyne приобретает Flir за 8 миллиардов долларов наличными и акциями

Время на прочтение4 мин
Охват и читатели2.8K
Стремясь расширить свой технологический портфель, компания Teledyne Technologies в начале января 2021 объявила о приобретении Flir Systems – компании, занимающейся производством тепловизоров. Сумма сделки составила 8 миллиардов долларов наличными и акциями.

В весьма внушительном списке датчиков, которыми занимается Teledyne, можно выделить приложения, в которых используются рентгеновские лучи, ультрафиолет, микроволновое излучение и радиосвязь.

Фил Мэгни, основатель и президент VSI Labs, дал EE Times следующий комментарий: «Похоже, Flir заполнит пробел тепловых датчиков в технологическом портфеле Teledyne».

image

Роберт Мехрабиан, исполнительный председатель Teledyne, сделал следующее заявление: «В основе наших компаний лежат запатентованные технологии различных датчиков. Наши бизнес-модели также похожи: обе наши компании поставляют клиентам датчики, камеры и сенсорные системы. Однако, наши продукты дополняют друг друга, при этом почти не пересекаясь, поскольку в них используются датчики, основанные на различных технологиях с разными длинами волн».
Читать дальше →

Атака на Капитолий не оправдывает расширение слежки за населением

Время на прочтение3 мин
Охват и читатели7.9K


После нападения на Капитолий правоохранительные органы работают сверхурочно, чтобы установить виновных и привлечь их к ответственности за попытку восстания. В распоряжении спецслужб есть много инструментов. И они уже начали использовать систему распознавания лиц. Возможно, даже запускают ClearView AI.

Сейчас от множества возмущённых граждан раздаются призывы использовать данные с вышек сотовой связи, лишь бы найти и наказать виновных.

Но важно понимать. Долговременный ущерб от нападения исходит не от самой толпы и того, что они сделали, а от того, как отреагирует общество.
Читать дальше →

Камера iPhone 12 Pro Max: Разбор

Время на прочтение4 мин
Охват и читатели27K
Поговорим про iPhone 12 Pro Max. В этом году впервые со времен iPhone 8 в двух флагманских смартфонах Apple существенно отличается камера.

Модуль iPhone 12 Pro Max больше, чем у iPhone 12 Pro. Почти на 20 процентов.

Почему же он больше? Или это для того чтобы кто-то покупал Pro Max с его бесчеловечной эргономикой?

Важных отличия в камере здесь три:

  1. Основной модуль больше.
  2. Другая система стабилизации изображения
  3. Другая телефотокамера с зумом на 2.5х, вместо 2x.

Разберемся со всем по очереди. Сравним с iPhone 12 Pro, Pixel 5 и не только. А заодно поговорим о проблемах этой камеры. И попробуем разобраться действительно ли это лучшая камера в смартфоне?


Итак, прежде не могу не сказать. Видео не передает насколько это огромный телефон!