Обновить
128K+

Обработка изображений *

Работаем с фото и видео

57,25
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

5 подходов к разметке данных для проектов машинного обучения

Время на прочтение4 мин
Охват и читатели8.8K

Когда мы в конце прошлого года перерабатывали свой курс по Deep Learning, чтобы сделать его более наглядным и ориентированным на кейсы из реальной бизнес-практики, мы включили в него новый модуль по разметке данных на крауд-платформе "Яндекс.Толока". 

Но так как краудсорсинг -- это не единственный способ разметки, мы подготовили для новых слушателей курса перевод статьи из блога Lionbridge с обзором основных подходов к разметке данных в Deep Learning. 

Читать далее

Размытие фона в Google Meet с расчётом ML в браузере

Время на прочтение6 мин
Охват и читатели4.7K
Видеоконференции занимают всё большее место в работе и личной жизни людей. Чем лучше организован процесс с точки обработки видео и приватности, тем меньше отвлекается внимание человека от самой конференции. В рамках этой задачи мы недавно разработали фильтры размытия и замены фона в Google Meet. Они задействуют машинное обучение (ML) для лучшего выделения участников независимо от их окружения. В то время как другие решения требуют установки дополнительного программного обеспечения, функции Meet основаны на передовых технологиях Web ML, построенных с помощью MediaPipe, и работают непосредственно в вашем браузере — никаких дополнительных шагов не требуется. Одной из ключевых целей при разработке этих функций было обеспечение производительности в реальном времени в браузере почти на всех современных устройствах, чего мы достигли, объединив эффективные модели ML на устройстве, рендеринг на основе WebGL и вывод ML на веб-стеке с помощью XNNPACK и TFLite.
Читать дальше →

Синтетические данные: улучшение алгоритмов восприятия и оптимизация поиска границ

Время на прочтение10 мин
Охват и читатели2.9K
image

Для того, чтобы охватить все краевые случаи, встречающиеся в реальном мире, критические системы восприятия нуждаются в огромных массивах данных. Один из распространенных подходов к обучению алгоритмов для беспилотных автомобилей – подбор и разметка данных о реальном вождении. На CVPR 2020 Андрей Карпатый рассказывал, что Tesla тоже использует этот подход – их автомобили адаптируют метки объектов в режиме онлайн. «Вариация и контроль» очень важны, поскольку инженеры постоянно адаптируют онтологию и методику маркировки данных, так как беспилотные автомобили постоянно сталкиваются с новыми сценариями, которые необходимо анализировать.

Впрочем, этот подход, основанный на использовании данных, имеет различные ограничения – они обусловлены масштабируемостью, стоимостью сбора данных и множеством усилией, необходимых для точной маркировки датасетов. В этом тексте команда Applied расскажет о подходе, основанном на синтетических размеченных данных. Этот подход обеспечивает ускорение и экономичность обучения и разработки критических алгоритмов для беспилотного транспорта.

image

Пример синтетических данных для изображений с камер с эталонной разметкой. Оригинальное RGB изображение (вверху слева), 2D-рамки (вверху справа), семантическая разметка (внизу слева) и 3D-рамки (внизу справа).
Читать дальше →

Шесть степеней свободы: 3D object detection и не только

Время на прочтение7 мин
Охват и читатели10K

В компьютерном зрении часто приходится работать с двумерными изображениями, и значительно реже - с 3D объектами. Из-за этого многие ML инженеры чувствуют себя неуверенно в этой области: много незнакомых слов, непонятно, куда тут применить старых друзей Resnet и Unet. Поэтому сегодня я хотел бы немного поговорить о 3D на примере задачи определения шести степеней свободы, что в каком-то виде синонимично 3D object detection. Я разберу одну из свежих работ на эту тему с некоторыми отступлениями. 

Кратко о задаче

Для начала давайте определимся, что такое шесть степеней свободы (6 DoF - degrees of freedom). Представим себе некоторый ригидный (неизменяемый, т.е. при трансформации все точки будут оставаться на той же дистанции друг от друга) объект в трехмерном мире. Чтобы описать его положение относительно наблюдателя понадобится 6 измерений: три будут отвечать за повороты по разным осям, а еще три - за смещение по соответствующим осям. Соответственно, имея эти шесть чисел, мы представляем, как объект расположен относительно какого-то базиса (например, точки, с которой ведется фотосъемка). Эта задача является классической для робототехники (где находится объект, который нужно схватить роборукой?), дополненной реальности (где нарисовать маску в MSQRD, ушки в Snapchat или кроссовки в Wanna Kicks) , беспилотных автомобилей и других доменов.

Я буду рассматривать статью MobilePose: Real-Time Pose Estimation for Unseen Objects with Weak Shape Supervision (Hou et al., 2020). Эта статья, написанная авторами из Google Research, предлагает надежный и, что немаловажно, быстрый пайплайн для решения задачи, будет уместно разобрать его по частям.

Читать далее

Светодиодная LED видеостена как средство отображения DICOM файлов

Время на прочтение7 мин
Охват и читатели3.2K
Постоянная гонка за новейшими веяниями цифровизации вынуждает нас работать со всеми документами только в электронном виде. Такая же история с рентгеновскими снимками, которые давно перешли на цифровые носители. А значит, что рано или поздно – привычные снимки, возможно не полностью, но уйдут в историю.


Читать дальше →

От процедурной генерации к детерминизму: подходы к моделированию синтетических данных для беспилотных авто

Время на прочтение9 мин
Охват и читатели1.3K
image

Симуляции очень важны для ускорения развития методов проектирования во многих отраслях промышленности. В области автомобильных систем беспилотной езды симуляции традиционно используются для тестирования алгоритмов планирования и управления движением. Повторные симуляции используются для разработки систем распознавания, в которых данные с датчиков дорожного движения записываются и воспроизводятся с помощью разнообразных программных стеков для проверки эксплуатационных качеств. Впрочем, эти симуляции были преимущественно ограничены сценариями, встречающимися в реальных автомобилях.

Существует и еще один тип симуляции, становящийся все более важным – генерация высококачественных искусственных данных, точно передающих информацию о реальных дорожных ситуациях. Проблема использования исключительно дорожных данных заключается в том, что для приближения к границам возможностей модулей распознавания в различных операционных областях необходимо собрать и разметить огромные массивы данных. Кроме того, алгоритмы распознавания перестают соответствовать имеющимся данным и выходят из строя при работе вне отработанной среды и при других условиях. В свою очередь, синтетические данные могут создаваться быстро и дешево, а их описания создаются автоматически с использованием базовых знаний о моделируемой среде.
Читать дальше →

Что это за цвет?

Время на прочтение9 мин
Охват и читатели5K
В предыдущей статье мы определяли цвет одежды по изображению, и это может помочь нам для принятия решений о том, одежду каких стилей покупать, и каким клиентам их отправлять. Мы описали гибридный подход с участием человека и машины, однако подробно описывали только часть работы человека – перевод изображений в иерархию цветов. В данной статье мы углубимся в часть работы компьютера – наш текущий алгоритм компьютерного зрения, процесс его разработки и идеи на будущее.

Откуда нам знать, что алгоритм работает?


Перед разработкой алгоритма нужно задуматься над тем, как мы будем оценивать его работу. Допустим, мы написали алгоритм, и он говорит, что «на этом изображении есть следующие цвета» – правильным ли будет его решение? И что это вообще значит — «правильным»?

Для решения этой задачи мы выбрали два важных измерения – правильную разметку основного цвета и правильное количество цветов. Мы задаём это как расстояние CIEDE 2000 (формула цветового отличия) между основным цветом, предсказанным нашим алгоритмом, и нашим реальным основным цветом, а также считаем среднюю абсолютную ошибку в количестве цветов. Такой выбор мы сделали по следующим соображениям:

  • Эти параметры легко подсчитать.
  • При увеличении количества метрик было бы труднее выбрать «лучший» алгоритм.
  • При уменьшении количества метрик мы можем упустить важное различие между двумя алгоритмами.
  • В любом случае у большинства предметов одежды есть один-два главных цвета, и многие из наших процессов полагаются на основной цвет. Поэтому правильно вычислить основной цвет гораздо важнее, чем правильно вычислить второй или третий цвета.
Читать дальше →

Взгляд на ADAS изнутри: когда поедет робот?

Время на прочтение16 мин
Охват и читатели17K
Сегодня мы хотим рассказать о направлении, с которого мы, Cognitive Pilot, исторически начали свои разработки в области создания беспилотных технологий, а именно отрасли automotive. Вообще эта сфера ставит перед разработчиками беспилотных систем наиболее интересные задачи: на дорогах общего пользования сцены намного сложнее и динамичнее, чем в сельском хозяйстве или на рельсах, а поведение объектов часто почти невозможно предугадать. Для создания беспилотных автомобилей используются технологии глубокого обучения, наиболее сложные нейронные сети и объемные датасеты. 

Но вместе с тем не секрет, что промышленное использование беспилотных автомобилей на дорогах общего пользования не разрешено законодателями. И получение санкций на это не стоит ожидать прямо завтра. Участникам рынка еще предстоит решить целый ряд серьезных организационных, юридических, технических и иных проблем. Поэтому мы и выбрали в качестве приоритетных, реальные рынки агро- и рельсового транспорта, на которых наш ИИ может работать и приносить пользу уже сегодня, где, например, комбайнеры уже не касаются руля, сосредоточившись на управлении техпроцессом уборки зерновых, машинисты локомотивов повышают безопасность работы, и где в рамках представленных нами моделей использования автопилотов не нужно ждать разрешения чиновников того или иного уровня. 


Использование ИИ для сверхсжатия изображений

Время на прочтение5 мин
Охват и читатели10K

Управляемые данными алгоритмы, такие как нейронные сети, взяли мир штурмом. Их развитие вызвано несколькими причинами, в том числе дешевым и мощным оборудованием и огромным объемом данных. Нейронные сети в настоящее время находятся в авангарде во всем, что касается «когнитивных» задач, таких как распознавание изображений, понимание естественного языка и т.д. Но они не должны ограничиваться такими задачами. В этом материале рассказывается о способе сжатия изображений с помощью нейронных сетей, при помощи остаточного обучения. Представленный в статье подход работает быстрее и лучше стандартных кодеков. Схемы, уравнения и, конечно, таблица с тестами под катом.
Приятного чтения!

Быстрый старт в видеоаналитику: Опыт использования OpenVINO Toolkit в хакатонах

Время на прочтение4 мин
Охват и читатели4.3K
image alt

Всем привет! Мы активные студенты НГТУ им. Р.Е. Алексеева, и мы хотим рассказать о своем опыте участия в хакатонах и создании IT-решений с использованием набора инструментов Intel – OpenVINO (Open Visual Inference & Neural Network Optimization) – отличной палочки-выручалочки при разработке систем видеоаналитики.


Для начала расскажем немного о себе. Мы студенты 3 курса ИРИТ, кафедра «Информатика и систем управления» – Татьяна Бородина, Тимофей Карклин, Александр Зенкин и Владимир Салтыков. С 1 курса мы активно участвуем в различных конкурсах IT-сферы, создав команду MirITeam[Прим. модератора: ссылка убрана, чтобы не нарушать правила. Google it.] – команду молодых и целеустремленных ребят. Мы разрабатываем стартапы в области компьютерного зрения и видеоаналитики, выступаем на научных конференциях и очень любим Хакатоны, их атмосферу и дух соревнования, где быстро нужно разработать хорошее, качественное решение, привнести в него «изюминку», и успешно (из опыта – это очень и очень важно) защитить свой проект перед жюри. Это ценный опыт реализации инновационных идей, получения новых знаний и качеств и, конечно же, командного сотрудничества.


Поделимся впечатлениями о последнем хакатоне, где мы участвовали –региональном этапе Всероссийского конкурса «Цифровой прорыв», где в рамках кейса ПАО «Ростелеком» мы занялись разработкой системы мониторинга за поведением студента во время экзамена год назад и предположить не могли, что это будет актуально и даже прикольно – сами выступаем в рамках испытуемых.

Читать далее

Масштабирование, поворот и сдвиг растра методом суперсемплинга

Время на прочтение6 мин
Охват и читатели5.8K
В процессе разработки геоинформационной системы возникла необходимость в трансформации фотографий земной поверхности. В связи с этим была поставлена задача написать функции масштабирования, поворота и субпиксельного сдвига растра методом суперсемплинга.

Соответствующие функции были успешно созданы и внедрены, а поскольку они могут представлять интерес для широкой общественности, я решил опубликовать готовую утилиту с открытым кодом и пояснениями.

Утилита и исходные коды размещены в архиве здесь.

Среда разработки: Delphi/Object Pascal.

Свободное использование и распространение приветствуются.

Ниже мы рассмотрим теорию и практику.


Читать дальше →

Рубрика «Читаем статьи за вас». Июль — август 2020 года

Время на прочтение26 мин
Охват и читатели5.8K

Семплинг поперек или как выжать из датасета еще несколько тысячных

Время на прочтение6 мин
Охват и читатели1.2K
Эта статья про картинки и классификацию. Небольшое исследование свойств, такой вот штрих к портрету MNIST (ну и подсказка в решении других подобных задач).

В сети есть множество публикаций об интерпретации той или иной нейронной сети и значимости и вкладе тех или иных точек в обучение. Есть масса работ про поиск усов, хвостов и других частей и их важности и значимости. Не буду сейчас подменять библиотекарей и составлять список. Просто расскажу о своем эксперименте.
Читать дальше →

Ближайшие события

Восстановление утраченных текстов с помощью современных алгоритмов. Софт

Время на прочтение12 мин
Охват и читатели20K
image

В первой части мы с вами поговорили о научном оборудовании, которое используется для прочтения, казалось бы, утраченных навсегда текстов. А теперь мы поговорим о том, как обрабатывать эти данные. Мы рассмотрим интересные цветовые пространства, алгоритмы, фильтры и методы статистического анализа. Но перед этим еще раз вернемся к их извлечению. Нам, простым смертным, доступны два варианта — сканеры и фотоаппараты. 

Что такое ШИМ и почему мерцает OLED? РАЗБОР

Время на прочтение8 мин
Охват и читатели212K
ШИМ, все вокруг говорят про ШИМ. Ну фиг знает — я его не вижу. Что хотите сказать, если понижу яркость дисплея, это как-то будет меня утомлять? Кажется тут есть в чём разобраться!

Сегодня мы объясним как на самом деле работает ШИМ. Узнаем сколько FPS видит человек, а сколько муха.  Проведём тесты ШИМ на осциллографе. И, конечно, расскажем как избавиться от ШИМа на Samsung и на iPhone.



OLED дисплеи фактически во всём превзошли IPS. Но некоторые люди просто физически не могут пользоваться OLED, ведь они чувствуют усталость глаз, сухость и даже головные боли.

Почему так? Дело в том, что в отличие от большинства IPS-экранов большинство OLED-матриц мерцают. Примерно как дешевые люминесцентные лампы. И это не очень хорошо сказывается на зрении.

Разработка и тестирование на платформах Эльбрус программы для томографической реконструкции Smart Tomo Engine (+2 видео)

Время на прочтение14 мин
Охват и читатели11K

Сегодняшняя статья будет посвящена сразу двум нашим любимым темам: компьютерной томографии (КТ) и отечественному процессору Эльбрус. Мы расскажем, чем отличается рентгенограмма от результатов КТ и объясним, зачем такой большой и серьезной машине, как томограф, был бы кстати специализированный вычислитель. Несмотря на то, что томографы используются уже почти 50 лет (создание первого томографа было анонсировано в 1972 году [1]), это не означает, что все проблемы KT сегодня решены. Наоборот, существует острая потребность в новых томографических алгоритмах, которые были бы быстрее и точнее используемых, позволили бы уменьшить лучевую нагрузку на объект, что, в свою очередь, существенно расширило бы и сферу применения метода КТ. Понимая все это, мы создали такое программное обеспечение Smart Tomo Engine. О нем речь пойдет ниже. Рассказав ранее о борьбе с ортотропными артефактами и об оценке “эффекта чаши”, в данной статье мы опишем несколько тестов, проведенных с использованием синтетических и собранных на отечественном томографе реальных томографических датасетах и покажем работу нашей программы на процессоре Эльбрус нового поколения (видео прилагается ниже). Результат работы программы приоткроет внутренний мир майского жука, причем значение слова “внутренний” здесь следует понимать буквально.


Восстановление утраченных текстов с помощью современных технологий. Железо

Время на прочтение17 мин
Охват и читатели14K
Для начала немного новостей.

Как вы можете помнить, в 2018 году я опубликовал статью Как нам удалось прочитать рукопись, найденную в 80-х возле третьего крематория в Аушвице-Биркенау. Так же можете почитать интервью со мной в новой газете.

image

После совместной работы новая  информация заставила зашевелиться как и сам музей Биркенау так и историков. Впервые у Павла Поляна вышли «Свитки из Пепла» на немецком языке. 

В январе 2020 года мы получаем письмо от нашего друга историка Андреаса Киллиана из Франкфурта со ссылкой на магазин музея Аушвиц Биркенау.

Добавляем в плеер функцию Ambilight при помощи умных ламп Xiaomi

Время на прочтение11 мин
Охват и читатели21K


Всем привет!
Думаю многие, интересующиеся умным домом или просто технологичным обустройством своего жилища, задумывались об «атмосферной» и нестандартной осветительной системе.

Один из способов такого «необычного» освещения комнаты во время просмотра фильмов предлагает компания Philips с технологией Ambilight, встроенной в особо навороченные телевизоры этого бренда.

В этой статье вы обнаружите реализацию подсветки Ambilight с помощью умных ламп Yeelight от Xiaomi!

Как я делал нейросеть для оценки картинки с простеньких веб-камер

Время на прочтение6 мин
Охват и читатели7.1K
Наверняка многие, кто пытался сделать свою первую нейросеть, проходили на Kaggle челленж Cat vs Dog, в котором нужно научить компьютер отличать картинку с кошкой или собакой на дата-сете из 25 тысяч заранее размеченных изображений.



Примерно с таким «Kaggle-опытом» я взялся за свою первую боевую модель машинного обучения с нуля. И опыт получился интересным. Но обо всем по порядку.

Пролог. «Система, чем-то похожая на Тиндер»


Читать дальше

Как разложить фото, видео по папкам, исходя из их дат, используя python

Время на прочтение2 мин
Охват и читатели14K


Всем знакомы завалы из фото и видео, кои покоятся годами после копирования с устройств.

Особенно это характерно для iphone,ipad, которые при прямом копировании (без itunes) создают
залежи медиаконтента. Как это все разложить по годам-месяцам?

Да, есть синхронизация, да, можно сразу все сортировать. Но…

Кто-то предпочитает ничего не трогать, так как соблюдается единство свалки, кто-то делает робкие попытки разложить все накопленное хотя бы по годам.
Читать дальше →