Обновить
128K+

Обработка изображений *

Работаем с фото и видео

60,81
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Как подготовить PreLabeled-датасет при помощи CVAT, YOLO и FiftyOne

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели10K

Представьте ситуацию: подходит к концу спринт, во время которого вы с командой планировали разметить десятки тысяч картинок для обучения новой нейросети (допустим, детектора). Откладывать задачи — не про вас! И вы обязались придумать способ как успеть в срок!

Сегодня я подробно расскажу:

как развернуть CVAT — популярный сервис для разметки данных;

как быстро и удобно предразметить датасет с помощью YOLO и FiftyOne;

как загрузить полученный датасет на CVAT для переразметки;

как выгрузить предразмеченный датасет обратно.

Читать далее

Каково расстояние между «Будапештом» и «Бухарестом» или об отождествлении слов с помощью расстояния Левенштейна

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели9.6K

Каждый из нас из школы помнит определение Евклидова расстояния между двумя точками на плоскости. С помощью расстояния Евклида можно вычислить расстояние между двумя точками на карте, например, между вашим местоположением и станцией метро. Но для пешехода в Нью-Йорке расстояние между двумя точками в городе будет отличаться от расстояния Евклида между двумя точками из-за невозможности передвигаться иначе, как по проезжим улицам, пересекающимся под прямыми углами. Такое расстояние так и называется: "расстояние городских кварталов" или манхэттенское расстояние. При любом способе расстояние характеризует меру близости точек. В сегодняшней статье мы расскажем о способах вычисления расстояния между двумя словами.

Читать далее

Шумные разработчики, или Какие виды шума бывают?

Время на прочтение4 мин
Охват и читатели12K

Играясь с генерацией карт высот в unity, я заметил одну неприятную тенденцию: большинство статей и материалов рассказывают либо о Value Noise, либо о Perlin Noise, либо о Voronoi Noise. Возможно я плохо искал, но это не отменяет того факта, что я сел писать эту статью, поэтому для всех нуждающихся я сделал шпаргалку.

Продолжение следует

Восстановление криптоключей по яркости LED-индикатора питания

Время на прочтение4 мин
Охват и читатели9.5K

Экспериментальная установка. Камера наблюдения (слева) снимает индикатор питания на смарт-ридере (справа) с расстояния 16 м

Известный эксперт в области криптоанализа Бен Насси (Ben Nassi) с коллегами из университета им. Бен-Гуриона опубликовали результаты уникальных экспериментов по восстановлению криптографических ключей с помощью видеозаписи светодиода питания устройства, на котором хранится/используется этот ключ.

Для извлечения секретного ключа достаточно нескольких секунд видеозаписи с камеры наблюдения (издали) или со смартфона (вблизи, с роллинг-шаттером).
Читать дальше →

Нейросеть распознает 15 документов за 1 секунду. А так можно было?

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели31K

Ковер-самолет, меч-кладенец, скатерть-самобранка, шапка-невидимка, молодильные яблоки, волшебный клубочек и… ? Правильно, решение для распознавания полнотекстовых документов от Smart Engines. Оно, как и все упомянутые предметы, совершенно уникально, неповторимо и обладает самым что ни на есть волшебным функционалом. Например, распознает текстовые данные со скоростью 15 страниц в секунду. А еще распознает текст на мятых листках. А еще распознает текст в темноте. А еще распознает текст на арабском. А еще на японском. А еще на иврите. И при этом всем существует не в сказках, не в 2030 году, а наяву. Рассказываем и показываем, как выглядит OCR без слабых мест.

Читать далее

Матирование изображений, или как получить фотореалистичный передний план

Время на прочтение7 мин
Охват и читатели5.2K

В последнее время в области компьютерного зрения произошло много революционных событий, но есть ряд классических задач, решение которых остается актуальным. Одна из них —  матирование, которое применяется для редактирования изображений и видео через извлечение нужных объектов с субпиксельной точностью. Решения этой задачи вы можете видеть в программах для кинопроизводства и фоторедакторах. В этой статье мы хотим познакомить вас с нашим новым подходом к матированию изображений. Изначально мы в SberDevices стремились решить задачу для портретов, но обобщающая способность модели позволяет использовать её и для изображений, выполненных в полный рост, для картинок с животными и так далее.

Читать далее

Стеганографические эксперименты с видеофайлами и Youtube. Продолжение

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели6K

С момента публикации первой части статьи появились интересные инструменты, демонстрирующие побочные возможности Youtube для хранения цифровой информации. Например, утилита Infinite-Storage-Glitch. Автор утилиты DvorakDwarf, пользуясь рациональным размещением цифровой информации в черно-белом формате CV_8UC3, успешно использовал Youtube если не в качестве полноценного дропбокса, то в качестве прототипа альтернативного файлового хранилища, что вызвало массу различных инспираций и породило бурную реакцию пользователей, в том числе этического характера.

Перейти к экспериментам

Шум в компьютерной томографии: правда ли он нам мешает?

Уровень сложностиСложный
Время на прочтение7 мин
Охват и читатели4.7K

Здравствуй, Хабр! На связи отдел компьютерной томографии Smart Engines. 

Как уже, наверное, известно нашему читателю, мы занимаемся разработкой томографического программного обеспечения. Мы работаем над совершенствованием алгоритмов реконструкции внутренней структуры объектов, боремся с артефактами реконструкции и различного рода шумами в измеренных данных. Наша основная задача - повысить качество реконструкции, увидеть чуть больше и чуть четче то, что когда-то было недоступно человеческому глазу.

Каждый пиксель детектора "живет своей жизнью и ошибается по своему". Ошибки связаны с шумом, который в каждом пикселе распределен уникальным образом и часто зависит от самого зарегистрированного значения. Такой шум называют гетероскедастичным.

Гетероскедастичность порождает на восстановленных изображениях искажения, которые мешают правильной интерпретации получаемых результатов. Наш отдел имеет опыт в противостоянии подобным зашумленностям данных, и сегодня мы хотели бы рассказать о придуманном нами методе фильтрации гетероскедастичного шума.

Читать далее

Распознавание документов на Steam Deck. А нужен ли мне мой ноутбук?

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели9.9K

Привет, Хабр! Как вы знаете, мы в Smart Engines не только любим распознавать документы, но и распознавать очень разные документы на очень разных устройствах, от Odroid до Эльбруса. Недавно у нас в руках оказалась игровая консоль Steam Deck, и мы решили проверить, насколько шустро она справляется с распознаванием в сравнении с обычным ноутбуком. Если вам интересно посмотреть на результаты бенчмарка Steam Deck в не совсем обычной для нее задаче, добро пожаловать под кат!

Читать далее

cv3 — делаем OpenCV питоничным

Уровень сложностиПростой
Время на прочтение14 мин
Охват и читатели15K

cv3 - это более питоничный интерфейс к OpenCV. Он упрощает работу с этой библиотекой, расширяет его синтаксические возможности, а также ускоряет исследования в области компьютерного зрения и выполнение задач по обработке изображений, при этом сохраняя гибкость и функциональность OpenCV.

Читать далее

Как нейросети помогают паломникам совершать хадж?

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели2.2K

Привет, Хабр!

Мы не раз писали о том, как банки, сотовые операторы и ретейлеры применяют системы распознавания Smart Engines. Сегодня делимся еще одним крайне любопытным кейсом. Рассказываем, как наше решение на базе искусственного интеллекта используется для оформления поездок российских паломников на хадж в Саудовскую Аравию. 

Спойлер: Smart Engines помогла хадж-оператору "Муслим Тур" ускорить бронирование поездок в 7 раз. 

Читать далее

Максимальное Потребление Кислорода. Как там наши сердце и легкие?

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели13K

Банальность №1: чтобы достичь цели, ее нужно выразить в измеряемых единицах.

Банальность №2: лучше быть богатым и здоровым.

В сумме эти два перла философской мысли приводят к выводу: чтобы достичь богатства и здоровья, и то, и то другое нужно измерять.

Собственное (или чужое) богатство без особых сложностей можно измерить, выразив в числах (в деньгах). С измерением здоровья есть проблемы. Я, по крайней мере, не знаю, как численно выразить свое здоровье в целом. Но сложную, на первый взгляд нерешаемую, задачу часто  можно разбить на части и справиться с нею поэтапно. 

Мы попробовали так же поступить и с задачей «измерение здоровья», начав с относительно легко измеряемой составляющей - кардиореспираторной, выразив ее через Максимальное Потребление Кислорода.

Читать далее

Создание модов для Age of Empires II с помощью нейросети

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.9K

В прошлом месяце я занялся придумыванием способа создания собственных спрайтов цивилизаций для наших с друзьями игр в Age of Empires II.

В этой статье рассказывается о процессе создания гибкого генератора изображений на основе промтов. Для начинающих я посоветую Alpaca, а тем, кто умеет кодить — Stable Diffusion Web UI и Python.

Выражаю особую благодарность сообществам моддеров AoEII OpenAgeSLX Studio и Age of Kings Heaven.

Читать далее

Ближайшие события

SBER-MoVQGAN или новый эффективный Image Encoder для генеративных моделей

Уровень сложностиСложный
Время на прочтение10 мин
Охват и читатели7.6K

Вариационные автоэнкодеры в квантованном векторном пространстве стали довольно популярными в последние несколько лет и успешно применяются в широком спектре генеративных задач (Stable Diffusion, VQ Diffusion, VideoGPT и др.). VQVAE позволяет сжимать картинку в латентное пространство меньшей размерности, а затем восстанавливать это латентное представление изображения в RGB-состояние. Операции в латентном пространстве выполняются быстро, поэтому VQVAE получил широкое применение как в авторегрессионных мультимодальных архитектурах (DALLE, ruDALL-E, RUDOLPH), так и в диффузионных моделях (DALL-E 2, Kandinsky 2.1, Latent Diffusion). В первом случае вариационный автоэнкодер позволяет закодировать картинку в последовательность визуальных токенов, которые вместе с текстовыми токенами используются в обучении трансформера. Во втором случае VQVAE кодирует картинку в квантованное пространство малой размерности, позволяя выполнять диффузионный процесс в латентном пространстве (ввиду того, что диффузионный процесс является итеративным и скорость генерации напрямую зависит от числа шагов диффузии, вычислительная сложность каждого шага очень важна), который в сравнении с пиксельной диффузией выполняется быстрее и потребляет меньше памяти. 

Во всех перечисленных задачах качество генерации напрямую зависит от качества восстановления исходных картинок с помощью VQVAE. Пару лет назад мы уже проводили эксперименты и обучали SBER-VQGAN, который на тот момент давал лучшие результаты в сравнении c dVAE и ванильным VQGAN. Подробнее об этих экспериментах можно прочитать в статье на Хабре. Однако по-прежнему нам не хватало качества восстановления в сложных доменах, таких как текст и лица, поэтому мы попытались модифицировать и улучшить SBER-VQGAN, в результате получив SoTA среди моделей по кодированию изображений.

Читать далее

Smart Engines: “Если ты предлагаешь новую технологию – должно пройти время, чтобы в обществе осознали ее необходимость”

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели2.6K

Привет!

Мы, компания Smart Engines, являемся экспертами в сфере распознавания. За время нашего существования мы опубликовали на Хабр более сотни статей, в которых рассказали о наших технологиях и научных достижениях. Теперь мы решили познакомить вас поближе с нашей командой и показать, что скрывается за дверьми офиса Smart Engines. 

Когда появилась первая OCR? Чем российская школа компьютерного зрения отличается от американской? С какой скоростью мы распознаем на "Эльбрусе"? Исчезнут ли когда-нибудь бумажные документы? На эти и другие вопросы в интервью блогеру imaxai ответили генеральный директор Smart Engines к.т.н. Владимир Арлазаров, директор по науке, член-корреспондент РАН, профессор, д.т.н. Владимир Львович Арлазаров.

Читать далее

Экономичное МФУ с СНПЧ: никакой мороки с картриджами меньше чем за 15К

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели22K

Привет, Хабр! Сегодня мы хотим рассказать об МФУ от Canon, которое в значительной степени решает вопрос удешевления цветной печати в небольшом или домашнем офисе. Под катом — обзор Canon PIXMA G2411, который откровенно пробивает дно в вопросах доступности печати, причем при невысокой первоначальной стоимости самого девайса.

Читать далее

Автоматический майнинг изображений

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели5K

В предыдущих статьях мы рассказали, как создать фотогалерею с собственной поисковой системой [1,2]1. Но где нам найти изображения для нашей галереи? Нам придется вручную искать источники «хороших» изображений, а затем вручную проверять, является ли каждое изображение «хорошим». Можно ли автоматизировать обе эти задачи? Ответ — да.

Читать далее

Ускоряем процесс разметки с помощью интерактивной сегментации

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели10K

Всем привет! Сегодня поговорим про задачу интерактивной сегментации на основе кликов (click-based) и как она может ускорить процесс разметки данных для различных типов сегментации. Сегментационные модели применяются в распознавании событий и объектов в видео (Video Understanding), анализе медицинских снимков и в управлении беспилотных автомобилей, а также с  их помощью реализована замена фона в приложениях для видеозвонков, бьютификация и автоматическая ретушь фотографий. SberDevices тоже активно разрабатывают свои решения для семантической сегментации – недавно мы рассказывали про задачу замены фона и бьютификацию в нашей статье, в которой представили новый большой opensource датасет для Portrait Segmentation и Face Parsing вместе с набором предобученных моделей.

Читать далее

Все события в мире синтетических данных за 2022 год

Время на прочтение12 мин
Охват и читатели1.6K

В течение прошлого года мы наблюдали существенный рост в мире синтетических данных и радостные изменения на этом рынке. В своей статье я поделюсь своими заметками о годе мониторинга рынка. Из неё вы узнаете о новых игроках, разработках и перспективах эволюции экосистемы.

Новые игроки и анализ рынка синтетических данных


Когда в 2021 году я опубликовала пост о состоянии рынка синтетических данных, на нём присутствовало 67 поставщиков:

  • 28 поставщиков структурированных синтетических данных,
  • 10 поставщиков синтетических тестовых данных,
  • 6 опенсорсных поставщиков,
  • и 29 поставщиков неструктурированных данных.

Год спустя картина изменилась:


На карте появилось 28 новых поставщиков, а всего продавать продукты и сервисы синтетических данных стали 97 компаний.

Мы добавляем на карту ещё 31 поставщика, что суммарно даёт 100 компаний, занимающихся продажей продуктов и сервисов синтетических данных. Пять компаний закрылось и ещё я убрала с этой карты опенсорсные решения. Обновлённый список компаний, занимающихся синтетическими данными, можно посмотреть в этой статье.
Читать дальше →

Новейшая технология КТ — измерения под контролем реконструкции

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели2.1K

Привет, Хабр! Каждому из нас хотя бы однажды было интересно заглянуть внутрь какого-либо объекта, не разрушая его, не так ли? И на сегодняшний день это представляется возможным благодаря одному из методов неразрушающего анализа внутренней структуры объекта - методу компьютерной томографии (КТ), подробнее о котором уже мы писали в статье. Первое, что приходит на ум, когда мы слышим термин КТ: “... что-то из медицины, какое-то исследование ...”. К удивлению многих, КТ не менее успешно применяется и в области промышленности, и в области научных исследований, и даже в области таможенного контроля.

Тут мы расскажем о нашей новой разработке, которая одновременно решает два из наиболее обсуждаемых аспектов в области КТ: как снизить дозу облучения и как сократить время томографического эксперимента? Первый имеет огромную важность для медицины, а второй – для индустрии. В нанотомографии, например, время эксперимента может достигать десятков часов. В статье мы покажем результаты, которых достигли в ходе экспериментов по исследованию разработанного нами подхода.

Читать далее