Обновить
128K+

Обработка изображений *

Работаем с фото и видео

61,87
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Как видит нейросеть от Сбера одно из страшных заболеваний лица

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели6.1K

Для начала небольшое вступление - описание болезни. "Страшное" заболевание название которому Гемифациальный спазм, также известное как – тиковые судороги. Представляет собой состояние, которое вызывает «тики» или мышечные спазмы на одной стороне лица. Эти тики безболезненны, хотя и могут доставлять дискомфорт, но как правило, не опасны для жизни. Однако по мере ухудшения состояния больного, тики могут становиться все более частыми и мешать привычному образу жизни. 

Наверное вам доводилось видеть людей страдающих "тиками". Согласитесь, что выглядит это мягко говоря не очень. Особенно когда тики и подергивания в области лица интенсивные, прямо пробирает до мурашек и хочется отвести взгляд куда подальше.

Читать далее

Гонка по развитию ИИ вышла из-под контроля и настолько же опасна, как и Манхэттенский проект

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели5.8K

Подобно созданию атомной бомбы  искусственный интеллект изменит всё - проблема в том, что мы не знаем как.

Автор оригинала: Dan Snow

Читать далее

Segment Anything: создание первой базисной модели для сегментации изображений

Время на прочтение9 мин
Охват и читатели8.1K

Сегментация, то есть распознавание пикселей изображения, принадлежащих объекту — базовая задача компьютерного зрения, используемая в широком спектре применений, от анализа научных снимков до редактирования фотографий. Однако для создания точной модели сегментации под конкретные задачи обычно требуется высокоспециализированный труд технических экспертов, имеющих доступ к инфраструктуре обучения ИИ и большим объёмам тщательно аннотированных данных, относящихся к предметной области.

Наша лаборатория Meta AI* стремится сделать сегментацию более доступной, основав проект Segment Anything: новую задачу, датасет и модель для сегментации изображений (подробности см. в нашей исследовательской статье). Мы публикуем нашу Segment Anything Model (SAM) и датасет масок Segment Anything 1-Billion mask dataset (SA-1B) (крупнейший в мире датасет сегментации), чтобы их можно было использовать во множестве разных областей и стимулировать дальнейшие исследования базисных моделей компьютерного зрения. Мы открываем доступ к датасету SA-1B, позволяя использовать его в исследовательских целях; модель Segment Anything Model доступна по открытой лицензии (Apache 2.0). Вы можете протестировать демо SAM со своими собственными изображениями.

* Принадлежит корпорации Meta Platforms, которая признана экстремистской организацией, её деятельность в России запрещена.
Читать дальше →

Астрологи объявили неделю нейроарта на Хабре

Время на прочтение5 мин
Охват и читатели27K

Однажды весною, в час небывалого жаркого заката, на Хабре объявили конкурс, посвящённый технологиям искусственного интеллекта. В Сезоне Data Mining мы собрали статьи об обработке больших данных. Из Сезона ML узнали, как работают нейросети и с чем их готовить. В разработке ещё один Сезон на эту тему. Мы решили передохнуть и объявляем неделю нейроарта. Участвовать может любой автор, который опубликует статью с 4 по 14 апреля 2023 года и добавит на картинку в ленте изображение от Kandinsky 2.1. Подробности под катом.

Читать далее

Как не заменить фару сосиской: определение качества изображений в сервисе оценки технического состояния автомобиля

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели4.1K

В научно‑популярных статьях и докладах, обучающих материалах по системам компьютерного зрения упор нередко делается на основную компоненту — тяжелые (или не очень) нейронные сети, которые неким волшебным образом обрабатывают картинку, и на выходе отдают результат.

Однако каждый ли вход в сеть стоит обрабатывать? Обучающие датасеты заранее подобраны и размечены, мусора и шума там чаще всего относительно мало, чего нельзя сказать о данных на входе в реально работающие системы. Особенно если данные загружаются обычными пользователями.

Мы не можем гарантировать, что сеть корректно обработает любой вход. Да, есть способы оценить, насколько модель уверена в своем ответе, но уже после обработки входа, когда мы потратили вычислительные ресурсы. Можем ли мы сказать заранее, что корректно обработать изображение не получится, что оно скорее всего не содержит достаточно информации? Давайте попробуем разобраться на примере реальной задачи.

Читать далее

Kandinsky 2.1, или Когда +0,1 значит очень много

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели92K

В ноябре 2022 года мы выпустили свою первую диффузионную модель для синтеза изображений по текстовым описаниям Kandinsky 2.0, которая собрала как позитивные, так и отрицательные отклики. Её ключевой особенностью была мультиязычность и использование двойного текстового энкодера на входе сети: XLMR-clip и mT5-small. Рефлексия после релиза подтолкнула нас к перестройке планов по развитию архитектуры и к сильному стремлению получить буст в качестве генераций, чтобы выйти на уровень аналогичных решений, названия которых слишком хорошо известны, чтобы их называть. В то же время мы могли наблюдать за появлением новых генеративных моделей и их файнтюнов, таких как ControlNet, GigaGAN, GLIGEN, Instruct Pix2Pix и др. В этих работах представлены и новые взгляды на генерацию, и новые возможности использования латентного пространства для внесения контролируемых изменений через текстовые промты, а также для смешивания изображений — возможности использования генеративных моделей расширяются постоянно. Бурное развитие прикладных кейсов привело к интенсивно нарастающему числу различных привлекательных для пользователей реализаций этих функций — визуализация городов, изображения известных личностей в нетипичных ситуациях и многие другие.

Читать далее

Пять причин, по которым вам нужны синтетические данные

Время на прочтение6 мин
Охват и читатели3.5K
Сбор и разметка данных в реальном мире может быть длительным и дорогостоящим занятием. Кроме того, у этих данных могут быть проблемы с качеством, разнообразием и количеством. К счастью, подобные проблемы можно решать при помощи синтетических данных.


Для обучения модели машинного обучения нужны данные. Задачи data science обычно непохожи на соревнования Kaggle, где у вас есть отличный крупный датасет с готовой разметкой. Иногда приходится собирать, упорядочивать и очищать данные самостоятельно. Такой процесс сбора и разметки данных в реальном мире может быть долгим, неудобным, неточным, а иногда и опасным. Более того, в конце этого процесса может оказаться, что полученные в реальном мире данные не соответствуют вашим требованиям с точки зрения качества, разнообразия (например, дисбаланс классов) и количества.
Читать дальше →

Можно ли привить кибериммунитет роботу? Практическое исследование на примере DIY робота официанта

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели2.7K

Иногда, устроившись на мягком пуфике с книжкой, так и хочется скосплеить Громозеку из мультфильма Тайна третьей планеты, и сказать “Официант, 400 капель яблочного сока и печеньку”. Статья описывает результаты работ по разработке DIY робота-официанта на базе Alpahabot, а также эксперимента по прививке роботу киберимунитета при помощи KasperskyOS CE.

Читать далее

Определение внимания водителей за рулем — реализация прототипов

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели3.6K

Задача контроля водителя очень актуальна в наше время. Должный контроль за состоянием водителей поможет сохранить здоровье автолюбителей, избежать многих дорожно-транспортных происшествий, тем самым снизив количество человеческих жертв. 

В конце 2022 года нашей команде поступил запрос на решение данной задачи. Было необходимо предложить подходы, используя которые можно понять, насколько устал водитель, занят ли он какими-либо посторонними делами за рулем, куда он смотрит при выполнении маневров, открыты ли у него глаза (не спит ли он) и т.д.

После продолжительного изучения существующих исследований в данной области, было принято решение начать работу с разработки следующих прототипов.

Читать далее

Хайп с нейросетями на ТВ. «СвоёТВ» и чужие технологии

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели4.2K

Большое количество профильных и новостных телеграмм каналов, крупные СМИ опубликовали прогноз погоды из Ставрополья, созданный нейросетями.

Читать далее

ML-подходы по поиску похожих изображений

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели18K

Привет, Хабр!

Меня зовут Паймеров Владимир, я Data Scientist и участник профессионального сообщества NTA.

Компьютерное зрение (computer vision, CV) — активно развивающаяся научная область,
связанная с анализом изображений и видео. В последнее время данному направлению
уделяется большое внимание, так как CV позволяет решать множество задач, таких как
детекцию объектов, классификацию изображений, распознавание лиц и т. д., которые
в свою очередь применяются в разных сферах жизни от мобильных приложений для
наложения масок на лицо во время звонка до построения систем безопасности,
поиска преступников и мошенников. Сейчас есть инструменты, позволяющие
хранить большой объем данных и обрабатывать изображения, поэтому появилось
множество инструментов для решения различных задач. Об одной из таких задач
будет рассказано в данном посте.

Читать далее

Многоклассовая детекция клеток рака почки: нейросетевой ассистент врача-патоморфолога

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели2.5K

Всем привет, меня зовут Арсений, я студент 2 курса магистратуры Сеченовского университета по специальности "Наноматериал и биофотоника”. В октябре прошлого года я занял первое место во всероссийском межвузовском конкурсе “Samsung Innovation Campus” со своим проектом “Многоклассовая детекция ядер светло-клеточного почечно-клеточного рака” и хотел бы поделиться подробностями.

Читать далее

YOLOv7 для определения поз людей на видео

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели16K

Привет, Хабр!

С вами Максим Алёшин, Data Scientist и участник профессионального сообщества NTA.

В этом посте мы познакомимся с возможностями YOLOv7 для определения поз людей на видео, обсудим принцип работы алгоритма, разберёмся, чем принципиально отличается подход к детекции скелетов человека в модели YOLOv7 и других фреймворках, подробно пройдёмся по всем шагам запуска на инференс предобученной модели YOLOv7-pose для детекции людей с их скелетами.

В процессе копания в первоисточниках и не только, мне удалось почерпнуть несколько интересных фактов о YOLO, чем я поделюсь с читателями. Некоторые труднопереводимые термины будут оставаться как есть.

Узнать больше

Ближайшие события

Andrej Karpathy: глубокие нейросети 33 года назад и 33 года спустя

Время на прочтение10 мин
Охват и читатели7.5K

На мой взгляд, статья Янна Лекуна с соавторами Backpropagation Applied to Handwritten Zip Code Recognition (1989 год) имеет определённую историческую ценность, поскольку, насколько мне известно, это первое реальное применение нейронной сети, от начала до конца обученной при помощи обратного распространения (backpropagation). Если не учитывать крошечный датасет (7291 изображений цифр в градациях серого размером 16x16) и крошечный размер использованной нейронной сети (всего тысяча нейронов), эта статья спустя 33 года ощущается вполне современной — в ней описана структура датасета, архитектура нейронной сети, функция потерь, оптимизация и приведены отчёты об величинах экспериментальных ошибок классификации для обучающего и тестового датасетов. Всё это очень узнаваемо и воспринимается как современная статья о глубоком обучении, только написанная 33 года назад. Я решил воспроизвести эту статью 1) для развлечения, а ещё 2) чтобы использовать это упражнение как исследование природы прогресса глубокого обучения.
Читать дальше →

Как с помощью AI-интеграций повысить популярность проекта

Время на прочтение8 мин
Охват и читатели4.7K

Рассказываем о том, как внедряли новомодные AI-инструменты в проект. Как это повлияло на его популярность и что за этим последовало — читайте в статье.

Технические особенности проекта: фреймворк — Laravel, БД — PostgreSQL, кэш/очереди — Redis, архитектура — основной кластер DigitalOcean Kubernetes и графический кластер GKE.

Читать далее

«Человек. Собака. Человек с собакой». Как искусственный интеллект понимает, что жизни школьников в опасности

Время на прочтение3 мин
Охват и читатели1.7K

В новостях Казани регулярно появляются заголовки о том, что бродячие, беспризорные собаки нападают на людей. Пугают сообщения о том, что школьнику прокусили щеку, на детей напала собака прямо на детской площадке, ребятам из группы школьников прокусили ногу и разорвали куртку… Осенью прошлого года замглавы исполкома Казани Искандер Гиниятуллин сообщал, что в столице Татарстана находится 4 900 животных, подлежащих отлову и стерилизации. Очевидно, что кроме этих мер требуются и другие. Команда исследований в области искусственного интеллекта Центра цифровой трансформации Республики Татарстан (ЦЦТ РТ) в начале года вплотную занялась вопросом.

Как именно - рассказываем в статье.

Читать далее

Как мы искали самый точный метод детектирования ключевых точек

Время на прочтение7 мин
Охват и читатели7.5K

Найдутся ли среди новых методов конкуренты старому доброму SIFT?

Читать далее

Сборка OpenCV с поддержкой OpenVINO

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели4K

В статье мы соберём OpenCV с поддержкой OpenVINO, а также узнаем отличия в скорости инференса модели машинного зрения на C++ и Python при прочих равных.

Читать далее

О работе с персональными данными в «Ситимобил» спустя 2.5 месяца после утечки – взгляд пользователя

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.2K

В этой статье будет рассмотренно продолжение известной по прошлому году истории о подходе к обработке персданных в «Ситимобил». Напомню, 23 декабря 2022 года стало известно об утечке данных водителей «Ситимобил». Компания признала факт утечки, уведомила Роскомнадзор, принесла извинения водителям и заявила о проведении внутреннего расследования. Среди многочисленных утечек (а всего по данным Роскомнадзора в 2022 было зафиксировано порядка 150 крупных утечек персональных данных) утечка у «Ситимобил» отличалась тем, что в открытый доступ попали не просто персданные, а изображения паспортов водителей.

На сегодняшний день информации о назначении штрафа компании еще нет. Но мне кажется, что при его назначении учтут, что в этой утечке были изображения паспортов и, как показано вот здесь изображения селфи водителей с паспортом одновременно. Не знаю можно ли фото, на котором есть и паспорт, и лицо крупным планом, классифицировать как биометрию, но очевидно, что с таким фото возможностей для нанесения ущерба водителю становится сильно больше.

В этой заметке я хочу показать свой взгляд пользователя на то, как происходит обработка изображений паспортов и персданных водителей в «Ситимобил» через 2.5 месяца после утечки.

Читать далее

Распознавание подачи в волейболе с помощью машинного обучения

Время на прочтение6 мин
Охват и читатели4.2K

Развитие искусственного интеллекта сейчас переживает бурный рост, и сфера его применения постоянно расширяется, проникая в области, ранее никак не связанные с ИТ.

Хорошим примером такой экспансии является спорт.

Не так давно появился термин Sport tech и количество проектов значительно выросло за последние несколько лет.

Волейбол — перспективное направление в спортивной аналитике. Один из самых массовых видов спорта, распространен в очень многих странах.

Итак, у нас есть видеозапись волейбольной игры. С какой целью она обычно делается? Возможно, чтобы показать друзьям или пересматривать лучшие моменты долгими зимними вечерами. Но наверное, в сыром виде, запись не очень годится для этого. Ведь скорее всего, первые минут десять игроки будут переодеваться и разминаться, а после каждого розыгрыша будет проходить минута‑другая, пока кто‑то сбегает за мячом.

В общем, мы подходим к очевидной цели — избавиться от всего скучного и оставить только самое интересное. Ок, стратегия ясна, переходим к тактике.

Для стороннего зрителя (которым конечно является искуственный интеллект) есть несколько маркеров для привлечения внимания: игроки, мяч, судья, табло. Любой из этих объяектов может быть подвергнут аналитике. Но сегодня мы поговорим о мяче.

Связь зрительского интереса и мяча вполне очевидна: мяч летает — мы смотрим. Нет мяча — некуда смотреть. В общем, понятно, что нам надо вырезать все кадры, где мяч не летает и тогда это можно будет смотреть без зевоты.

Читать далее