Знаю только про Сбер ;) они видео обрабатывали. В принципе, если найду нормальный контакт с обществом глухонемых или носителем языка - готов продолжить работу. А может, посмотрю их датасет ;)))
Честно говоря, я писал диплом на тему распознавания алфавита глухонемых... Изначально была идея yolo + conv2d, но производительность не позволила. Поэтому я пришел к mimepipe + dense. С одной кисти получались 21 координаты (х, y, z) и все прилично работало 4 снимка в секунду... Про тепловые карты немного не понятно, я бы использовал разницу кадров - это мне кажется более перспективным ;)
Да, только буквы. Для полного жестового языка нужно датасет писать. Я еще не смотрел датасет на котором сбердевайсы учились, но в планах это есть ;))
Lstm и сканирование всего человека в массив (координат 300)…
Знаю только про Сбер ;) они видео обрабатывали. В принципе, если найду нормальный контакт с обществом глухонемых или носителем языка - готов продолжить работу. А может, посмотрю их датасет ;)))
Потому, что голос - один массив данных, а жесты - две руки, туловище, губы и лицо…
Это все можно сканировать и распознавать ;)) я бы взялся, но я не носитель языка
Я бы попробовал, была бы перчатка ;)
Честно говоря, я писал диплом на тему распознавания алфавита глухонемых... Изначально была идея yolo + conv2d, но производительность не позволила. Поэтому я пришел к mimepipe + dense. С одной кисти получались 21 координаты (х, y, z) и все прилично работало 4 снимка в секунду... Про тепловые карты немного не понятно, я бы использовал разницу кадров - это мне кажется более перспективным ;)