Комментарии 9
Ого! Спасибо что поделились тут и поздравляю, это очень крутая работа, вы обогнали RF-DETR!
Жаль конечно, что модель коммерческая, в закрытый контур не засунешь, т.е. в системах безопасности ИБ не пропустит, но все равно здорово, что соотечественники тоже двигают CV. И не абы как, а сразу с двух ног, опередив и YOLO и RFDETR.
Насколько я понял, трекинга пока нет?
спасибо за поздравления.
трекинг уже есть -> https://ml.comexp.net/detect
и есть возможность on-premise, конечно

Если я правильно понял ваш алгоритм на основе ваших патентов и прошлых публикаций (которые сумел найти с 10995 года), то в целом у вас следующий поход. В каком-то смысле это "токенизатор" (условно), так как тут главное именно упаковка входного сигнала.
Ваш подход очень похож на то как делают реальные нейроны в зрительной коре.
Это ближе к работам описанным в книге "как мы видим" Ричарда Маслэнд.
Ниже отрывки из книги, по памяти нашел то описание.
Скрытый текст









спасибо. в технические подробности предпочитаем не вдаваться:)
что касается вашего следующего комментария, то а) вы верно уловили, что наш подход похож на то, как делают реальные нейроны в зрительной коре и б) с Ричардом Маслэндом как автором знакомы, но мы в основном берем идеи, кроме своих голов, от других видных ученых. Почитайте, например, нашу предыдущую статью про Язык Мышления – https://habr.com/ru/articles/1061406/
также, если интересно, можете почитать наш "альманах" на тему: https://comexp.net/posts
Да эту статью видел, когда пытался понять, что вы сделали:
от Фодора Language of Thought идея внутренней комбинаторной системы представлений.
от Хомского идея врождённой организации и ограничений
от Ньюэлла/Саймона символьный взгляд на вычисление
от Маслэнда и других подобных, линию Hubel–Wiesel, как раннюю зрительную кору поэтому и преположил как вы вероятно реализовали.
Но с самой статьей https://habr.com/ru/articles/1061406/ не согласен. Например, что TAPe описывает Язык Мышления мозга слишком упрощённо. Так как остается практически только обобщение, я же рассматриваю это как PMAX, когда система балансирует между обобщением и сохранением разнообразия. В случае TAPe, он слишком много уделяется merge, а отбрасывает split информации. И еще ряд других моментов. Но это уже за рамками статьи.
В остальном интересно было понять, как устроен ваш подход.
TAPe+ML более чем вдвое превзошла YOLO? а где оценка на YOLO26s на 500 изображений? (На 30 крошечных изображениях YOLO ожидаемо может банально переобучаться.)
У вас средний размер TAPe данных на один кадр получается порядка 300 байт. Я понимаю, что кадр там совсем крошечный. Нужно хотя бы несколько реальных кадров и примеры сегментации для понимания сложности.
В целом много туманного маркетинга.
Кстати, похоже у них TAPe это quadtree + Walsh/Haar.
Какова вычислительная сложность "TAPe encoding"? Его время включено в приведенные цифры inference?

TAPe+ML v3 на arXiv: превосходим SOTA в классификации, детекции и сегментации при <100 тыс. параметров