Обновить

TAPe+ML v3 на arXiv: превосходим SOTA в классификации, детекции и сегментации при <100 тыс. параметров

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели8.5K
Всего голосов 6: ↑5 и ↓1+7
Комментарии9

Комментарии 9

Ого! Спасибо что поделились тут и поздравляю, это очень крутая работа, вы обогнали RF-DETR!

Жаль конечно, что модель коммерческая, в закрытый контур не засунешь, т.е. в системах безопасности ИБ не пропустит, но все равно здорово, что соотечественники тоже двигают CV. И не абы как, а сразу с двух ног, опередив и YOLO и RFDETR.

Насколько я понял, трекинга пока нет?

спасибо за поздравления.
трекинг уже есть -> https://ml.comexp.net/detect
и есть возможность on-premise, конечно

Если я правильно понял ваш алгоритм на основе ваших патентов и прошлых публикаций (которые сумел найти с 10995 года), то в целом у вас следующий поход. В каком-то смысле это "токенизатор" (условно), так как тут главное именно упаковка входного сигнала.

Ваш подход очень похож на то как делают реальные нейроны в зрительной коре.

Это ближе к работам описанным в книге "как мы видим" Ричарда Маслэнд.

Ниже отрывки из книги, по памяти нашел то описание.

Скрытый текст

спасибо. в технические подробности предпочитаем не вдаваться:)

что касается вашего следующего комментария, то а) вы верно уловили, что наш подход похож на то, как делают реальные нейроны в зрительной коре и б) с Ричардом Маслэндом как автором знакомы, но мы в основном берем идеи, кроме своих голов, от других видных ученых. Почитайте, например, нашу предыдущую статью про Язык Мышления – https://habr.com/ru/articles/1061406/

также, если интересно, можете почитать наш "альманах" на тему: https://comexp.net/posts

Да эту статью видел, когда пытался понять, что вы сделали:

  • от Фодора Language of Thought идея внутренней комбинаторной системы представлений.

  • от Хомского идея врождённой организации и ограничений

  • от Ньюэлла/Саймона символьный взгляд на вычисление

  • от Маслэнда и других подобных, линию Hubel–Wiesel, как раннюю зрительную кору поэтому и преположил как вы вероятно реализовали.

Но с самой статьей https://habr.com/ru/articles/1061406/ не согласен. Например, что TAPe описывает Язык Мышления мозга слишком упрощённо. Так как остается практически только обобщение, я же рассматриваю это как PMAX, когда система балансирует между обобщением и сохранением разнообразия. В случае TAPe, он слишком много уделяется merge, а отбрасывает split информации. И еще ряд других моментов. Но это уже за рамками статьи.

В остальном интересно было понять, как устроен ваш подход.

TAPe+ML более чем вдвое превзошла YOLO? а где оценка на YOLO26s на 500 изображений? (На 30 крошечных изображениях YOLO ожидаемо может банально переобучаться.)

У вас средний размер TAPe данных на один кадр получается порядка 300 байт. Я понимаю, что кадр там совсем крошечный. Нужно хотя бы несколько реальных кадров и примеры сегментации для понимания сложности.

В целом много туманного маркетинга.

Кстати, похоже у них TAPe это quadtree + Walsh/Haar.

quadtree + Walsh/Harmuth (не Haar) явно было бы не достаточно. Да и в патентах 2006 года у них сказано чуть больше. Они все таки пошли дальше. То есть у них буквально изображение собирается в "слова" / "фразы", если абстрагироваться.

Какова вычислительная сложность "TAPe encoding"? Его время включено в приведенные цифры inference?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации