Возвраты в онлайн‑торговле одеждой держатся, по разным оценкам, на уровне 20–30%, а в отдельных категориях доходят до половины заказов. Главная причина устойчиво одна: не подошло по посадке, и на неё приходится около половины всех возвратов. Задача выглядит как классическая рекомендательная: есть покупатель, есть товар, надо предсказать метку. Ниже я разберу, почему в этой постановке она недоопределена в принципе, и что из‑за этого происходит с моделями.

Дисклеймер про мой интерес: я занимаюсь подбором белья офлайн, то есть той самой процедурой, которую эти системы пытаются заменить. Мне важно понимать, где у них потолок.

Что мы наблюдаем и что определяет исход

Возьмём самый неудобный класс изделий — тот, где посадка бинарна и ошибка заметна сразу. У бюстгальтера маркировка состоит из двух величин: обхват под грудью и буква, кодирующая разность между обхватом по выступающим точкам и обхватом под грудью.

Итого два числа, а теперь перечислим, что физически влияет на результат:

  1. обхват под грудью;

  2. разность обхватов, то есть объём;

  3. ширина основания груди — расстояние между точками, где мягкая ткань примыкает к грудной клетке;

  4. глубина, то есть насколько объём вынесен вперёд относительно основания;

  5. проекция — где именно расположен максимум объёма: ближе к центру, ниже, выше;

  6. упругость тканей и подвижность, от которой зависит, как форма меняется под нагрузкой.

Первые два наблюдаемы и закодированы в маркировке. Остальные не наблюдаемы, в маркировке не отражены и между собой не связаны жёстко.

Формально это система, где вектор признаков размерности два подаётся на вход функции, зависящей минимум от шести переменных. Решения не существует не потому, что модель плохая, а потому, что информации на входе меньше, чем степеней свободы у объекта. Никакая архитектура этого не чинит: недостающие четыре координаты надо откуда‑то взять.

Куда обычно берут недостающие координаты

Способ первый и самый распространённый — восстанавливать их из истории покупателя. «Вы носите такой‑то размер в таком‑то бренде» плюс рост и вес, дальше коллаборативная фильтрация по похожим пользователям.

Тут есть тонкость, которую стоит проговорить явно. Такая модель восстанавливает не тело, а согласие конкретного человека с конкретным лекалом конкретного бренда. Это принципиально другая величина, и полезна она, пока мы остаёмся внутри знакомых бренду лекал, и деградирует ровно там, где нужнее всего: на новом бренде, на новой линейке, на краях размерного диапазона, где выборка тонкая.

Способ второй — учиться на возвратах. Здесь начинается самое интересное с точки зрения качества разметки.

Возврат — сигнал слабый и смещённый сразу с двух сторон. Отсутствие возврата не означает «подошло»: человек мог оставить вещь, потому что возврат неудобен, потому что вещь дешёвая, потому что он уже не помнит про срок. Наличие возврата не означает «не тот размер»: причиной мог быть цвет, качество, передумал. Метка, которую мы обучаем, определена косвенно и шумно, а её распределение зависит от логистики магазина сильнее, чем от анатомии покупателя.

Показательно, как с этим работают на практике. В статье SizeFlags (Nestler, Karessli, Hajjar, Weffer, Shirvany, KDD 2021) описана байесовская вероятностная модель, обученная как раз на слабо размеченных данных большого масштаба, с A/B‑проверкой в продакшене в четырнадцати странах. Обратите внимание на постановку: авторы не пытаются восстановить тело покупателя. Они выявляют товары, которые систематически маломерят или большемерят, то есть переносят задачу с покупателя на изделие, где данных на порядок больше и сигнал устойчивее.

Это, на мой взгляд, единственный честный способ выжать пользу из такой разметки. Он снимает часть систематической ошибки лекала и не решает индивидуальную задачу вообще — да и не заявляет, что решает.

Почему подбор по фотографии не закрывает дыру

Регулярно возникает идея снять недостающие параметры с фото или видео, благо оценка позы и силуэта давно решённая задача.

Проблема не в компьютерном зрении, а в том, что именно измеряется. Фотография даёт внешний контур одетого или полуодетого человека в конкретной позе. Ширина основания и проекция — это характеристики того, как мягкая ткань прилегает к грудной клетке, и снаружи по контуру однозначно не выводятся: два разных сочетания дают один и тот же силуэт. Добавьте, что интересующая нас геометрия меняется под нагрузкой, а измерять её надо в том состоянии, в каком изделие будет носиться.

И главное — нет ground truth. Чтобы обучить регрессию с фото на «правильный размер», нужен размеченный набор, где правильный ответ установлен независимым способом. Такого открытого набора нет, а построить его дорого: это ручной обмер плюс экспертная оценка посадки, то есть работа человека на каждый пример.

Что можно посчитать, а что нет

Полезное упражнение — прикинуть мощность пространства.

Двухпараметрическая сетка масс‑маркета: примерно шесть значений пояса и четыре чашки, порядка 24 позиций. Расширенная: двенадцать поясов и одиннадцать букв, 132 позиции. Добавим ширину основания с тремя градациями — 396. Добавим проекцию, тоже три — 1188.

Мультипликативный рост номенклатуры и есть настоящее ограничение. Даже если модель идеально предскажет все шесть координат, отгружать нечего: изделия с нужной комбинацией не существует, потому что производство не держит тысячу с лишним лекал при крайне неравномерном спросе по ячейкам.

Отсюда следует неприятный для нашей отрасли вывод. Точность рекомендации сверху ограничена не качеством модели, а разрешением каталога. Предсказывать с точностью выше шага сетки бессмысленно: результат всё равно округлится до ближайшей существующей позиции.

Чего я не нашла

Открытых датасетов с честным ground truth по посадке в публичном доступе нет — только данные о возвратах и о том, какой размер человек выбрал сам. То есть воспроизводимо сравнить подходы негде, и любые заявленные проценты точности сравнивать между собой некорректно: у них разные определения правильного ответа.

Не нашла я и общепринятой метрики. «Подошло» — это отсутствие возврата, оценка самого покупателя или экспертная проверка посадки? Три разные величины, которые в статьях и в маркетинговых материалах регулярно называются одним словом.

И последнее наблюдение, которое мне кажется важнее остальных. Задача обычно подаётся как предсказательная, хотя по устройству она измерительная: не хватает не модели, а входных данных. Пока в маркировке два числа, а в изделии шесть значимых параметров, самый эффективный шаг — не улучшать предсказание, а добирать недостающие координаты измерением. Офлайн это делает человек с сантиметровой лентой за час, и именно поэтому процедура до сих пор не автоматизирована — она не про алгоритм, а про сбор данных, которых нет.