Обновить

Как используют Computer Vision в Ретейле в 2026 году и какие я вижу вызовы

Всем привет, меня зовут Илья, техлид по CV в ретейл-компании, веду свой блог в тг https://t.me/ilia_sevostianov

Недавно гонял на выставку в Сингапур NRF Retail 2026 - и очень много интересного там удалось увидеть, как вообще используют компьютерное зрение в ретейле в настоящее время.

И был сильно поражен и изумлён!

Казалось бы, да, CV развивается бешеными темпами, LLM тоже обновляются с завидной частотой, кто-то уже начинает говорить про AGI, но при всём при этом в ретейле все так же используют в подавляющем большинстве классические, надежные 2Д-модельки.

К примеру, вот есть задача контроля выкладки на стеллажах. Расскажу подробнее

Изображение было взято из статьи Ultralytics про контроль планограммы с помощью YOLO26
Изображение было взято из статьи Ultralytics про контроль планограммы с помощью YOLO26

У нас есть планограмма - это то, как товар должен быть расставлен на полке.
А есть факт - реалограмма - как у нас товары выставлены на самом деле.

Стоит задача: провести аудит, что у нас выставлено на полках, что соответствует планограмме, есть ли у нас пустые места на полках, пересорт и прочее

И почти каждый из экспонент на выставке эту задачу решают,, кто-то лучше, кто-то хуже, но тем не менее: используют ёлку, кто-то извращается с VLM и делает это с планшета, как Starbucks

Это, конечно, круто! Для супербольших магазинов, наверное, это может быть полезно - выставляем камеры или пускаем платформу мобильную, которая проводит аудит - и розница решает, что с этим делать.

Но вот чего мы не увидели: НИКТО не умеет просчитывать количество товаров на полках.

Ни у кого не было рабочего пилота, абсолютно ни у кого. Но 2 экспоненты явно дали понять, что у их партнеров (больших сетей магазинов) такой запрос есть. И они хотят запускать пилоты.

Ретейл очень интересен с точки зрения CV. И вот какие вызовы я вижу:

  • Просчет количества товаров на полках, инвентаризация

  • Отслеживание пути покупателя в магазине

  • Антифрод в магазине и на кассах самообслуживания

  • Уменьшение очередей на кассах

  • Раскладка "горячих" товаров в особо проходимых местах

и другие

Я стараюсь писать в своем телеграмм-канале про эти и подобные кейсы. Подписывайтесь, буду рад! https://t.me/ilia_sevostianov

И да, а что вы думаете, увидим ли мы реально работающий магазин аля Amazon Go, который работает в реальном магазине, и когда?

Теги:
Всего голосов 2: ↑0 и ↓2-2
Комментарии0

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Наш проект называется ExVRAM Lab. Это открытая исследовательская лаборатория, в которой мы проверяем, насколько большие локальные LLM можно запускать на обычных видеокартах с ограниченным объёмом VRAM, если использовать ultra‑low‑bit quantization, полное размещение весов на GPU и существующие open‑source inference‑технологии.

ExVRAM расшифровывается как Exchange Compute for VRAM. Основная идея проекта — в ряде сценариев выгоднее потратить часть свободной вычислительной мощности GPU на работу с более компактным представлением весов, чем хранить часть модели в оперативной памяти и постоянно передавать данные через PCIe.

Когда мы начинали проект, исходный вопрос был достаточно простой: можно ли запустить dense‑модель примерно на 27 миллиардов параметров на видеокарте всего с 8 ГБ VRAM так, чтобы она не просто «запустилась», а работала полностью на GPU, поддерживала длинный контекст и обеспечивала нормальную интерактивную скорость генерации.

В качестве основной тестовой системы мы используем NVIDIA GeForce RTX 5060 8 GB на архитектуре Blackwell. Основная модель в текущих экспериментах — Qwen3.8–27B.

Сначала результат выглядел не слишком впечатляюще. Модель запускалась, но значительная часть весов оставалась в системной памяти. Около 5,7 GiB весов находилось на GPU, ещё примерно 2,5 GiB — на CPU. Скорость генерации составляла порядка 3,8–5,5 токена в секунду.

При этом сама видеокарта была загружена далеко не полностью.

Это стало одним из первых важных наблюдений проекта. Проблема заключалась не столько в нехватке вычислительной мощности RTX 5060, сколько в том, что часть decoder weights находилась в RAM. Во время autoregressive generation данные приходилось постоянно передавать между CPU и GPU через PCIe.

Как мы запустили Qwen3.8–27B целиком на RTX 5060 8 GB и получили ~30 токенов/с

Публикации