Обновить

Комментарии 2

"Категориальные" - более часто употребимый в DataScience, и более удобочитаемый термин для categorical data, чем те два что используются в статье.

Тема интересная и важная, во многом недооцененная. Аналитики и кодеры намеренно уходят от категориального анализа (работают как со строками), поскольку в популярных пакетах pandas, pyarrow и др. существует много тонкостей в работе категорий, и простая замена str на cat - 100% приведет к поломкам ETL сразу в нескольких местах.

Т.к. категории - это список всех возможных значений, и/или "пустот" - на практике возникает много ошибок в "корреспондирующих сущностях" данных (дебет-кредит, субконто 1С по дебету и кредиту и итд). Такие категориальные данные из строк нужно создавать по нормативным данным (справочникам - Плану счетов 1С) или по объединениям сущностей дт+кт (слышу как кто-то побежал проверять как создется у него).

На Хабре о проблемах пока ни слова, но достаточно статей о плюсах категорий в части скорости выборки и экономии RAM (2X, 4X быстрее чем с object/string-данными).

Кажется, что по тексту есть ошибка

В примере сопряжённой таблицы мужчин, предпочитающих литературу, 45

А девушек в том же столбце 35

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Информация

Сайт
otus.ru
Дата регистрации
Дата основания
Численность
101–200 человек
Местоположение
Россия
Представитель
OTUS