Комментарии 2
"Категориальные" - более часто употребимый в DataScience, и более удобочитаемый термин для categorical data, чем те два что используются в статье.
Тема интересная и важная, во многом недооцененная. Аналитики и кодеры намеренно уходят от категориального анализа (работают как со строками), поскольку в популярных пакетах pandas, pyarrow и др. существует много тонкостей в работе категорий, и простая замена str на cat - 100% приведет к поломкам ETL сразу в нескольких местах.
Т.к. категории - это список всех возможных значений, и/или "пустот" - на практике возникает много ошибок в "корреспондирующих сущностях" данных (дебет-кредит, субконто 1С по дебету и кредиту и итд). Такие категориальные данные из строк нужно создавать по нормативным данным (справочникам - Плану счетов 1С) или по объединениям сущностей дт+кт (слышу как кто-то побежал проверять как создется у него).
На Хабре о проблемах пока ни слова, но достаточно статей о плюсах категорий в части скорости выборки и экономии RAM (2X, 4X быстрее чем с object/string-данными).
Кажется, что по тексту есть ошибка
В примере сопряжённой таблицы мужчин, предпочитающих литературу, 45
А девушек в том же столбце 35
Анализ номинативных данных