Комментарии 1
Статья ради статьи, вы быть хоть как-нибудь серьезно отнеслись к подготовке материала.
Даже в самых базовых уроках, книгах, статьях используют нормальные токенизаторы, к примеру из библиотек NLTK/Gensim, а не python-овский strip().
Не говоря уже о том, что пропущенные такие базовые этапы как удаление стоп слов (его сам TfIdfVectorizer может провести), лемматизация/стемминг, настройка параметров векторизатора.
Выглядит как какой-та низкокачественная калька с англоязычной статьи по типу этой.
Зарегистрируйтесь на Хабре, чтобы оставить комментарий
Инжиниринг признаков: извлечение признаков из текста