Обновить
6
Моисеев Арсений@MoZZes

Data scientist, гаражный изобретатель

1
Подписчики
Отправить сообщение
В целом, это все как раз о том, как из «сырого» сделать «образцовый», если я правильно понял, вы предлагаете сравнить, как будет работать LDA на изначально «образцовом» и на прошедшем предобработку датасете — сложно сказать. Я думаю, что 20 newsgroups dataset, переведенный на русский тоже потребует похожей предобработки, возможно в упрощенной форме, а так, на нем скорее всего будут более хорошие результаты — тексты из ВК уж очень разнородные + в 20 newsgroups letters побольше данных(18к текстов VS 4к).

Информация

В рейтинге
Не участвует
Откуда
Москва, Москва и Московская обл., Россия
Зарегистрирован
Активность