Ээээээ… нахождение общих подпоследовательностей сложно назвать выстраиванием причинно-следственных связей. А уж про искусственный интеллект лучше вообще не говорить всуе.
Я этому тоже подивился, поэтому и спросил про возможность использования целых слов, а не символов. Если использовать слова, то можно построить матрицу расстояний и свести все к кластеризации термов по этой матрице.
Тогда следующий вопрос: результаты рубрикации поступающих данных дополняют потом обучающее множество? Т.е. если вы разобрали новую новость и определили ее в категорию «экономика», то скорректированные цепочки этой новости будут определять принадлежность следующих за ней новостей к этой рубрике? Или же используется только ядро цепочек, построенное на обучающей выборке?
Корректно ли будет вот такое обобщение: по факту вы формируете некоторое множество (нечеткое?) символьных цепочек которые встречаются во всех обучающих текстах для каждой категории?
Мммм… а если символы заменить целыми словами (приведенными к неопределенной форме) и анализировать соответственно большие тексты. Будет работать?
А как работает категоризация (отнесение текста к какой либо теме)? Я так понимаю алгоритм обучается на подготовленном наборе текстов генерируя для цепочки?
Чтобы это не было средней температурой по больнице анализировать надо не ЖЖ в целом, а отдельные сообщества (как явные так и неявные). До этого я еще не дошел — отрабатываю инструментарий и подходы.
Рейтинг комментаторов я выкинул чтобы не перегружать первую часть публикации. Подумаю куда включить эти данные.
А что вы понимаете под «коррелирует с его рейтингом» — если выстроить рейтинг по количеству оставленных комментаторов то с чем считать корреляцию? С его позицией в топе ЖЖ по френдам?
Подобная аналитика не очень выгодна самим сервисам на мой взгляд. Получается что всю движу организует весьма небольшое количество активных участников. Это не плохо, это просто особенность социальных систем и ее надо понимать, а иначе можно сделать ошибочные выводы (специально или по незнанию). Этим часто грешат СМИ и политически ангажированные персоны в блогах.
А как работает категоризация (отнесение текста к какой либо теме)? Я так понимаю алгоритм обучается на подготовленном наборе текстов генерируя для цепочки?
Хотя для меня понимание законов распределения активности участников социальных сетей подтвержденное экспериментом — это тоже смысл.
А что вы понимаете под «коррелирует с его рейтингом» — если выстроить рейтинг по количеству оставленных комментаторов то с чем считать корреляцию? С его позицией в топе ЖЖ по френдам?
Хобби у меня такое.