Обновить
59
Roman Lugovkin@RomanL

Пользователь

11
Подписчики
Отправить сообщение
Ну тут о баесе вообще речи не идет даже близко.
Ээээээ… нахождение общих подпоследовательностей сложно назвать выстраиванием причинно-следственных связей. А уж про искусственный интеллект лучше вообще не говорить всуе.
Я этому тоже подивился, поэтому и спросил про возможность использования целых слов, а не символов. Если использовать слова, то можно построить матрицу расстояний и свести все к кластеризации термов по этой матрице.
Тогда следующий вопрос: результаты рубрикации поступающих данных дополняют потом обучающее множество? Т.е. если вы разобрали новую новость и определили ее в категорию «экономика», то скорректированные цепочки этой новости будут определять принадлежность следующих за ней новостей к этой рубрике? Или же используется только ядро цепочек, построенное на обучающей выборке?
Корректно ли будет вот такое обобщение: по факту вы формируете некоторое множество (нечеткое?) символьных цепочек которые встречаются во всех обучающих текстах для каждой категории?
Что значит «язык изменяется»?
Может лучше вообще в память всасывать всю базу? Какой размер?
Что такое «специальный маркер»?
Мммм… а если символы заменить целыми словами (приведенными к неопределенной форме) и анализировать соответственно большие тексты. Будет работать?

А как работает категоризация (отнесение текста к какой либо теме)? Я так понимаю алгоритм обучается на подготовленном наборе текстов генерируя для цепочки?
на 300 байт!!!???
Последовательность символов или слов?
Секунда на 300 байт — это что, полный перебор что ли?
Это лишь часть целого. Смыслы выделять буду чуть позже.

Хотя для меня понимание законов распределения активности участников социальных сетей подтвержденное экспериментом — это тоже смысл.
Чтобы это не было средней температурой по больнице анализировать надо не ЖЖ в целом, а отдельные сообщества (как явные так и неявные). До этого я еще не дошел — отрабатываю инструментарий и подходы.
Я не понимаю о чем вы. Можно на примере?
Рейтинг комментаторов я выкинул чтобы не перегружать первую часть публикации. Подумаю куда включить эти данные.

А что вы понимаете под «коррелирует с его рейтингом» — если выстроить рейтинг по количеству оставленных комментаторов то с чем считать корреляцию? С его позицией в топе ЖЖ по френдам?
Я пока не нашел структурного или статистического алгоритма выявления ботов. Мысли есть, но я еще их не проверял.
Подобная аналитика не очень выгодна самим сервисам на мой взгляд. Получается что всю движу организует весьма небольшое количество активных участников. Это не плохо, это просто особенность социальных систем и ее надо понимать, а иначе можно сделать ошибочные выводы (специально или по незнанию). Этим часто грешат СМИ и политически ангажированные персоны в блогах.
Познание структуры мироздания :)))
Хобби у меня такое.
Расскажите. Интересно очень.

Информация

В рейтинге
Не участвует
Откуда
Владимирская обл., Россия
Дата рождения
Зарегистрирован
Активность