Comments 11
ну не знаю, на сколько много полезной информации на хабре, за последние пару лет, почти ежедневного скролла статей, дай бог 10 полезных статей наберется. в основном вода какая то.
Больше полезной информации нахожу в статьях давность которых переваливает за 5-6 лет назад.
А так да, у самого тоже давно мысли есть (а времени на реализацию нет :D, + пока ИИшка гугловская очень помогает в поиске) запилить какой ни будь инструментарий для майнинга-полезной инфы из хабра и прочих ресурсов.
Но я бы не стал ориентироваться на внутренние показатели рейтинга статей, т.к бывает вроде бы в заминусованных статьях проскальзывает что то полезное, а так же комментарии к самими статьям тоже надо парсить\анализировать, тоже бывает полезные мысли озвучивают.
раздумываю реализацию на базе семантики статей, типа сколько полезных слов используется в статье и прочее и прочее, т.е рейтинг больше как косвенный показатель, а не решающий чтобы был.
upd:
кек посмотрел, что у Вас уже есть статья про семантический поиск :D
Знания нужно переводить в формы, доступные для быстрой и удобной навигации. В рамках этого ресурса задача невыполнимая - это другое, здесь песочница для обмена идеями, добыча их (доуточнение) через публикацию статей и комментирование.
Дистилляция должна быть с использованием других инструментов и площадок. Типа такого - Атлас технологий разработки программного обеспечения - благо сейчас технологии позволяют собрать все.
Когда техническую статью на которую ты тратишь дни своей жизни в ленте вытесняют генерируемые быстрее кроликов фибоначчи поверхностные материалы, созданные ради продвижения бренда.
Эту бы энергию - да в мирное русло (с)
Проблема в том, что многие не знают уже что такого придумать и фантазируют всякое, оторванное от реалий жизни и дают это на вход ИИ - понятно, что на выходе получаем.. Ничего не получаем.
КМВ, положение бы спасли проекты (отдельный раздел), к которым могли бы примкнуть желающие и туда направить свои усилия (продвижение). Взять какие-то неисследованные темы, покрутить их с разных сторон, что-то наподобие научной соцсети вперемешку с Kaggle, crowdsource. Такое, на длительную дистанцию, а не одна статья ограниченая авторским видением.
Тема этой публикации как раз про перевод исходной информации в формы по которым легко искать.
Ваш подход с Атласом и мой с таксономией смыслов публикаций скорее дополняют друг друга. Ведь таксономия статей строится от корпуса материалов и их групп снизу-вверх, а куратор атласа сверху-вниз по своей созданной ранее иерархии классификаций. Качество исходных материалов это отдельная тема и она может как коррелировать с рейтингом и популярностью, так и нет.
КМВ, положение бы спасли проекты (отдельный раздел), к которым могли бы примкнуть желающие и туда направить свои усилия (продвижение). Взять какие-то неисследованные темы, покрутить их с разных сторон, что-то наподобие научной соцсети вперемешку с Kaggle, crowdsource.
Остается понять как это реализовать, зачем это нужно самим участвующим и как набрать достаточное сообщество для этого. Как и в любой соцсети у пользователей должна быть мотивация тратить на это время, некая движущая сила.
Так владельцы и не пробовали даже делать удобно. Элементарно, есть закладки, но поиска в закладках нет.
От создателей озон, "вы никогда не найдете свой заказ, если ему больше 2 месяцев. Вы же не надеялись на поиск в списке заказов, которых могут быть по 20-30+в месяц"
Я бы хотел видеть все статьи в хронологическом порядке, что-то вроде календаря.
Скрытый текст
База знаний из 34 тысячи статей с Хабра
... что самые интересные или резонансные материалы здесь набрали либо рейтинг от 100, либо ...
База знаний и статьи на массовость... Если резонансные, то да, если глубокотехнические?.. Сколько человек по-тихому жаловались, что хардкорно технические статьи (узкой тематики) не собирают достаточной аудитории и валяются около < +15. Зато очередная статья про man openssh наберет сколь угодные числа читателей.
Есть тут такая проблема! Сколько в штуках таких глубокотехнических статей никто не знает и как их отделить их от 340тыс. других статей тоже. По существующим метаданным это не сделать.
Если обрабатывать ВСЕ то мне понадобится 1000$ на это на аккаунте OpenRouter и пару недель на обработку. Или около года на своем компьютере и приличный счет за электроэнергию…
Я понимаю. Это прямое "отделять зёрна от плевел", что и человеку-то не просто делать. Нужно хоть как-то в теме быть, хоть чтобы дать оценку "просто/средне/глубоко". А если средне/глубоко, то еще бы и качество писанины и насколько тема нова или повторяется.
Например взять цикл статей @Molechkaпро регулярки. Избитая тема? Да. Нужна (мне)? Нет. Но написано отлично, с иллюстрациями и объяснение для новичков такое, что остается только к мелочам формулировки придираться (для улучшения точности и простоты понимания). И на фоне других статей начального уровня можно сказать - тема закрыта.
Ссылку вы кстати сами в кат. про регулярки привели. То есть система работает.
То есть система работает. Какая система? Голосования на хабре/популярность или кластеризации?
Про названные критерии… Нейронкой для каждой публикации заполняется уровень аудитории, полнота раскрытия темы и чего в ней не хватает, плюс жанр, тип документа, противоречия в текстее, приемы демагогии и наличие рекламы. Для 34тыс. статей: начальный уровень 13092, средний 19421, глубокий 1515, не определен в 242 статьях. Быть “в теме” нужно только уж в очень редких случаях - матфизика, генетика итп. Полнота: всесторонний 23298, умеренный 9983, поверхностный 989.
Эти параметры не основная тема здесь, так что статистику по ним не добавлял. В публикации фокус на группировке и иерархическом указателе для групп.
Новизна и избитость темы - это свойства не отдельной публикации а группы. Поэтому вначале их надо кластеризовать, а потом уже оценивать между собой внутри. Спасибо за интересную мысль!
Спонтанная мысль, рейтинг за статью можно давать с коэффициентом от сложности статьи.
Как превратить Хабр из ленты соцсети в библиотеку и базу знаний