Pull to refresh

Comments 11

ну не знаю, на сколько много полезной информации на хабре, за последние пару лет, почти ежедневного скролла статей, дай бог 10 полезных статей наберется. в основном вода какая то.

Больше полезной информации нахожу в статьях давность которых переваливает за 5-6 лет назад.

А так да, у самого тоже давно мысли есть (а времени на реализацию нет :D, + пока ИИшка гугловская очень помогает в поиске) запилить какой ни будь инструментарий для майнинга-полезной инфы из хабра и прочих ресурсов.

Но я бы не стал ориентироваться на внутренние показатели рейтинга статей, т.к бывает вроде бы в заминусованных статьях проскальзывает что то полезное, а так же комментарии к самими статьям тоже надо парсить\анализировать, тоже бывает полезные мысли озвучивают.

раздумываю реализацию на базе семантики статей, типа сколько полезных слов используется в статье и прочее и прочее, т.е рейтинг больше как косвенный показатель, а не решающий чтобы был.


upd:
кек посмотрел, что у Вас уже есть статья про семантический поиск :D

Знания нужно переводить в формы, доступные для быстрой и удобной навигации. В рамках этого ресурса задача невыполнимая - это другое, здесь песочница для обмена идеями, добыча их (доуточнение) через публикацию статей и комментирование.

Дистилляция должна быть с использованием других инструментов и площадок. Типа такого - Атлас технологий разработки программного обеспечения - благо сейчас технологии позволяют собрать все.

Когда техническую статью на которую ты тратишь дни своей жизни в ленте вытесняют генерируемые быстрее кроликов фибоначчи поверхностные материалы, созданные ради продвижения бренда.

Эту бы энергию - да в мирное русло (с)

Проблема в том, что многие не знают уже что такого придумать и фантазируют всякое, оторванное от реалий жизни и дают это на вход ИИ - понятно, что на выходе получаем.. Ничего не получаем.

КМВ, положение бы спасли проекты (отдельный раздел), к которым могли бы примкнуть желающие и туда направить свои усилия (продвижение). Взять какие-то неисследованные темы, покрутить их с разных сторон, что-то наподобие научной соцсети вперемешку с Kaggle, crowdsource. Такое, на длительную дистанцию, а не одна статья ограниченая авторским видением.

Тема этой публикации как раз про перевод исходной информации в формы по которым легко искать.

Ваш подход с Атласом и мой с таксономией смыслов публикаций скорее дополняют друг друга. Ведь таксономия статей строится от корпуса материалов и их групп снизу-вверх, а куратор атласа сверху-вниз по своей созданной ранее иерархии классификаций. Качество исходных материалов это отдельная тема и она может как коррелировать с рейтингом и популярностью, так и нет.

КМВ, положение бы спасли проекты (отдельный раздел), к которым могли бы примкнуть желающие и туда направить свои усилия (продвижение). Взять какие-то неисследованные темы, покрутить их с разных сторон, что-то наподобие научной соцсети вперемешку с Kaggle, crowdsource.

Остается понять как это реализовать, зачем это нужно самим участвующим и как набрать достаточное сообщество для этого. Как и в любой соцсети у пользователей должна быть мотивация тратить на это время, некая движущая сила.

Так владельцы и не пробовали даже делать удобно. Элементарно, есть закладки, но поиска в закладках нет.

От создателей озон, "вы никогда не найдете свой заказ, если ему больше 2 месяцев. Вы же не надеялись на поиск в списке заказов, которых могут быть по 20-30+в месяц"

Я бы хотел видеть все статьи в хронологическом порядке, что-то вроде календаря.

Скрытый текст

База знаний из 34 тысячи статей с Хабра

... что самые интересные или резонансные материалы здесь набрали либо рейтинг от 100, либо ...

База знаний и статьи на массовость... Если резонансные, то да, если глубокотехнические?.. Сколько человек по-тихому жаловались, что хардкорно технические статьи (узкой тематики) не собирают достаточной аудитории и валяются около < +15. Зато очередная статья про man openssh наберет сколь угодные числа читателей.

Есть тут такая проблема! Сколько в штуках таких глубокотехнических статей никто не знает и как их отделить их от 340тыс. других статей тоже. По существующим метаданным это не сделать.

Если обрабатывать ВСЕ то мне понадобится 1000$ на это на аккаунте OpenRouter и пару недель на обработку. Или около года на своем компьютере и приличный счет за электроэнергию…

Я понимаю. Это прямое "отделять зёрна от плевел", что и человеку-то не просто делать. Нужно хоть как-то в теме быть, хоть чтобы дать оценку "просто/средне/глубоко". А если средне/глубоко, то еще бы и качество писанины и насколько тема нова или повторяется.

Например взять цикл статей @Molechkaпро регулярки. Избитая тема? Да. Нужна (мне)? Нет. Но написано отлично, с иллюстрациями и объяснение для новичков такое, что остается только к мелочам формулировки придираться (для улучшения точности и простоты понимания). И на фоне других статей начального уровня можно сказать - тема закрыта.

Ссылку вы кстати сами в кат. про регулярки привели. То есть система работает.

То есть система работает. Какая система? Голосования на хабре/популярность или кластеризации?

Про названные критерии… Нейронкой для каждой публикации заполняется уровень аудитории, полнота раскрытия темы и чего в ней не хватает, плюс жанр, тип документа, противоречия в текстее, приемы демагогии и наличие рекламы. Для 34тыс. статей: начальный уровень 13092, средний 19421, глубокий 1515, не определен в 242 статьях. Быть “в теме” нужно только уж в очень редких случаях - матфизика, генетика итп. Полнота: всесторонний 23298, умеренный 9983, поверхностный 989.

Эти параметры не основная тема здесь, так что статистику по ним не добавлял. В публикации фокус на группировке и иерархическом указателе для групп.

Новизна и избитость темы - это свойства не отдельной публикации а группы. Поэтому вначале их надо кластеризовать, а потом уже оценивать между собой внутри. Спасибо за интересную мысль!

Система кластеризации работает. Не обязательно быть идеальной, если она лучше поиска Хабра (ничтожный) или поисковиков (по ранжированию толковость статьи не понять).

Спонтанная мысль, рейтинг за статью можно давать с коэффициентом от сложности статьи.

Sign up to leave a comment.

Articles