Хабр показывает материалы как ленту соцсети: читают в основном свежее и обсуждают, а через пару недель статья уходит из поля зрения и может попасться читателю если на нее приведет внешний поисковик или по пользователь перейдет с внешнего ресурса. В ленте выигрывают частота публикации и объем. При этом за 20 лет на ресурсе накопилась редкая база знаний: некоторые старые статьи до сих пор отвечают на актуальные вопросы, их держат в закладках, а темы живут десятилетиями.
Я отлично понимаю что любой проект в этом мире пытается выжить и получать прибыль. К чести этого ресурса, у читателя есть возможность сконцентрироваться на контенте и не отвлекаться на мерцание рекламы и баннеров! Но в этом же плюсе Хабра кроется и минус - реклама становится не явной, а вплетенной в текст.
Начинаешь читать материал и получаешь ссылки на телеграм каналы в статьях независимых авторов призывающих подписаться. А в корпоративных блогах рекомендации виртуальных машин на хостинге, подписки на агрегаторы AI чатботов, дозы нейрослопа для поисковой оптимизации сайтов и продуктов с 2023 года, продвижение HR бренда компании для создания очереди кандидатов и тому подобное. И с этим вряд ли станет лучше. Не спасет читателя модерация и политики платформы.
Нарушается баланс между коммерческими интересами продажи корпоративных подписок и мотивацией независимых и не оплачиваемых авторов-энтузиастов создавать и публиковать полезные материалы. Когда техническую статью на которую ты тратишь дни своей жизни в ленте вытесняют генерируемые быстрее кроликов фибоначчи поверхностные материалы, созданные ради продвижения бренда. Автор не находит своего читателя, а все что было дальше второй-третьей страницы ленты уже вряд ли попадется кому-либо на глаза, кроме небольшого шанса быть прочитаным людьми при попадение в выдачу гугла и яндекса.
Я не агитирую “пчел против мёда”! Но предложу свой подход, который позволяет искать нужную информацию среди десятков и сотен тысяч статей. На Хабре есть контент высочайшего качества: описания решений практических задач, фреймворков, технологий, фич и конструкций языков программирования, как выжить в корпорации или стартапе. И все это можно найти как человеку, так и автоматизированным агентам, нужно лишь обработать и подготовить этот массив информации. И да, здесь для обработки статей и их группировки используются нейросети и алгоритмы кластеризации.
Будем группировать 34 тысячи статьи Хабра по смыслу и каталогизировать их, читать похожие по теме не доверяя ключевым словам и хабам которые указал автор материала. Таким же образом вы можете создавать свою локальную базу знаний из личных материалов и записок на работе и дома, при желании не делясь этой информацией с облачными API сервисами нейросетей. Эту же структурированную информацию будет гораздо проще найти и AI агенту для решения ваших технических задач, где нужны точные решения, алгоритмы и “рецепты”.
Материал в статье, не скрывающийся под спойлером, написан вручную дедовским “ламповым” методом. Однако в этой статье многие свои утверждения буду подкреплять ссылками и статистикой под спойлером - это автоматизированная аналитика по базе знаний от “бездушной LLM машины”, которую буду добавлять сюда один в один.
База знаний из 34 тысячи статей с Хабра
Это моя субъективная подборка, считаю что самые интересные или резонансные материалы здесь набрали либо рейтинг от 100, либо у публикации от 100 комментариев, либо ее сохранили от 100 раз в закладки, либо прочитали более 100 тыс. раз. Итого в выборке оказалось около 10% от общего числа доступных статей на ресурсе на середину июня 2026.
Какие поля и данные извлекаются из каждого текста я уже рассказывал в своей прошлой публикации “Некорпоративный Хабр: семантический поиск и фильтрация по структурированным полям в браузере (llama.cpp в WebAssembly)”. В этот раз я увеличил охват материалов и расходы на их обработку c помощью Gemma-4-31B. На извлечение признаков из этих статей ушло 75$, на кластеризацию результатов тратится гораздо меньше, но экспериментов по группировки и измерения их качества было значительно больше.

Статистика по обработке статей и описание процесса
Корпус.
34 270 статей 2006–2026 годов. Каждая статья — markdown-файл с метаданными: заголовок, дата, автор, хабы, теги, просмотры, рейтинг, закладки, комментарии.
Приложение обходит папку и раскладывает метаданные по полям базы.
Отбор: рейтинг от 100, или от 100 комментариев, или от 100 закладок, или от 100 тысяч просмотров.
Модель читает статью.
На каждую статью модель возвращает JSON по схеме, около 30 полей: заголовок, аннотация, смысл, TL;DR, ключевые слова, темы, ключевые выводы, аудитория, тональность, жанр, тип документа, предметная область, полнота, противоречия, приёмы демагогии, реклама, персональные данные, NSFW.
Результат анализа на английском; Причина этого - экономия токенов и лучшая работа с английским компактных локальных LLM моделей
Ответ проверяется по схеме.
Модель —
google/gemma-4-31b-itчерез OpenAI-совместимый API. Приложение умеет работать и с локальными Ollama и llama.cpp.На корпус ушло 266 млн входных и 52 млн выходных токенов, в среднем 7,8 тыс. и 1,5 тыс. на статью.
Анализ через OpenRouter обошёлся в $75,30 — около $0,002 за статью, или $2,20 за тысячу статей.
Прогон шёл в 30 параллельных потоков. Медианный вызов длился 53 секунды, весь корпус занял 30 часов активной работы, а с перерывами — двое суток.
Эмбеддинги.
Отдельный вектор строится для аннотации, смысла и аудитории, а также для каждой темы, топика и вывода.
Модель — Qwen3-VL-Embedding-2B, всего 384 756 векторов размерности 2 048.
Всё лежит в одной базе DuckDB размером около 13,6 ГБ.
Группы и названия.
HDBSCAN на видеокарте (CUDA или Vulkan) делит статьи на группы, в группе минимум 3 статьи.
Модель называет каждую группу по-русски, описывает общие признаки и может исключить чужие статьи. Исключённые статьи предлагаются соседним группам.
Затем названия групп сами группируются в уровни дерева, а статьи вне групп притягиваются голосованием ближайших соседей.
Качество проверяется метриками и LLM-судьёй: тест на лишний элемент, проверка заголовков.
LLM-вызовы для кластеризации обошлись в $33,92, так что весь эксперимент стоил около $109.
Что получилось в пространстве «Смысл».
30 300 статей (88%) разложены по 7 245 группам.
Дерево из экспорта
habr_meaning: 7 245 → 1 516 → 203 → 19 разделов.
Группировка материалов
После того как из статей извлечены признаки и на них рассчитаны эмбеддинги, настает время кластеризации.

Создавая новую коллекцию выбираю поле “Смысл” и запускаю работу HDBSCAN алгоритма в своем приложении, который группирует семантически похожие статьи, используя их эмбеддинги. Для каждой группы с помощью LLM создается ее название и описание, какие общие черты у публикаций в группах и какие из кандидатов в группу нейронка считает не подходящими. Когда все листовые группы созданы алгоритмом, в ход вступает агломеративная кластеризация их в дерево.

А далее можно экспортировать иерархию групп статей в html, markdown, json или xml. В случае с markdown вы можете использовать привычный вам Obsidian и работать с подготовленной базой знаний в нем. Либо открыть/опубликовать вашу группировку материалов как статический веб сайт с возможностью просматривать в режиме 3D связи между группами.

Результаты группировки значений статей я выложил на github pages

Проблемы читателей и авторов технических публикаций
Лента в стиле соцсети позволяет удерживать аудиторию и возвращаться к чтению Хабра снова и снова. Но что хорошо для коротких новостей и фото пятничных котиков, противоположно по мотивации чтению сложных и объемных технических публикаций. После того как позиция в ленте вытесняется более новыми публикациями все меньше шансов что эту информацию вообще кто-либо прочтет и оценит/прокомментирует. Хочет ли проводить много времени за листанием ваша целевая аудитория или она появляется спонтанно на очень короткое время?
Немного из материалов Хабра на тему ленты
Лента соцсети. «Листая страницы Хабра, поймал себя на мысли, что я воспринимаю Хабр как новостную ленту в социальной сети» — «Хочу больше годных профстатей, Хабр», 2021.
Одно и то же пишут заново. «…на Хабре это практически невозможно, несмотря на попытки внедрить трекер, систему уведомлений и поднимать старые темы на главную страницу. Поэтому люди вынуждены постоянно публиковать новые статьи об одном и том же предмете» — «Почему форумы продолжают жить», 2023.
Хабр это признаёт.
«Думаем, как помочь читателям находить хорошие старые статьи — их на Хабре накопилось прилично» — «Реакции на Хабре: постмортем», 2025.
«Строить на Хабре рекомендательную систему на реакциях — так себе удовольствие» — «На Хабре появились реакции: зачем и почему», 2024.
Поиск и хабы задачу не решают.
Поиск по словам хвалят: «Хабр сделал хороший поиск по всем своим разделам» — geekr, 2021. Но искать можно только то, что уже знаешь, как назвать. Обзора темы поиск не даёт.
Хабы перепутаны: «проблемой является беспорядочное размещение материалов в Хабы» — «Починим Хабр?», 2022.
Этот тезис звучал ещё в 2014 году. «…на сайте, где многие посты сохраняют свою актуальность годами, нельзя прятать поиск. Для Хабра внутренний поиск так же важен как для гугла, и должен быть всегда доступен» — «Что не так с редизайном Хабрахабра», 2014 (среди тегов статьи — «Денискин верни поиск»).
Метапример: критика интерфейса ходит по кругу. Все статьи ниже нашлись в одной ветке дерева «Интерфейс и UX Habr» (27 статей, 2008–2022). Инструмент сам достал историю вопроса, которую лента давно забыла. Вот некоторые из материалов:
Год
Статья
Просмотры
2008
713
2011
3 085
2012
48 874
2014
145 957
2018
26 484
2021
60 778
2022
11 623
Выигрыш сейчас не в пользу тех кто тратит многие часы и дни на вдумчивое написание статьи, а также для подготовки данных и кода для публикации. Побеждает за внимание читателя тот, кто публикует больше и чаще.
Статистика по 34 тысячам публикаций говорит что...
Корпоративных блогов стало больше. Доля статей из блогов компаний в выборке: 4% в 2012 году, 24% в 2015-м, 36% в 2020-м, пик 47% в 2021-м, 39% в 2025-м.
Реклама по оценке модели.
В корпоративных статьях модель нашла рекламу в 66% за все годы и в 77% в 2024 году.
В авторских статьях доля выросла с 8% в 2013–2018 годах до 34% в 2025-м.
Telegram-каналы. До 2017 года ссылки на Telegram-канал были в 1–2% статей. В 2024-м они есть в 57% корпоративных статей, в 2025-м — в 33% авторских.
Голос сообщества: «Рак, убивающий Хабр, ака «подпишитесь на мой телеграм-канал»», 2024.
Нейрослоп.
«Но сейчас я вижу то, что я не просто не люблю, я ненавижу — нейрослоп… Дешевый некачественный копирайтинг еще никогда не был ТАК дешев» — «Вы не сможете это развидеть: краткий гайд по определению LLM-текстов на Хабре», 2025.
«Это замкнутый круг: дешевый контент вытесняет дорогой (речь больше о временных трудозатратах), а с приходом дешевого контента уходят и серьезные авторы» — «Тихий апокалипсис: я устал читать сгенерированные статьи», 2025. «Как AI захватывает Хабр, и почему это всех бесит» и «Хабр, GPT, корпоративные блоги и БМЛы».
Лента глазами читателей.
«Вдумчиво полистайте ленту и посчитайте, сколько там треша и бесполезного шума» — «Хабр мёртв», 2025.
«Новость с +10 просидит на главной Хабра намного дольше, и будет в состоянии собрать 10к просмотров» и «Старожилы читают контент Хабра через кучу фильтров и скриптов» — «Хабр — стоп кран», 2024.
Нюанс: читатели выбирают авторов.
«В 2025 году медианная статья автора из топа собирает 15 460 просмотров. У компании из топа — 5 530» — «Хабр умирает, и это не кликбейт», 2025.
В выборке медиана просмотров авторских статей тоже выше: 48,6 тыс. против 31,7 тыс. в 2024 году.
Медианный рейтинг корпоративных статей при этом выше: 100 против 60. С 2020 года корпоративные статьи почти вдвое чаще попадают в выборку только за счёт рейтинга, без 100 комментариев и 100 закладок: 9,8% против 5,4%. «Как и зачем компании накручивают голоса на хабре» и «Считаем чужие лайки: есть ли на Хабре накрутки?».
Спрос на авторские тексты есть, но лента показывает то, что публикуется чаще.
И вот тут начинается самое интересное. Заголовки статей иногда не соответствуют фактическому содержанию, публикация добавлена не в те хабы, ключевые слова добавлены “от балды” или шуточно. Ну и текущая система таксономии хабов - это лишь одна из возможных проекций тематической классификации. А ведь у статьи есть еще выводы, дополнительные темы и целевая аудиторий, по которым тоже хотелось бы искать. И эту работу лучше переложить на нейросеть, она может монотонно с незначительным разбросом от ожидаемого выдавать название статьи по смыслу, краткое содержание, ключевые слова и целевую аудиторию для каждого из материала. И инструментом для этого я поделился бесплатно четыре месяца назад.
Авторы часто не могут найти что уже написано по данной теме и снова и снова повторяются с минимальной новизной того что они пишут. А есть темы которые можно рассказывать снова и снова, если “упаковать” это в уникальную авторскую обертку
Замечание о вечных темах и статьях похожих по смыслу
Закладки. Статьи до 2015 года — это 53% выборки и 58% всех закладок. Статьи до 2020 года — 80% выборки и 84% закладок. Больше всего закладок у статей 2012–2014 годов. Оговорка: закладки копятся годами.
Тихие справочники. 5 218 статей (15% выборки) попали в неё только благодаря закладкам: рейтинг и комментарии у них ниже 100. Их мало обсуждали, зато сохраняли, и медиана просмотров у них самая высокая — 153 тыс. против 20 тыс. у статей, прошедших только по комментариям. Это справочный слой архива: к таким статьям возвращаются, но в ленте они не заметны.
Темы живут десятилетиями.
В 2 559 из 7 245 смысловых групп есть статьи и до 2015 года, и начиная с 2020-го. В этих группах 43% всех сгруппированных статей.
У трети статей до 2015 года (5 978 из 18 094) есть смысловой «сосед» из 2020-х.
Одну тему пишут заново. Группа «Регулярные выражения»:
2011 — пособие для новичков, 924 тыс. просмотров;
2018 — «в Python от простого к сложному», 1,8 млн;
2021 — «основы», 1,3 млн;
2024 — «простыми словами», две части.
Группа | Статей | Годы | До 2015 / с 2020 | Медиана просмотров | Закладок всего |
|---|---|---|---|---|---|
Язык программирования Rust | 43 | 2012–2026 | 4 / 27 | 39 904 | 5 104 |
Эффективность работы в командной строке Linux/Unix | 27 | 2011–2025 | 8 / 12 | 122 509 | 16 982 |
Парадокс Ферми | 27 | 2012–2026 | 4 / 11 | 30 479 | 1 821 |
Оценка языка PHP | 21 | 2008–2025 | 9 / 8 | 26 703 | 3 805 |
Методы эффективного изучения языков | 20 | 2007–2025 | 9 / 6 | 108 574 | 9 029 |
Модульное тестирование и TDD | 19 | 2008–2022 | 8 / 5 | 32 537 | 6 116 |
Архитектура и проектирование программного обеспечения | 19 | 2013–2025 | 5 / 6 | 69 308 | 4 605 |
Настройка и использование SSH | 16 | 2008–2023 | 8 / 4 | 190 016 | 13 901 |
Регулярные выражения | 15 | 2009–2024 | 7 / 5 | 237 439 | 10 903 |
Алгоритмы на графах | 12 | 2009–2024 | 8 / 4 | 122 293 | 3 351 |
Проектирование REST API и ресурсов | 12 | 2011–2025 | 4 / 7 | 47 664 | 2 920 |
Арифметика чисел с плавающей запятой | 12 | 2011–2025 | 4 / 5 | 53 911 | 4 109 |
Примеры статей из нескольких категорий, которые можно читать снова и снова:
Тема | Год | Статья | Просмотры | Закладки |
|---|---|---|---|---|
Регулярные выражения | 2011 | 923 726 | 1 150 | |
Регулярные выражения | 2018 | 1 796 041 | 2 680 | |
Регулярные выражения | 2021 | 1 295 113 | 1 334 | |
Регулярные выражения | 2024 | 64 983 | 819 | |
Регулярные выражения | 2024 | 29 847 | 404 | |
SSH | 2012 | 1 603 807 | 7 265 | |
SSH | 2017 | 552 683 | 1 834 | |
SSH | 2022 | 81 472 | 497 | |
SSH | 2023 | 435 238 | 231 | |
Командная строка | 2015 | 252 130 | 2 313 | |
Командная строка | 2025 | Терминал — ваш лучший друг: 5 утилит командной строки, которые заменят вам GUI | 57 410 | 548 |
Вот ссылка на созданную программой группировку материалов для регулярных выражений.
Как это может улучшить Хабр
С помощью этого подхода можно добавить “Страницы тем” созданных автоматически, но после могут редактироваться людьми чтобы устранить неточности и искусственность. Как способ навигации по огромному объему материалов технической библиотеки.
На основе этой же группировки можно было бы добавить блок “На эту тему писали раньше” под статьей, где автор мог бы понять что уже написано на эту тему и в чем именно ему стоит быть оригинальнее.
Добавить к статье поля “тон”, “приемы демагогии” итп чтобы читателю было заранее понятно стоит ли читать эту публикацию.
Классификацию и группировку 34тыс. статей Хабра по смыслу, вы можете открыть и смотреть семантические группы в режиме 3D навигатора https://igor-suhorukov.github.io/habr_articles/
Выводы
Интересного и полезного контента на Хабре много - не хватает навигации по тому что написано сообществом за последние 20 лет. Лента показывает свежее, а встроенный поиск находит только то что ты знаешь как искать, хабы созданы как исторически сложилось и ценные материалы ждут случайного перехода из гугла или яндекса. Группировка по смыслу статей закрывает именно этот разрыв. Модель обрабатывает статьи и извлекает из них структурированную информацию по заданным полям, эмбеддинги и алгоритмы кластеризации собирают похожее вместе и LLM дает этим группам осмысленное название, а агломеративная кластеризация собирает группы в дерево. По этому дереву может искать как человек, так и AI агент выполняя запрос пользователя
Причем это оказалось подьемно для одного человека - 34тыс. статей обошлись в 109$ включая множество экспериментов и устранения ошибок программы кластеризации. Этот же подход сработает и на ваших собственных текстах и заметках, документации и архивах материалов. Возможно даже сделать это на домашнем компьютере или ноутбуке с мощной видеокартой от 16Gb VRAM если вы не хотите отдавать личные данные в облачные API
Буду рад замечаниям в комментариях по качеству групп и их названий: какие темы разъезались, какие слиплись в одну группу и по какому критерию статьи вам бы было интереснее искать.

