
Комментарии 33
Приятного общения с герром майором.
Расширение не обходит никакой защиты. Оно читает открытые статьи через сессию самого пользователя, держит полторы секунды между запросами и замолкает на три минуты по первому же 429. Сохраняет локально, с указанием автора и ссылкой на оригинал, никуда не публикует.
По ГК на личное использование обнародованного есть 1273 и 1335.1, а соглашение Хабра само делает исключение для личного некоммерческого сохранения с сохранением атрибуции. Так что герру майору показывать особо нечего :)
Да кому нужны твои парсеры статеек. У товарища майора есть дела поважнее, чем гоняться за расширениями для хрома
Хм. неплохо, сразу же появилась идея, многие бы думаю порадовались выложенному архиву хабра на какой-то трекер в md формате без всякого г вокруг и что бы статьи которые он не выдаёт для русских ип, тоже конечно выкачались. А потом было бы неплохо еще включить механизм фильтрации от откровенного нейрослопа, ну точнее маркировка таких статей, что бы их можно выключить было из поиска и просмотра. Ну а ещё удобный поиск, сортировка, катологизация.
А как вы храните важные статьи, чтобы не потерять?
Наваял скрипт на Питоне, с помощью бесплатного ИИ-сервиса, который загружает мои статьи из Хабра на компьютер, причем, отображение максимально похожее, но, не требующее Интернета. Эти статьи я, постепенно (по мере отсутствия лени), выкладываю, затем, на свой сайт: https://lecole.free.nf/articles.php .
А что насчёт картинок, md же поддерживает локальные ссылки на png/jpg. А расширение не выкачивает их?
Упс, вот оно, кто тоже с ходу не нашёл настройка - тут. Протестировал как работает, слежение в том числе. Это великолепно читать хабр в своём любимом редакторе .md без смс и регистраци без спама и с фильтрацией тегов! Спасибо за отличный плагин.

В силу возраста и плохого зрения много читать могу только "с бумаги".
Поэтому всегда "ручками" копировал статьи в Ворд и распечатывал для дальнейшего чтения.
За расширение - спасибо!
В российском праве есть статья 1335.1 ГК — про извлечение материалов из обнародованной базы данных. Она разрешает делать это без разрешения правообладателя в личных, научных и образовательных целях в оправданном объёме, а в иных целях — в объёме, составляющем несущественную часть базы.
Интересно, а поисковики как-то по-другому работают? Они ведь стараются скачать и проиндексировать существенную часть базы.
Поисковики на это не опираются. В сайтах зашит robots.txt - по сути это разрешение от сайта, что и в каком объёме индексировать.И поисковик не замещает источник, тк он отдаёт сниппет со ссылкой и возвращает читателя на площадку. В той же 1335.1 ключевое ограничение звучит как «необоснованное ущемление интересов изготовителя базы», а поисковик их наоборот обслуживает. Плюс у поисковиков есть отдельный статус информационного посредника (1253.1 ГК) со своим режимом ответственности, а это вообще другая правовая конструкция, чем извлечение материалов пользователем.
Расширение достаёт данные из HTML по CSS-селекторам вроде .tm-article-presenter__meta или .tm-publication-hub__link
Есть вот такой URL, он возвращает данные в JSON:
https://habr.com/kek/v2/articles/1061238/?fl=ru&hl=ru
Есть ещё вот такое r.jina.ai/https://habr.com/ru/articles/1061856/ выдаёт тоже .md на выходе, но увы картинок не прикрепляет. И это малость избыточно, использовать ллм для парсинга, но бесплатно, а за регистрацию или логин через google дают 10.000.000 токенов по api. Я использую кое где в проектах такой вот "парсинг".
Вот это очень полезно, спасибо!
а для комментариев есть урл?
Комментарии статьи:
https://habr.com/kek/v2/articles/1061238/comments/?hl=ru
Комментарии пользователя:
https://habr.com/kek/v2/users/4external/comments?fl=en%2Cru&hl=ru&page=2
За экспорт в маркдаун для обсидиана однозначно респект. У меня так половина базы знаний собрана, потому что закладки в браузере мертвы по определению
Спасибо за расширение.
Пробую "offline" для чтения в самолёте.
Ваша же статья https://habr.com/ru/articles/1061856/, пробовал несколько раз, очищая историю скачивания
1) сохраняется без картинок
2) нет сохранённых комментов
ещё баг - когда описывается картинка, во всяком случае c remote url, не допускается пробел между ! и [.
у локальных 
а у remote! [cs2_degenerate.jpg](https://habrastorage.org/r/w1560/getpro/habr/upload_files/10c/d1b/c48/10cd1bc4833c39403532e39a30d536f1.webp)
и как-то бы посмотреть лог при пакетной загрузке
Сохранение присутствует, надо включить в настройках

Подскажите, а он все сваливает в одну папку? общим скопом? или может раскладывать по названиям?
О, наконец-то! А то каждый раз перед посадкой в самолет лотерея с тем, сколько вкладок со статьями удержит браузер телефона без желания их перезагрузить. При старом дизайне хабра не было скриптов, я под сотню статей как-то открыл, на 5 часов полета чтоб хватило, все были в памяти и не пытались заставить браузер перегрузить страницу. А сейчас уже так не работает, бывает десяток вкладок держится, бывает вообще 2-3 и всё :(
Попробую теперь скачать вот так, спасибо!
На лисе пользуюсь этим https://github.com/deathau/markdown-clipper
а есть возможность скачать свои закладки, чтобы читать их оффлайн?

Написал расширение, которое качает статьи Хабра в Markdown — и не долбит сервер