Обновить

Написал расширение, которое качает статьи Хабра в Markdown — и не долбит сервер

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели12K
Всего голосов 27: ↑25 и ↓2+27
Комментарии33

Комментарии 33

Приятного общения с герром майором.

Расширение не обходит никакой защиты. Оно читает открытые статьи через сессию самого пользователя, держит полторы секунды между запросами и замолкает на три минуты по первому же 429. Сохраняет локально, с указанием автора и ссылкой на оригинал, никуда не публикует.

По ГК на личное использование обнародованного есть 1273 и 1335.1, а соглашение Хабра само делает исключение для личного некоммерческого сохранения с сохранением атрибуции. Так что герру майору показывать особо нечего :)

Да кому нужны твои парсеры статеек. У товарища майора есть дела поважнее, чем гоняться за расширениями для хрома

Хм. неплохо, сразу же появилась идея, многие бы думаю порадовались выложенному архиву хабра на какой-то трекер в md формате без всякого г вокруг и что бы статьи которые он не выдаёт для русских ип, тоже конечно выкачались. А потом было бы неплохо еще включить механизм фильтрации от откровенного нейрослопа, ну точнее маркировка таких статей, что бы их можно выключить было из поиска и просмотра. Ну а ещё удобный поиск, сортировка, катологизация.

Интересная идея, спасибо, подумаю над этим на досуге :)

И комментарии!

Обалденно, очень интересно было изучить. А случайно ни у кого не остался магнет линк на дата сет, чисто для ознакомительных исследовательских целей надо..

И назовем этот трекер рутрекер-хабр-эдишн)

А как вы храните важные статьи, чтобы не потерять?

Наваял скрипт на Питоне, с помощью бесплатного ИИ-сервиса, который загружает мои статьи из Хабра на компьютер, причем, отображение максимально похожее, но, не требующее Интернета. Эти статьи я, постепенно (по мере отсутствия лени), выкладываю, затем, на свой сайт: https://lecole.free.nf/articles.php .

Прикольно сделали, спасибо, что поделились

А что насчёт картинок, md же поддерживает локальные ссылки на png/jpg. А расширение не выкачивает их?

Упс, вот оно, кто тоже с ходу не нашёл настройка - тут. Протестировал как работает, слежение в том числе. Это великолепно читать хабр в своём любимом редакторе .md без смс и регистраци без спама и с фильтрацией тегов! Спасибо за отличный плагин.

В силу возраста и плохого зрения много читать могу только "с бумаги".
Поэтому всегда "ручками" копировал статьи в Ворд и распечатывал для дальнейшего чтения.
За расширение - спасибо!

В российском праве есть статья 1335.1 ГК — про извлечение материалов из обнародованной базы данных. Она разрешает делать это без разрешения правообладателя в личных, научных и образовательных целях в оправданном объёме, а в иных целях — в объёме, составляющем несущественную часть базы.

Интересно, а поисковики как-то по-другому работают? Они ведь стараются скачать и проиндексировать существенную часть базы.

Поисковики на это не опираются. В сайтах зашит robots.txt - по сути это разрешение от сайта, что и в каком объёме индексировать.И поисковик не замещает источник, тк он отдаёт сниппет со ссылкой и возвращает читателя на площадку. В той же 1335.1 ключевое ограничение звучит как «необоснованное ущемление интересов изготовителя базы», а поисковик их наоборот обслуживает. Плюс у поисковиков есть отдельный статус информационного посредника (1253.1 ГК) со своим режимом ответственности, а это вообще другая правовая конструкция, чем извлечение материалов пользователем.

Есть ещё вот такое r.jina.ai/https://habr.com/ru/articles/1061856/ выдаёт тоже .md на выходе, но увы картинок не прикрепляет. И это малость избыточно, использовать ллм для парсинга, но бесплатно, а за регистрацию или логин через google дают 10.000.000 токенов по api. Я использую кое где в проектах такой вот "парсинг".

Вот это очень полезно, спасибо!

а для комментариев есть урл?

Спасибо!

За экспорт в маркдаун для обсидиана однозначно респект. У меня так половина базы знаний собрана, потому что закладки в браузере мертвы по определению

Спасибо за расширение.
Пробую "offline" для чтения в самолёте.

Ваша же статья https://habr.com/ru/articles/1061856/, пробовал несколько раз, очищая историю скачивания
1) сохраняется без картинок
2) нет сохранённых комментов

ещё баг - когда описывается картинка, во всяком случае c remote url, не допускается пробел между ! и [.
у локальных

![](images/articles_1040826/01.gif)

а у remote

! [cs2_degenerate.jpg](https://habrastorage.org/r/w1560/getpro/habr/upload_files/10c/d1b/c48/10cd1bc4833c39403532e39a30d536f1.webp)

и как-то бы посмотреть лог при пакетной загрузке

Логи добавлю в следующем обновлении, а насчёт описания картинок спасибо, исправлю это

Сохранение присутствует, надо включить в настройках

Подскажите, а он все сваливает в одну папку? общим скопом? или может раскладывать по названиям?

В настройках можно включить сохранение по типу и по хабу

О, наконец-то! А то каждый раз перед посадкой в самолет лотерея с тем, сколько вкладок со статьями удержит браузер телефона без желания их перезагрузить. При старом дизайне хабра не было скриптов, я под сотню статей как-то открыл, на 5 часов полета чтоб хватило, все были в памяти и не пытались заставить браузер перегрузить страницу. А сейчас уже так не работает, бывает десяток вкладок держится, бывает вообще 2-3 и всё :(

Попробую теперь скачать вот так, спасибо!

а есть возможность скачать свои закладки, чтобы читать их оффлайн?

Да

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации