Обновить

Комментарии 92

Корень проблемы в том, что за исходящий трафик платит владелец сервера. Достаточно минимальных изменений и проблема уйдёт - либо Вам будет плевать кто и сколько скачивает страницы, а то и чем больше - тем лучше будет, либо боты сами будут следить за тем, чтобы не активничать.

Можно придумать много схем реализации, каждая со своими интересантами, но они внедряются, ибо

  • интересанты уже толкаются локтями, хотя пока это и не бросается в глаза

  • можно спровоцировать переход на прямой обмен сообщениями без централизации, типа как в старину наука развивалась потому, что учёные писали друг-другу письма

Сама по себе борьба с ботами ничем обоснована быть не может, ибо боты действуют на благо Франции от имени и по поручению людей.

Физика: "иду я нафиг".

"Сама по себе борьба против участия мужчин в соревнованиях для женщин ничем обоснована быть не может, ибо мужчины действуют на благо Франции от имени и по поручению женщин."

По теме статьи: сеть на доверии всегда будет служить злоумышленникам (цена свободы).

Как говорится, а что автор оргинального поста ожидал?

Он построил 1,5 миллиона публичных страниц с профилями, причём сам набрал данные скрейпингом чужих открытых источников, имеет около 500 человеческих посетителей в день — и внезапно обнаружил, что его огромную машиночитаемую базу данных читают машины. Ну надо же! Для такого сайта как раз человек и должен быть совершенно диким посетителем. Это не «99% современного веба — боты», это «я построил роскошную кормушку для краулеров».

Вот чего не отнять в смысле выводов: ИИ-краулеры действительно изменили экономику скрейпинга. То есть старое соглашение «Google качает пачкой мои страницы, зато приводит покупателей» у генеративного поиска действительно ломается.

Но тут, похоже, нужно не запретами бороться, а выстраиванием кеша. Думаю, собери он страницы статикой (да, 1.5 млн файлов статикой - это не суперобъём), было бы проще. Автор полгода совершенствует систему распознавания незваных гостей, вместо того чтобы сначала сделать так, чтобы незваный гость мог взять бесплатную брошюру у двери, но не включая ему свет, кондиционер и SQL-сервер.

P.S. Cloudflare Workers сейчас включает 10 млн запросов в месяц, сверх этого запросы стоят $0,30 за миллион, а исходящий трафик вообще не тарифицируется. Поэтому фраза «боты заставляют меня платить $90» сама по себе ничего не объясняет. Деньги съедают вычисления, D1/KV и архитектура запросов — и автор чуть дальше сам признаётся в неэффективных запросах и настройках кэша. Т.е. человек сначала сделал так, чтобы просмотр публичной страницы был платной серверной операцией, а потом долго и героически защищает её файрволлом от просмотра.

Я смотрю на это с точки зрения физики. Любой запрос стоит ресурсов (платный). Чем раньше отрубишь запрос тем меньше ресурсов серверам нужно потратить (во всей цепочке прохождения пакета от клиента до сервера). Любой запрос, что имеет околонулевую вероятность конверсии в оплату, можно слать в лес, если брать только экономический баланс. И там 3.6 млн. "китайцев" в сутки ломилось, т.е. в ~$10 в месяц сверху бы ему это встало только на запросах, если не считать, что это число может вырасти (всякие сайты с БЖУ и пр. фигнёй парсят часто и иногда жёстко). CF тоже не впёрлось отдавать по каждому бесплатному клиенту 10 млн. запросов в день, поэтому у них там и своя фильтрация есть.

На пустой сервак у меня иногда до 100 уникальных IPшников пробивается с ipset с чёрными списками (подсетями). С серыми списками перед чёрными проходит максимум пара десятков. Без этого логи они забивают быстро, ненужной фигнёй (без учёта простого дропа по портам и лимитам). Большая часть - запросы на уязвимые url всяких CMS/.NET/Python/NodeJS и пр. серверов.

У меня приблизительно такие же проблемы, но у меня свой bare metal сервер и на счет это не вляет.

Есть один момент, о котором автор не упомянул, и как мне кажется выстрелил себе в ногу блокировкой ДЦ - это любые email, содержащие ссылки на сайт. Поясню:
когда отправляется любое письмо со ссылками/картинками на ваш сайт (не важно каким способом отправляется и откуда, например отправка может быть не из вашего сайта, а например из mailchimp) - почтовые сервера получателя (например gmail, yahoo и т.д.) не только сканируют письма на вирусы, но и проверяют буквально каждую ссылку в нем. И делают это ОЧЕНЬ агресивно. Они отправляют HEAD запрос на каждую ссылку в каждом письме. Например разослав красивое html письмо с картинками и новостями сайта на 5000 ардесов вы получите мощный ДДОС из около 50к HEAD запросов за несколько минут (при условии что в письме 10 ссылока на сайт). И повторный всплеск трафика, но уже GET запросов, когда ваши письма начнут массово открывать (и почтовый клиент будет подтяшивать контент с вашего сайта). А открывают письма в основном в веб-клиенте.

А теперь угадайте где размещаются большество почтовых серверов и почтовых веб клиентов? Правильно - в ТОПовых ДЦ США, которые автор заблокировал.

Я наступил на эти грабли, когда тоже заблокировал крупные ДЦ и ефективность рассылок упала у меня на 90+%. Оказалось если ссылки в письме битые (HEAD не вернет 200) - почти все почтовики либо отправляют письмо в спам, либо вообще deffered. И даже если письмо доставилось, и его откроют - то оно будет не читаемым HTML мусором.

Отдельная головная боль - локальные почтовые клиенты (Outlook, The Bat, Thunderbird и другие) - они скачивают письмо, и при открытии тянут контент с сайта из IP пользователя, но используя свои юзерагенты. И проверку JS - они не умеют. Блокировать их тоже нельзя так как по сути это реальные посетители. Но вот боты активно используют эти юзерагенты.

И вишенка на торте - неторые почтовики используьт свои прокси для работы с письмами, вроде GoogleImageProxy, которые тоже имеют сотни тысяч ИП от ДЦ США.
Вишенка номер два - проверка вообще может выполнятся из другого континента. Я часто вижу ситуацию после рассылки, когда основная масса запросов от почтовиков по ссылкам в письме прилетает из Британии или Нидерландов, при том что сайт и сервер в США и 99% посетителей из США.

Это по сути касается любой рекламы/продвижения. Группа в FB, телеграм канал, и прочие - все будет тянуть контент из ДЦ США, а вы их заблокировали.

В конце указан e-mail автора оригинала. Можете поговорить.

Классное дополнение автора комментария и статья раскрыла мне не известные до селе знаниях.

Интересно как дальше интернет экономика будет развиваться на фоне того что хостить сайт на стороннем сервисе будет супер дорого из-за ботов.

Все будет нормально. Просто ваш подход - не верный. Автор борется с ветряными мельницами.
Представьте, что ваш сайт вруг стал попульрный и все эти запросы от ботов - реальные пользователи. Ведь по сути это не взлом/ SQLinj, а обычные запросы контента. Что бы вы делали в этом случа? Правильный ответ - кеш!

Мой сайт имеет реальных 5к посетителей в сутки, но обслуживает 3 миллиона запросов в сутки без увеличения стоимости хостинга и без увеличения нагрузки на сервере. Как? Да благодаря бесплатному тарифу CloudFlare, в котором есть edge cache, и 10 правил для его управления. Итого к серверу доходит около 100к запросов в сутки, что вполне нормально для 5к посетителей. Остальные 2,9М запросов и около 500 Gb трафика - отдаются из кеша CF (все цифры приведены без статики, js, css, картинок и т.д., только запросы к страницам). Все бесплатно.


Там есть некоторые мелкие сложности, в основном связанные с URL param. Но это требует минимальных изменений на сайте, вроде заменить /?page=1 на /page/1. Но общая стратегия строится на принципе "кешировать все, кроме...".

Например у вас интернет магазин на вордпресс + вукоммерс, создаем правило
Bypass cache для
(http.cookie contains "wordpress_logged_in_") or (http.cookie contains "woocommerce_items_in_cart") or (http.cookie contains "woocommerce_cart_hash") or (http.cookie contains "wp_woocommerce_session_") or (http.cookie contains "wordpress_sec_") or (http.cookie contains "wp-postpass_")
и вуаля, ничего не кешируется для залогиненых пользователей, пользователей с товарами в корзине, с сессией вукомераса и т.д. Не кешируются админка, личные кабинеты и вся прочая "private" зона. Вся прелесь в том, что 99,99% ботов не умеют в кукис от слова совсем.
не кешировать апи и фиды? изи
http.request.uri.path contains “/wp-json” or http.request.uri.path contains “/wp-api”

И такими исключениями вы выкидываете из кеша, все что не должно кешироватся. 10 правил хватает с головой (учтите, в одно правило можно запихнуть множество условий, ограничение - 4000 символов на правило, это очень много). Остальное - попадет в кеш CF и будет отдаватся с него, даже не обращаясь к вашему серверу. Картинки, страницы, js, css, шрифты - абсолютно все из кеша. Пусть хоть миллиард запросов от ботов, вы их не заметите, они не дойдут к серверу.


Что то поменяли на какой то странице сайта и нужно очистить кеш на CF? Изи, у них мощнейшее АПИ для этого. Большенство CMS с коробки предоставляют функционал хуков. Если на вордпрессе изменили страницу/товар - это автоматически дергает хук. Вам осталось написать 20 строк кода, чтобы отправить запрос на АПИ очистки кеша для страницы которую выдал хук и все будет работать автоматически (говорят для этого есть даже официальный плагин от CF, но по слухам он полное говно и прохо поддерживается. Я не пробовал). Хоть каждые 5 минут обновляйте сайт, в кеше всегда будет свежая информация без ваших усилий.

Проходит несколько лет и интернет становится де-факто частной собственностью CloudFlare. Где они и решают, что можно хостить, что нельзя, и кому.

Вот полностью согласен, первое что пришло в голову при прочтении статьи, а автор думал использовать кеш? 90% проблем у него уйдут, как минимум со счетами если включит жёсткое кеширование.

Мой сайт имеет реальных 5к посетителей в сутки, но обслуживает 3 миллиона запросов в сутки без увеличения стоимости хостинга и без увеличения нагрузки на сервере. Как? Да благодаря бесплатному тарифу CloudFlare, в котором есть edge cache, и 10 правил для его управления. Итого к серверу доходит около 100к запросов в сутки, что вполне нормально для 5к посетителей. Остальные 2,9М запросов и около 500 Gb трафика - отдаются из кеша CF (все цифры приведены без статики, js, css, картинок и т.д., только запросы к страницам). Все бесплатно.

На мой древний сайтик, на который заходят только старожилы, тоже обрушился ботнет. У меня также была мысль использовать CF, но т.к. РКН борется с CF у посетителей сайта сайт перестал открываться. Извиняюсь за тавтологию. Каким образом вы сумели встроить CF в свой флоу?

Мои сайты, посетители, контент и инфраструктура и сервера никак не связаны с Россией и РНК. Более того, у меня РФ вообще перманентно заблокирована на CF, вместе с Китаем, Сингапуром и Индией. Не потому что меня беспокоят боты из этих стран, а потому что из них идет около 80% действительно вредоносных запросов (сканы уязвимостей, попытки sqlinj и тому подобное)

Раз тут перепись :). есть у меня git.mydomain.com(на Forgejo), 99% там - зеркала разных интересных мне проектов. 7 млн хитов в месяц, 248k visitors, 314 Gb. Hetzner, SEMRush, OVH, Alibaba US, Microsoft. ИИ боты в основном.

Проблем с потреблением ресурсов пока нет.

Пусть хоть миллиард запросов от ботов, вы их не заметите, они не дойдут к серверу.

А Потом прилетает мелкий поток на ваш API с random param, который пробивает любой кэш. Да еще и с разных IP, с 50 RPM, которые не матчат никакие правила, т.к. это уладывается в профиль легитимного поситителя.

8)

И тут уже приходится уже искать другие решения.

если вы оставляете ваши апи ендпоинты без ограничения rate limit и без ограниения доступа по IP (хотя это и на всех ендпоинтах возможно) - это исключительно ваша проблема. Rate limit + API endpoint это как Отче Наш же...

Rate limit + API endpoint это как Отче Наш же...

Воистину! Сразу видно опытного теоретика. )
У вашего вышестоящего маршрутизатора не хватит портовой емкости, а у маршрутизатора вашего аплинка - просто не хватит сил переживать такой PPS.
Ваш API и не узнает что была атака, и ваш мониторинг, даже если он и был, покажет в лучшем случае небольшой спайк, а потом полное отсутствие трафика.

p.s. вы просто не представляете маштаб возможных атак, когда атакует серьезный бизнес или государство.

Я устал заниматься оптимизациями своего старого wordpress'а - борбьа с ботами, спам-коментами, CDN... Психанул, конвертировал в статичные HTML и захостил на Cloudflare pages. Дышать легче стало.

Очень верное решение, если оно возможно технически!
В последнее время многие переходят, благо генераторов хватает.
Простор для оптимизации - почти безграничный.

x402 внедрят полноценно. Боты будут оплачивать такие запросы (ну или не будут если автор сайт хочет слишком много а автор бота не считает нужным платить). Cloudflare кстати тестирует.

Как с почтой быть - вот не очень понятно но - можно тупо и клиентский софт доработать.

Боты хотят данные, судя по всему в общем защититься от ботов вы не можете (я знаю что статья перевод и автора тут нет, но с этим сталкиваются многие так или иначе), т.е. данные они и так получат, но стоить этот процесс будет для владельца сервера заметные суммы.

Решение - отдать данные добровольно, в удобном виде, без ограничений (автор и так их точно так же забрал у других, так что 'по совести' это верный шаг). А свой сервис строить не на самих данных, а как инструмент по работе с ними, т.е. предоставить возможность пользователю приходить на сайт не за данными а за решением.

p.s. большая часть сайтов, которые я частично скрайпил для себя, предоставляли максимально неадекватные возможности, т.е. данные есть но без полной их загрузки себе, сделать с ними почти ничего нельзя.

Есть методы отдать ботам не те данные, за которыми они пришли. Это следующий "эшелон обороны". Не всегда сервис предоставляющий возможность работы с данными, является чем-то эксклюзивным. Очень часто именно данные являются наибольшей ценностью. Особенно если данные не скрапятся из открытых источников, а создаются руками человека.

Сначала получите shadowban от всех поисковиков, потом изгоните часть клиентов, приняв их за ботов, а потом только начнёте задумываться, а была ли польза.

Ну естественно "не лоб" же принимается решение о том, кто к нам пришел. Белый бот, черный бот или реальный посетитель. К тому же, поверьте, если вы ошиблись и приняли белого поискового бота как черного (хотя это весьма сложно, реверc lookup работает очень четко), то что вместо условного числа "100" в данных будет "125" никоим образом не смутит поисковую систему. Это просто проверено уже 10-ю годами разработки и эксплуатации такой системы.

Защитится от всех ботов нет, а от 99% запросто банальной проверкой жава-скрипт. Да если бы у нас клаудфлар работал, то было бы сильно проще отсекать большую часть подозрительного трафика

А зачем отдавать данные ботам? добровольно.

Строить сервис не на данных, а не сервисе? так это другой бизнес, другие инвестиции

Например, вот у Вас Хабр (любой статейник), какой сервис Вы построите?

Как писали в других местах, проблема в том, что бот тупой. Если на сайте есть фильтры, например, по тегам, бот скачивает все возможные комбинации значений фильтров заново. Миллионы раз подряд скачивает одни и те же данные, переставляя галки на фильтре.

У меня тоже по сайту в основном боты лазают. Но я не особо страдаю от этого, правда. У меня почему-то посещаемость гораздо меньше. Да и после появления нейросетей ещё упала сильно.

у меня ботов не наблюдается, равно как и траффика от нейросетей. я бы даже приветствовал его увеличение, значит инфа на сайте интересная, разве нет?

Если инфа на сайте не интересна даже ботам, то она не интересная.

у чела то хоть Cloudflare есть, банально поставил проверку на всех подозрительных

а не так как у нас в России: тоже борюсь с ботами, включал на 12 часов на днях. Да только я сам не могу попасть на сайт без КВН. (или может с Cloudflare в России все хорошо и это я настроил неправильно? (заходить пытался через мобильный Мегафон)

По поводу "страданий", рекламная сеть Яндекса уже 2 раза выкинула мой сайт "за недействительные показы и клики". Вот и думайте

Заблочил в панели ISP менеджер всю Азию. Штаты, Канаду, Европу пока нет (но руки чешутся)

Ситуация со скрейпингом ухудшается, потому он становится дешевле, поэтому я считаю, что единственное решение проблемы — экономическое. Cloudflare создаёт систему pay‑per‑crawl, при которой краулеры платят за запрос в edge‑сети

Да, решение проблемы должно быть экономическим. Но лежит оно IMHO глубже, в изменении самой экономической модели Интернета.

Сейчас основа экономической модели интернета - это “экономика внимания”: экономический смысл существования сайтов, если смотреть в корень и без иллюзий - это использование возможности манипуляции пользователями, чтобы им что-нибудь втюхать, либо самим владельцем сайта - если сайт служит для продажи какого-нибудь товара/услуги, - либо теми, кто покупает у владельца эту возможность (то есть, рекламу) на сайте. Для такой экономической модели боты вредны, потому что им ничего не втюхаешь, и отдачи их посещения не приносят. Сами же владельцы ботов в такой экономической модели являются “безбилетниками”: они получают данные, но не платят за них. И это совершенно обоснованно ощущается как несправидливость.

Только вот платить посредникам, типа того же Cloudflare за то, чтобы избавиться от ботов-безбилетников - это IMHO ничуть не более справедливо. А справедливым было бы платить непосредственно за то, что получаешь. Благо Интернет служит отличной технологической платформой для микротранзакций (а транзакции здесь будут именно микро-, потому что себестоимость отдачи данных сама по себе невелика). Вот посредник, который сможет организовать именно такие микротранзакции (к примеру, списывая на них деньги со счетов пользователей, куда пользователи кладут некие суммы заранее), пусть даже не забесплатно - это IMHO куда более справедливое решение. И, главное - куда лучше охватываемое контуром рыночного регулирования через спрос/предложение: потребитель платит именно за то, что он реально получает и может оценить насколько ему это нужно, продавец-сайт может устанавливать цену на свои данные в соответствии со спросом. И всё - честно, не то, чтобы совсем без обмана (не обманешь – не продашь, как известно), но вполне прозрачно для участников рынка.

Короче, я даже не джва, а джвадцать джва года хочу такой интернет. Но, как известно, хотеть не вредно, но не более того.

PS Мне могут сказать, что такое уже есть - всякие подписные сервисы типа Patreon, Sponsr, Бусти. А я в ответ скажу, что транзакции там - отнюдь не микро-, доступ к материалам продается слишком большими кусками. И если за подписку на любимого автора соответствующую сумму не жалко отдать заранее, птому что его читать точно будешь, и часто,то поглядеть разок на что-то заинтересовашее в моменте за недорого на таких сервисах не получается. В этом и есть разница.

Ну введёте вы микро-транзакции за скачивание странички, и что будет дальше? Дальше будет взрывной рост сайтов-помоек со сгенерированными текстами, дабы стащить с кошелька ботов деньги отдавая некий хлам.

Дальше будет взрывной рост сайтов-помоек со сгенерированными текстами, дабы стащить с кошелька ботов деньги отдавая некий хлам.

В любом случае это уже чисто проблема ботов и их владельцев. И я не вижу, что мешает владельцам ботов настроить их так, чтобы этот хлам не подбирать и помойки не кормить.
Или же - договориться с владельцем сайта, чтобы он пускал забесплатно полезные ему боты, к примеру - от поисковиковых систем - забесплатно (естественно - с аутентификацией, чтобы посторонние под их видом не лазили) .

То есть вы хотите одну странную систему заменить ещё более странной системой, добавив туда деньги, но не решив нормально проблемы :-/

Нет. Потому что проблема не техническая, а потому системы ее сами по себе не решают. Проблема - экономическая, и я хочу, чтобыу сайтов была другая экономика, которая вводит сайты и их посетителей в контур рыночного регулирования, для того и нужны деньги.
По-моему, “нормально” - именно так.

В любом случае это уже чисто проблема ботов и их владельцев.

В принципе, не совсем. Вас, как человека, тоже можно погонять через кучу промежуточных страниц (не забывая снять маленькую, но копеечку на каждой) прежде чем дать(если вообще дадут) то, что ищете. Ну вот как сейчас через промежуточные страницы с рекламой гоняют.

Но это, в общем, решается репутацией: "солидные источники информации(например <имя>) так не делают, иди туда"

Вас, как человека, тоже можно погонять через кучу промежуточных страниц (не забывая снять маленькую, но копеечку на каждой) прежде чем дать(если вообще дадут) то, что ищете.

Некоторые сайты уже так делают. И на каждой такой говностраничке показывают горы рекламы с одним абзацем и ссылкой на следующую страницу.

Вас, как человека, тоже можно погонять через кучу промежуточных страниц (не забывая снять маленькую, но копеечку на каждой) прежде чем дать(если вообще дадут) то, что ищете.

Можно, но зачем? Если информация достаточно ценная, то можно просто поднять цену безо всяких грязных трюков, которые плохи тем, что портят репутацию.

для конкурентной борьбы маркетинг идет на любые извращения и гадости

Там уже накинули пару контр-аргументов, но я добавлю тот, что они не могут изменить схему, потому что я в принципе не хочу видеть персонализированную рекламу, но они мне это навязывают. Лезут в мой микрофон, читают куки и так далее, хотя я хочу нейтральную рекламу, раз уж без нее не обойтись.

Поэтому лично я не собираюсь поплнять счет таких добросовестных посредников. Но если Вы говорите про бизнес между бизнесом — то да, наверно это интересно.

они не могут изменить схему, потому что я в принципе не хочу видеть персонализированную рекламу, но они мне это навязывают.

“Они” - я не понял, это кто? Но в целом, да, переход от нынешнего состояния интернета к тому, что мне мечтается, так просто не сделать. Но помечтать об интернете, в котором вы платите деньгами а не вниманием (то есть, просмотром рекламы) можно, да.

Они — рекламадатели.

схема у гулга была простая вначале — наши сайты, а сюоку крутятся банери гугла с рандомной рекламой.

Затем они решили оптимизиравать свои доходы через персонализацию рекламы, сами знаете как. Боты боты боты, куки и тд. Паралельно фб и вотцап начали по своему уже в приложениях тащить от тебя инфу.

В итоге мы получили картину, где в эпоху до глобального интерената, рекламодатели продавали либо рандом по тв, либо в специализированных медиа показывали специализированную рекламу.

Таким образом, когда я прихожу в условный магазин ( я пришел с иголочки одетый, в часах ролекс и красовках пума ( с хура ли, но пусть будет), то максимум который могли с меня считать — это прохожие, которые смотрели как я одет — всё. Никто не записывал в блокнот информацию о бо мне, а потом не передовал ее владельцу магазина, ято бы когжа и пришел к нему в след раз — он мне тут же предложил мой любимый бренд. Понимаете?!

В определенной степени, да — магазин, ыладелец или кассир запоминают меня как покупателя, и когда я пояыляюсь в том же ларьке или баре, мне приятно сверкнуть своими часами перед посетителями и услышать фразу бармена: Вам как обычно бакал светлого для начала, сэр? И я с удовольствием отвечаю ему — да, и этой даме в подарок от меня тоже на в кус, что пожелает….

Понимаете разницу. Теперь же я заходя в современный магазин электронной продажи, да куда бы то ни было в целом, — подвергаюсь тотальному скрапингу, сканированию, категоризациии, профилиралифилиралихациии ( в шутку изувечил слово), с целью доброго гулгла (рекламодателя и его контр-агента) подсунуть мне сразу «топчик».

СПСИБО. НЕ НАДО. да, не стоит смотреть на это односторонне, мол все «ужас-ужас», но как на это иначе смотреть, как без слез, я, не, знаю.

Повторяю, в чемто такие системы нужны, в определенных сценариях, возможно вообще не на рынке рекламы, но то что мы имеем сейчас — тотальное профилирование. Да ну их нафиг. Я против например. Меня полностью устраивает гугл, но в этом момент. Единственное, что бесит. Как мне отказываться от его услуг — я не знаю.

PS: ах да, чуть не забыл. Теперь Вы предлагаете, чтобы мы им, еще, и платили за это? Типо если влезли в дерьмо, то хоть дайте какой-то выбор. Я в инет по подписке захожу, за то меня фб не скраппит. Так они же это уже реализовалив нутри контура? А не, то твиттер сделал, кажись, если не ошибаюсь.

PPS: конечно, Вы изначально про слой между мной и рекламодателем говорили, но я Вам обрисовал, как я вижу эту «кроличью нору».

Теперь Вы предлагаете, чтобы мы им, еще, и платили за это?

Нет, я предлагаю, чтобы мы платили вместо этого, вместо этой навязчивой рекламы. По крайней мере, именно этого я джвадцать джва года хочу.

А еще есть x402.Именно микро-транзакции.

90 долларов в месяц.
База данных - 1,5 млн записей.
VPS стоила бы 6-8 долларов в месяц с исходящим лимитом в 1 ТБ (5 ГБ от ботов * 30 дней = 150 гиг, 15% от того, что обычно включено в тариф), а поместив сайт за DNS от CloudFlare можно сэкономить примерно 2/3 от трафика или больше.

Сейчас есть много VPS по цене 30-40 баксов в год с лимитом 3-15Тб в месяц.

Сразу на год брать - не резон, отлетают пачками.

Нормально. Сейчас все прокидывают трафик через вторую машинку, уже одноразовую. А основная побольше постоянная. И куплена на год.

Прокидывать можно всяким, оно все парой понятных текстовых конфигов настраивается.

Что значит отлетают???

Куда отлетают, зачем?

Очень большая и сложная статья, даже слишком. Не уж то это стандарт для Хабр? Без негатива

Неужто на Хабр ходят читать твиты по 250 символов?

Если возраст в профиле реальный, то это должны быть 30-секундные видео с фоновой музыкой. И чтобы свайпать было можно.

Камон, там 2002, в 24 года я монографию опубликовал.

"Да, были люди в наше время, могучее, лихое племя: Богатыри — не вы!"
Больше чем уверен, что и сегодня есть люди, которые в 24 монографию публикуют. Но сложно отрицать массовый сдвиг в клиповое мышление у большого числа молодых людей.

Я с этим не спорю, но 24 года, это всё же не 14. Тут не в возрасте дело, имхо. Если сантехник Василий, 50 годиков, попал впервые в интернет в эпоху твитора и тиктока, пропустив эру диалапа, форумов и лонгридов в жж, его сетевые привычки будут мало отличаться от школьника Олега, который попал в сеть в то же время.

е.... вы токсичные...

я не пойму, это жирный наброс, постметаирония или все всерьез?)

Это смена поколений на Хабре, сэр

Снобный — это хакер, детка))) и тут так принято. Но как по мне, просто хвастунишка, он) хотя и молодец. Я даже не знаю, что такое монография, но уже хочу написать, и мне — 45-ть))))

Так еще и лайкают такие комментарии? Ну и позор

отредактировал:

Мы такие циклы уже проходили — “эффект пикабу”, войны с корпоративными блогами. Похоже, постоянная чистка и есть суть эволюции Хабра — движение к академическим стандартам через регулярные приступы борьбы за качество.

так уж здесь повелось (с)

По сути, он ничем не отличается от вашего.

А лайкают, наверное, ещё и за исправление ошибки в вашем комментарии ;)

Это обычная статья для хабра. До победы копроблогов со статьями про кремы для опы, тут много такого было.

Не уж то это стандарт для Хабр?

О, это вы статьи не читали, которые выходили в то время, когда Хабр был закрытым сообществом. Можно сказать, что стандарты, кхм, немного скорректированы.

Недавно заблокировал настоящего клиента с Chrome 101 и китайской локалью. Браузер настойчиво слал не percent-encoding кириллицу в GET-запросе, а как-то по-другому закодированный юникод, из-за этого фреймворк сайта падал на этапе маршрутизации. Надеюсь, пользователь нашёл другой браузер и посмотрел на сайте то, что хотел.

А ещё заметил, что многие боты не умеют в сжатие, или только в gzip (но не в br). А так разве что Яндекс раньше любил каждый месяц выкачивать по 200-300 ГБ pdf-файлов, хотя они не менялись.

Яндекс раньше любил каждый месяц выкачивать по 200-300 ГБ pdf-файлов, хотя они не менялись.

А там точно всё правильно настроено? Дата изменения в sitemap же должна быть. Зачем ему ещё раз скачивать...

В sitemap файлов не было, дата модификации файлов возвращалась в заголовках nginx. Позже в этих же заголовках было запрещено роботам качать эти файлы (X-Robots-Tag: noindex) и через robots.txt конечно же.

Здесь особенно важно не смешивать два слоя метрик: edge-запросы/байты и продуктовые события. После нового правила WAF меняется доля отфильтрованного трафика, и без раздельных рядов это легко принять за падение живой аудитории. Я бы сохранял для каждого запроса хотя бы класс (бот/прошёл challenge/подтверждённая сессия), а воронку строил отдельно по событиям приложения. Тогда алерты на рост bot bytes и на просадку verified sessions не спорят друг с другом.

Я давно уже перестал собирать, хранить и обрабатывать статистику посещаемости своих сайтов (раньше каждый месяц это делал, даже программу специальную почти дописал), но вижу только одно: падение числа посетителей. Раньше я считал, что причина одна: сайты на русском, но вне РФ. Соответственно, доступ сильно затруднен.
Но сейчас я думаю, что есть и вторая причина: люди не приходят из поиска как раньше, потому что любой поисковик через ИИ сразу выдает "оптимальный" ответ, не направляя искателя на оригинальный сайт. И искатель, и поисковик довольны, а интересы владельца сайта и автора контента им побоку.

Бороться с ботами бесполезно, это не увеличит число посетителей, Корень проблемы в алгоритмах поисковиков. Но как бороться с ними? Я не знаю...

Поисковики с сайтами ещё до этого бороться начали со всякими турбо-страницами и у гугла какой-то аналог тоже был. Но сейчас да, с нейросетями вообще всё плохо с реальными посетителями стало. Ничего уже не поделать тут.

Гугл еще и забанил в поиске сайты на доменах 3 уровня, причем не все (на бесплатных хостингах оставил), а только настоящие, не мусорные. И саппорта там нет, чтобы написать "какого черта?". Так что "обложили" со всех сторон... Я даже в блоге подробно писал об этом... И да - ничего не сделаешь...

  • Мэтт Полсон из MarketBeat: «Не забудьте добавить в список Россию».

И хотя с российских IP тебе не придет ни одного бота (откуда могут взяться боты в средневековой стране), но ты же не хочешь, чтобы на твой сайт зашел русский Иван? Поэтому, обязательно добавь в список Россию!

Есть региональные сайты. Сайты, у которых через клауд закрыты определенные страны или наоборот открыты только некоторые - это распространенная практика.

Например, для всех серверов одного проекта (сетки сайтов разных регионов и серверов) через Security rules закрыт Китай.

А вот для бразильского сервера такое правило - Country is not in BO, CL, CO, EC, MX, PE, VE, UY - блок

То есть в данном случае к автору статьи на сайт из России в США зайдет полтора человека за полгода и ими можно пренебречь.

там есть конечно и другие ньюансы, бывает что клауд неправильно определяет ip посетителя (базы как я понимаю у них обновляются не онлайн)

То есть вы одобряете закрытие интернета по своим миниинтернетикам? Этак 99 процентов сайтов могут закрыться от большей части мира, там трафик копеечный.

А нужен этим сайтам этот трафик от большей части мира?

Я не знаю. Мне не нравится сама идея что все окукливаются. И наши идут в мировом тренде закрывая доступ к сайтом из-за рубежа.

А вам? Хотите ходить только на местные сайты, потому что остальные закрылись от вас?

А вам? Хотите ходить только на местные сайты, потому что остальные закрылись от вас?

Когда-то я был юношей и был максималистом, и я пылал бы праведным гневом.
А сегодня я просто включу туннель (если нужно), или поменяю сайт (если не очень нужно).

И, кстати, как "веб-мастер" (какое слово-то древнее), я делаю точно так же на своих проектах. У меня есть сайты для всех - например, для изучения английского, там ограничений нет. Английский ведь везде учат, даже в США.
А есть для местных потребителей. И там стоят правила. Мои правила с фильтрацией регионов. В одном из сервисов у провайдера egress-трафик платный в Китай и Океанию у провайдера (-Китай -Океания). В другом - просто нон-стоп долбежка в поисках уязвимых эндпоинтов. Посмотрел откуда идут атаки, и положил их в reject.

В каждую страну на сайт которой зайти хотите? Не, ну я тоже справлюсь, но это же ужастно. И 99 процентов людей не справится и будет ходить только на местные сайты.

Разных банилок по любым критериям сделано море. Блокировать страны для их работы не надо.

Все мои проекты открыты для всего мира. Я делаю что могу для сохранения интернета. И мне всегда интересна мотивация айтишников разрушающих интернет своими руками.

Спросить у тех кто систему сертификатов разрушил я ничего не могу. Поэтому прикапываться к кому могу.

Интернет разваливается на куски. На мой взгляд - это печально. Сеть, которая могла объединять людей, уступаем место местечковым группкам сайтов.

В эту сторону и правительства работают, и сами люди, закрывая доступ пользователям из других стран. Грустно.

Мои сайты тоже открыты для всех, ибо зачем я должен ограничивать доступ к своему творчеству? Но только мои сайты на русском, но вне РФ. А посему зайти из РФ на них сложно. Можно, но скорость такая, что никто не дождется. И не потому, что они что-то плохое содержат. А просто потому, что зарубежный трафик получается.
Увы, в распаде интернета на зоны заинтересованы в мире очень много кто...

Тут я с вами согласен полностью Так я о том и говорю. К нему на сайт придет максимум один русский Иван в год (ибо ну зачем русскому Ивану список доноров музеев США), но в список Россию набавить всё равно надо обязательно. Чтобы даже этот один не пришел и не осквернил его сайт. Как это, не добавить в список Россию? Ведь иначе тебя не будут считать за приличного человека.

так он и я тоже и многие другие блочат страны не потому что нам не нравятся светлолицы иваны или желтолицые (имен не знаю) жители юго-восточной азии, а потом что паразитный трафик зашкаливает и отделять мух от котлет сложно. Да и зачем.

Я допустим, понимаю, что бот дипсика в теории приведет юзера даже из Китая, но доля приведенного юзера и кол-во ботов с Китая - очень вещи неодинаковые

А еще CF у нас заблочили. Так бы я просто капчу в CF поставил и всё. Человек пройдет спокойно, боту - заметно сложнее. Плюс у CF есть наработанные практики и по ботнетам и по поведенческим

(между прочим, та же метрика, как-то определяет ботов по поведенческим. Однако с веб-мастерами этой тайной инфой нифига не делится) Зато как банить за "у вас там недействительные показы и клики" - так они первые)

а ко мне еще ддос прибегал. несильный, но серверу было плохо. Почему, хз. И не один раз. Но именно ддос -долбили с разных IP, пока банил подсетями одни, появлялись другие. (победить не смог, просто включал проход через CF на сутки)

Вот что я хотел сказать, когда Вы будете недели тратить на фильтрацию трафа, чтобы пустить одного Ивана. Вы подумаете. Блин, насколько сильно мне нужен один Иван?

Можно встречно поднять вопрос использования частных ресурсов посетителя на обработку всякой рекламы, счётчиков и прочей ерунды. Посетитель заходит за сутью содержимого. Например, в случае хабра - за статьёй и комментариями. Баннеры сбоку посетителю не нужны, но устройство посетителя будет их скачивать, рендерить и держать в оперативной памяти и даже на дисковом кэше. И мы приходим к тому же самому, но с другой стороны. Так кто это всё начал?

Так-то я сисадмин и да, я тоже своим клиентам настраиваю ограничения, потому что не все они желают тратиться на разработчиков для переписывания сайта под эффективную работу с миллионами запросов. Даже под эффективную работу с десятками тысяч запросов не желают, будем честны. Поэтому приходится вводить тонны ограничений и я вообще открыл статью с надеждой найти что-то новое. И… ничего не нашёл кроме идеи отстреливать ещё и старые версии браузеров. Всё остальное уже и так применяю в том или ином виде. Но я также и простой посетитель и всё своё время пользования интернетом я наблюдаю, как он деградирует и превращается в сплошной поток жидкой консистенции и неприятного запаха.

Я считаю так, что если у вас там бизнес какой-то и вы надеетесь зарабатывать с показов статей, то честно будет сразу сделать вход по кредитке. И даже в поисковые системы не надо этот свой контент показывать, чтобы они потом меня туда не кидали. Когда я ищу что-то в сети, я ищу это бесплатно, так как за интернет я уже заплатил. Если же я захочу что-то платное, то я пойду в специальные платные места. Благо, их полно и есть бесплатно доступные списки этих платных ресурсов.

Вот о таком интернете я мечтаю. Упрощённо обобщая, в нём будет ассортимент всяких википедий с информацией по всем вопросам бытия и на все случаи жизни. А магазины можете в какую-нибудь отдельную сеть выделить. Я даже рад, что в последние годы этот бардак съезжает массово в маркетплейсы и даже в выдаче стало поменьше всяких магазинов. Вообще не понимаю, зачем показывать магазины, если я не дописал ключевые слова “купить” или “цена”. Если их нет, то покупать я ничего не собираюсь точно. Я хочу узнать, как это устроено, когда было сделано и т.д. Да что угодно, но не купить.

Резюме: делайте сайты для людей, а не для заработка и не нужно будет отбиваться от других таких же нехороших.

Когда я ищу что-то в сети, я ищу это бесплатно, так как за интернет я уже заплатил.

Вы заплатили всего лишь за доступ к трнаспорту. Владелец любого сайта с информацией ничего из заплаченных вами денег не получает и возместить из них свои расходы не может. Для этого нужен другой экономический механизм. Сейчас таким механизмом практически исключительно является реклама.

PS Экономический механизм, в котором провайдеры доступа делились заплаченными им за доступ деньгами с владельцами/операторами сайтов, в истории существовал (например – America Online в начале 90-х), но он не выжил.

Простите, много ли Вы сделали сайтов для людей, а не для денег? Откуда у Вас силы, время, ресурсы?

а как связан паразитный трафик и наличие на сайте рекламы?

более того, если Вы на сайте никак не зарабатываете, то Вы теряете деньги (хостинг, домен, привлечение специалистов для борьбы с паразитным трафом, включая ддос-ы) - да и контент.. самому писать. так зачем сайт. можно канал в телеге ввести. Ах да, у нас ж блочат все популярные каналы

Когда я ищу что-то в сети, я ищу это бесплатно

я так в продуктовые магазины ходил. Но не нашел понимание у сотрудников :)

Википедию спонсируют.. Но много Вы сайтов спонсируете. вот лично Вы? Я вот ни одному сайту не донатил. Может что-то на бусти покупал, но это не точно

и как это механизм должен работать? Типа сначала заплатили провайдеру интернета

затем по копеечке (условно) с вас списывается за каждый посещенный сайт. - в целом такое возможно, но система дюже сложная

На nginx 99% паразитного трафика вырезаются в несколько строк. Например запретом chrome от 1 до 125 версии (гуглите почему сами). И сервер вообще ничего не тратит отдавая 444 паразитам. Конечно этот список можно пошаманить и черным списком краулеров, паттернами доступа. Вы поймите одно: ботнеты работают определенными довольно тупыми паттернами. Там нет цели сделать что то эксклюзивно. А раз это массовая история, то значит можно изучить ее особенности и их учесть. Но самый распромтраненный паттерн на сегодня - это версия хрома. Смело режьте от 1 до 125. На мой взгляд автор не до конца понимает предмет, но на верном пути. Даже поведенческие и те вычисляются например несколько заходов холостых на десятый блок на час например (чтобы не заблочить ip мобильных операторов). Также рекомендую создать блокировки по признакам cdp, webdriver и тому подобное

А что такое "холостой заход" ? и это надо на каждый Ip вести учет кол-ва заходов?

Ага, в тетрадке))) Все эти условия конечно в коде прописываются. Потому что если банить всех подряд, то ничего хорошего не будет. Есть признаки по которым надо банить сразу (например старые версии хрома или переход по honeypot), но с другой стороны и есть признаки по которым надо чтобы набирался антирейтинг ip (например заход на сайт без действия или количество обращений к 404). И потом лучше разделять: какие признаки отдать на бан серверу без траты ресурсов например nginx отдающий 444 (отфильтровывающий трафик) или ipsets через iptables (черные списки), а на какие все-таки немного тратить их. Но там бан и по времени лучше делать на час. Какой смысл те же ip адреса или ip-диапазоны блокировать навсегда? Бот зашел с мобильного оператора, Ваша автоматика ему на час кислород перекрыла. Всё. Опыт показывает, что они потом с этого ip в ближайшие недели/месяцы не возвращаются. А если заблокировать такой ip или диапазон, то можно со временем лишиться мобильного трафика. Поэтому нет смысла такие ip банить на всегда. Ну и потом есть замечательные бесплатные инструменты для серверов как CrowdSec, настройки в nginx (где чуть ли не половина функционала Cloudflare помещается в несколько строк и бесплатно) ну и Fail2ban наконец (если настраивать через ipsets).

В статье не хватает логов детальных, с того же Cloudflare. Защита любого сайта - в большей степени индивидуальна.

Для RU сегмента, к сожалению Cloudflare свое изжил. Под РФ есть готовые решения.

У нас имя компании которую я не могу называть, админы так озаботились защитой от ботов и лишнего трафика, что перекрыли кислород гугл боту, зацепив своими блокировками их АСН-ку, более полу года в выдаче кроме бренд запросов ни чего не вылезало, хотя индексация всех страниц была и отображалась, только сейчас когда удалось наконец упросить снять все запреты, начинаем появляться в выдаче понебренд запросам...
Как и всегда, главное помнить, старейший принцип медицинской этики, обычно приписываемый Гиппократу не навреди 😅

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации