Обновить

AI-краулеры в 2026: кого пускать в robots.txt, чтобы попадать в ответы ИИ

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели9.1K
Всего голосов 1: ↑1 и ↓0+3
Комментарии2

Комментарии 2

На своём сервере сделайте cat access_log | grep -F 'robots.txt' | egrep -o '"[^"]+"$' | sort -u и посмотрите какие боты читают ваш robots.txt. Для остальных писать туда рекомендации смысла нет.

  • DuckDuckGo/DuckAssistBot игнорирует robots.txt

  • OpenAIBot/ChatGPT-User игнорирует robots.txt

  • Anthropic/Claude-User игнорирует robots.txt

  • остальных AI-ботов проверить уже не могу - они давно забанены в WAF (включая любых ботов Apple)

С подсетей Anthropic вообще сайты парсятся со строкой Googlebot/2.1; +http://www.google.com/bot.html в User-Agent. Они чихают на robots.txt и идут на всё, чтобы бесплатно получить ваш контент.

Согласен, что логи — единственный надёжный источник, статья ровно про это. По ChatGPT-User подтверждаю → в OpenAI ребята сами пишут, что на user-initiated запросах robots.txt может не применяться. А вот про Googlebot — это документированно про Perplexity (и там был браузерный UA, не Googlebot). По Anthropic такого публично не зафиксировано, а голая строка Googlebot в UA без reverse-DNS ничего не доказывает. Claude-User и DuckAssistBot по докам robots.txt соблюдают — если у вас в логах иначе, это интересный кейс, буду следить и проверять, спасибо

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации