Про ИИ-ботов пишут в основном пересказами документации вендоров: этот собирает данные для обучения, тот ходит за содержанием по запросу пользователя. Я решил посмотреть, что происходит на самом деле — прежде всего по журналам доступа сервера. Ниже представляю вам разбор: кого видно в логах, что они запрашивают, чем отличаются два типа ботов у одного вендора и почему файл llms.txt в этой картине почти не встречается.

Двух ботов одного вендора нельзя смешивать в одну строку

Первое, обо что спотыкается разбор логов: у большинства вендоров ботов больше одного, и назначение у них разное.

  • GPTBot — обход для обучения моделей. Ходит планово, обходит разделы, уважает robots.txt.

  • OAI-SearchBot — обход для поисковой части: собирает индекс, из которого потом строятся ответы со ссылками.

  • ChatGPT-User — заход по действию пользователя: человек задал вопрос, система пошла за конкретной страницей прямо сейчас.

Три типа роботов у одного вендора решают разные задачи.
Три типа роботов у одного вендора решают разные задачи.

То же деление у остальных: у Perplexity — PerplexityBot для индекса и Perplexity-User для запроса пользователя, у Anthropic — ClaudeBot и отдельный агент пользовательских заходов.

Практическое следствие: закрывая в robots.txt «всех ИИ-ботов» одной строкой, вы закрываете и тот обход, который приводит на сайт живого человека по его же вопросу.

Что видно в журналах: три группы запросов

Разбор строк доступа по User-Agent даёт устойчивую картину.

Обход разделов. Планомерные заходы по карте сайта и внутренним ссылкам, с интервалами, без привязки к трафику. Это индексирующие боты.

Точечные заходы за одной страницей. Одиночный запрос конкретного URL, часто с реферером от сервиса. Это пользовательские агенты: кто-то задал вопрос, система пошла за содержанием.

Технические файлы. robots.txt запрашивается регулярно и всеми. sitemap.xml — заметно реже. А вот llms.txt в этой группе почти не встречается: по данным Limy.ai за 90 дней на 515 миллионов событий ИИ-ботов пришлось 408 запросов этого файла — меньше одной десятитысячной процента.

Как отделить настоящего бота от подделки

User-Agent подделывается одной строкой, поэтому доверять ему нельзя. Проверка идёт по владельцу адреса.

# 1. Кто заходил под видом GPTBot
grep "GPTBot" access.log | awk '{print $1}' | sort -u > ips.txt

# 2. Обратная зона: адрес должен резолвиться в домен вендора
while read ip; do
  host "$ip" | grep -qE "openai|oai" && echo "$ip ok" || echo "$ip ПОДДЕЛКА"
done < ips.txt

Вендоры публикуют диапазоны адресов для своих обходчиков — сверка по ним надёжнее обратной зоны и не зависит от настройки DNS.

По моим разборам доля подделок среди «ИИ-ботов» в логах заметная: под известными именами ходят парсеры, которым не место в вашей статистике.

Почему llms.txt не спасает и что работает вместо него

408 запросов файла на 515 миллионов событий — статистическая погрешность.
408 запросов файла на 515 миллионов событий — статистическая погрешность.

Файл предлагают как способ отдать модели карту сайта в удобном виде. Идея разумная, но данные показывают, что боты за ним не приходят: они читают HTML-страницы, как читали.

Значит, работает не отдельный файл, а доступность и структура самих страниц:

  • Содержание в HTML, а не только в скриптах. Агент пользователя не выполняет сложный JavaScript и получит пустую страницу.

  • Открытый robots.txt для пользовательских агентов даже при закрытых обучающих обходчиках — если хотите переходов от живых людей.

  • Быстрый ответ сервера. Заход по вопросу пользователя ограничен по времени: медленная страница просто не попадёт в ответ.

  • Структура блоками с самодостаточными подзаголовками — фрагмент забирается целиком, и он должен быть осмысленным без соседей.

Что запомнить

В логах видно три разных явления, которые обычно называют одним словом: обучающий обход, поисковый обход и заход по вопросу живого человека. Закрывать их одной строкой в robots.txt — терять третье вместе с первым. Файл llms.txt в реальном трафике встречается на уровне статистической погрешности, а решают доступность HTML, скорость ответа и структура страницы.