Про ИИ-ботов пишут в основном пересказами документации вендоров: этот собирает данные для обучения, тот ходит за содержанием по запросу пользователя. Я решил посмотреть, что происходит на самом деле — прежде всего по журналам доступа сервера. Ниже представляю вам разбор: кого видно в логах, что они запрашивают, чем отличаются два типа ботов у одного вендора и почему файл llms.txt в этой картине почти не встречается.

Двух ботов одного вендора нельзя смешивать в одну строку
Первое, обо что спотыкается разбор логов: у большинства вендоров ботов больше одного, и назначение у них разное.
GPTBot — обход для обучения моделей. Ходит планово, обходит разделы, уважает
robots.txt.OAI-SearchBot — обход для поисковой части: собирает индекс, из которого потом строятся ответы со ссылками.
ChatGPT-User — заход по действию пользователя: человек задал вопрос, система пошла за конкретной страницей прямо сейчас.

То же деление у остальных: у Perplexity — PerplexityBot для индекса и Perplexity-User для запроса пользователя, у Anthropic — ClaudeBot и отдельный агент пользовательских заходов.
Практическое следствие: закрывая в robots.txt «всех ИИ-ботов» одной строкой, вы закрываете и тот обход, который приводит на сайт живого человека по его же вопросу.
Что видно в журналах: три группы запросов
Разбор строк доступа по User-Agent даёт устойчивую картину.
Обход разделов. Планомерные заходы по карте сайта и внутренним ссылкам, с интервалами, без привязки к трафику. Это индексирующие боты.
Точечные заходы за одной страницей. Одиночный запрос конкретного URL, часто с реферером от сервиса. Это пользовательские агенты: кто-то задал вопрос, система пошла за содержанием.
Технические файлы. robots.txt запрашивается регулярно и всеми. sitemap.xml — заметно реже. А вот llms.txt в этой группе почти не встречается: по данным Limy.ai за 90 дней на 515 миллионов событий ИИ-ботов пришлось 408 запросов этого файла — меньше одной десятитысячной процента.
Как отделить настоящего бота от подделки
User-Agent подделывается одной строкой, поэтому доверять ему нельзя. Проверка идёт по владельцу адреса.
# 1. Кто заходил под видом GPTBot grep "GPTBot" access.log | awk '{print $1}' | sort -u > ips.txt # 2. Обратная зона: адрес должен резолвиться в домен вендора while read ip; do host "$ip" | grep -qE "openai|oai" && echo "$ip ok" || echo "$ip ПОДДЕЛКА" done < ips.txt
Вендоры публикуют диапазоны адресов для своих обходчиков — сверка по ним надёжнее обратной зоны и не зависит от настройки DNS.
По моим разборам доля подделок среди «ИИ-ботов» в логах заметная: под известными именами ходят парсеры, которым не место в вашей статистике.
Почему llms.txt не спасает и что работает вместо него

Файл предлагают как способ отдать модели карту сайта в удобном виде. Идея разумная, но данные показывают, что боты за ним не приходят: они читают HTML-страницы, как читали.
Значит, работает не отдельный файл, а доступность и структура самих страниц:
Содержание в HTML, а не только в скриптах. Агент пользователя не выполняет сложный JavaScript и получит пустую страницу.
Открытый
robots.txtдля пользовательских агентов даже при закрытых обучающих обходчиках — если хотите переходов от живых людей.Быстрый ответ сервера. Заход по вопросу пользователя ограничен по времени: медленная страница просто не попадёт в ответ.
Структура блоками с самодостаточными подзаголовками — фрагмент забирается целиком, и он должен быть осмысленным без соседей.
Что запомнить
В логах видно три разных явления, которые обычно называют одним словом: обучающий обход, поисковый обход и заход по вопросу живого человека. Закрывать их одной строкой в robots.txt — терять третье вместе с первым. Файл llms.txt в реальном трафике встречается на уровне статистической погрешности, а решают доступность HTML, скорость ответа и структура страницы.

