Задача звучит просто: выяснить, называют ли бренд ChatGPT, Claude, Perplexity, Gemini, Алиса AI и GigaChat, когда пользователь спрашивает совета или ответа у ИИ. На практике эта задача раскладывается на десятки технических решений, каждое из которых меняет результат в разы. Ниже устройство замера, формат хранения и три моих ошибки, которые обесценивают всю работу.
Замер строится на неподсказанных запросах, а не на названии бренда
Вопрос «что такое компания N» проверяет, знает ли модель название. Для оценки видимости он бесполезен: клиент так не спрашивает.
Замер идёт по вопросам, в которых бренда нет: «посоветуй агентство для такой-то задачи», «к кому обратиться с такой проблемой», «какие компании работают в такой нише». Модель выбирает сама, а мы считаем, попал ли бренд в ответ.
Список таких вопросов фиксируется один раз и дальше не меняется — иначе замеры между собой несравнимы. Я тестировал на разных нишах и клиентах, и понял, что 20 контрольных промптов, разложенных по ступеням принятия решения о покупке и интересе к бренду, — оптимальный размер.
Нужно использовать веб-поиск у моделей ИИ, иначе будетевидеть устаревшую картину

Языковая модель без доступа в сеть отвечает по обучающим данным. Для компании, о которой в этих данных ничего нет, ответ будет пустым — и это скажет вам не про видимость, а про дату среза обучения этой языковой модели.
Поэтому каждый канал в замере включается с поиском. Например, у ChatGPT: веб-поиск включается опцией, отдельной модели для этого больше нет
resp = client.chat.completions.create( model="gpt-4o", web_search_options={}, # без этого — ответ по обучающим данным messages=[{"role": "user", "content": prompt}], ) Признак режима пишется в лог рядом с ответом: {"platform": "chatgpt", "search_enabled": true, "prompt_id": "d3", "brand_mentioned": true}
Без этого поля старые логи невозможно сравнивать с новыми: замер без поиска и замер с поиском — разные метрики, хотя выглядят одинаково.
Источники ответа важнее самого факта упоминания
Ответ модели — это текст плюс список источников, на которые она опиралась. Второе на практике ценнее первого: список показывает, какие площадки система считает авторитетными в конкретной теме.
Накопленная выборка из 1771 цитирования дальше работает как карта: видно, что по нашим темам модели чаще всего берут материалы с отраслевых площадок, а сайты самих компаний занимают заметно меньшую долю.
Алиса AI считается иначе, чем западные модели
Алиса собирает ответ поверх органической выдачи Яндекса: нейросеть переписывает запрос, поиск возвращает документы, нейросеть синтезирует ответ. Значит, замер по Алисе — это одновременно замер позиций в Яндексе, и падение видимости здесь чаще означает просадку в органике, а не проблему с текстом.
Голая языковая модель Яндекса и продуктовая Алиса с поиском — разные вещи. Первая на многих запросах вообще отказывается отвечать, и такой отказ нельзя считать нулевой видимостью. В агрегации отказы выделяются в отдельную категорию.
Поискового интерфейса, сопоставимого с остальными, у GigaChat нет. Прогон через голую модель даёт систематически заниженную картину для молодых брендов — по той же причине, что и любой замер без поиска. Поэтому тут работаю вручную — прогоняю запросы сам иил прошу агента через РФ-прокси.
Три ошибки, из-за которых замер видимости в ответах ИИ можно выбрасывать
Смена списка вопросов между замерами. Любая правка формулировки меняет ответ модели. Список фиксируется, изменения — только с новой версией и пересчётом базовой точки.
Один прогон вместо нескольких. Ответы нейросетей нестабильны: на одном и том же вопросе состав названных компаний плавает. Для отчётных срезов я усредняю и делаюпо три прогона, для еженедельного мониторинга хватает одного, но тогда и выводы делаются только по крупным сдвигам.
Сравнение процентов между платформами. Видимость 40% в ChatGPT и 40% в Алисе получены на разных механиках и означают разное. Сравнивать имеет смысл платформу саму с собой во времени.
Что запомнить
Замер видимости держится на трёх вещах: фиксированный список неподсказанных вопросов, обязательный веб-поиск с записью признака в лог и сохранение источников ответа. Без первого несравнимы замеры между собой, без второго получите ложный ноль, без третьего — цифру, из которой не следует ни одного действия.

