Задача звучит просто: выяснить, называют ли бренд ChatGPT, Claude, Perplexity, Gemini, Алиса AI и GigaChat, когда пользователь спрашивает совета или ответа у ИИ. На практике эта задача раскладывается на десятки технических решений, каждое из которых меняет результат в разы. Ниже устройство замера, формат хранения и три моих ошибки, которые обесценивают всю работу.

Замер строится на неподсказанных запросах, а не на названии бренда

Вопрос «что такое компания N» проверяет, знает ли модель название. Для оценки видимости он бесполезен: клиент так не спрашивает.

Замер идёт по вопросам, в которых бренда нет: «посоветуй агентство для такой-то задачи», «к кому обратиться с такой проблемой», «какие компании работают в такой нише». Модель выбирает сама, а мы считаем, попал ли бренд в ответ.

Список таких вопросов фиксируется один раз и дальше не меняется — иначе замеры между собой несравнимы. Я тестировал на разных нишах и клиентах, и понял, что 20 контрольных промптов, разложенных по ступеням принятия решения о покупке и интересе к бренду, — оптимальный размер.

Нужно использовать веб-поиск у моделей ИИ, иначе будетевидеть устаревшую картину

Три ошибки, после которых результат замера нельзя сравнивать ни с чем
Три ошибки, после которых результат замера нельзя сравнивать ни с чем

Языковая модель без доступа в сеть отвечает по обучающим данным. Для компании, о которой в этих данных ничего нет, ответ будет пустым — и это скажет вам не про видимость, а про дату среза обучения этой языковой модели.

Поэтому каждый канал в замере включается с поиском. Например, у ChatGPT: веб-поиск включается опцией, отдельной модели для этого больше нет

resp = client.chat.completions.create(

    model="gpt-4o",

    web_search_options={},          # без этого — ответ по обучающим данным

    messages=[{"role": "user", "content": prompt}],

)

Признак режима пишется в лог рядом с ответом:

{"platform": "chatgpt", "search_enabled": true, "prompt_id": "d3", "brand_mentioned": true}

Без этого поля старые логи невозможно сравнивать с новыми: замер без поиска и замер с поиском — разные метрики, хотя выглядят одинаково.

Источники ответа важнее самого факта упоминания

Ответ модели — это текст плюс список источников, на которые она опиралась. Второе на практике ценнее первого: список показывает, какие площадки система считает авторитетными в конкретной теме.

Накопленная выборка из 1771 цитирования дальше работает как карта: видно, что по нашим темам модели чаще всего берут материалы с отраслевых площадок, а сайты самих компаний занимают заметно меньшую долю.

Алиса AI считается иначе, чем западные модели

Алиса собирает ответ поверх органической выдачи Яндекса: нейросеть переписывает запрос, поиск возвращает документы, нейросеть синтезирует ответ. Значит, замер по Алисе — это одновременно замер позиций в Яндексе, и падение видимости здесь чаще означает просадку в органике, а не проблему с текстом.

Голая языковая модель Яндекса и продуктовая Алиса с поиском — разные вещи. Первая на многих запросах вообще отказывается отвечать, и такой отказ нельзя считать нулевой видимостью. В агрегации отказы выделяются в отдельную категорию.

Поискового интерфейса, сопоставимого с остальными, у GigaChat нет. Прогон через голую модель даёт систематически заниженную картину для молодых брендов — по той же причине, что и любой замер без поиска. Поэтому тут работаю вручную — прогоняю запросы сам иил прошу агента через РФ-прокси.

Три ошибки, из-за которых замер видимости в ответах ИИ можно выбрасывать

  1. Смена списка вопросов между замерами. Любая правка формулировки меняет ответ модели. Список фиксируется, изменения — только с новой версией и пересчётом базовой точки.

  2. Один прогон вместо нескольких. Ответы нейросетей нестабильны: на одном и том же вопросе состав названных компаний плавает. Для отчётных срезов я усредняю и делаюпо три прогона, для еженедельного мониторинга хватает одного, но тогда и выводы делаются только по крупным сдвигам.

  3. Сравнение процентов между платформами. Видимость 40% в ChatGPT и 40% в Алисе получены на разных механиках и означают разное. Сравнивать имеет смысл платформу саму с собой во времени.

Что запомнить

Замер видимости держится на трёх вещах: фиксированный список неподсказанных вопросов, обязательный веб-поиск с записью признака в лог и сохранение источников ответа. Без первого несравнимы замеры между собой, без второго получите ложный ноль, без третьего — цифру, из которой не следует ни одного действия.