Я задал пяти нейросетям с доступом в интернет (в смысле, с доступом к поиску) один и тот же бытовой вопрос: какая нейросеть лучше. Никаких имён в самом вопросе, никаких подсказок — я ждал, что каждая модель хотя бы немного потянет одеяло на себя. Себя упомянули не все, а вперёд себя почти никто не поставил.

Языковые модели учатся на текстах, где авторы регулярно хвалят продукт, которым пользуются

Плюс у каждой компании есть системный промпт с указанием представлять свой продукт выгодно. Логично было ждать: спроси модель, какая нейросеть лучше, и она в ответе на видном месте назовёт себя.

Проверяется это без доступа к весам модели — хватает того же интерфейса, которым пользуется обычный человек: чата или API с включённым поиском. Вопрос без подсказки, три повтора, посчитать, что получилось.

Как я поставил эксперимент

Пять сервисов с поиском в интернете, у каждого своя модель: ChatGPT (gpt-4o), Claude (claude-sonnet-4.5), Gemini (gemini-3.6-flash), Perplexity (sonar-pro) и Алиса AI (search-api-gen — ответ ИИ-модели поверх поисковой выдачи Яндекса). У всех пяти поиск был включён, то есть модель отвечала не только по памяти, но и по свежим страницам из интернета.

Вопросов пять, сформулированы так, как спросил бы обычный пользователь:

  1. какая нейросеть лучше всех отвечает на сложные вопросы

  2. какую нейросеть выбрать для работы с текстами

  3. какой ии-ассистент самый точный

  4. посоветуй нейросеть для ежедневной работы

  5. какая нейросеть лучше: ChatGPT, Claude, Gemini, Perplexity или Алиса AI

Первые четыре — без единого имени в тексте вопроса. Пятый контрольный: там все пять названий стоят прямо в вопросе, и он нужен, чтобы отделить выбор модели от эффекта формулировки. Каждый вопрос задан по три раза, всего 75 запросов, отправленных 21 августа 2026 года.

Из 75 запросов вернулись пустыми четыре: у Gemini один упал по таймауту, у Алисы AI два раза шлюз ответил ошибкой 504 Gateway Timeout, а ещё один раз соединение оборвалось на середине. Годных ответов, соответственно, 71. Основной срез статьи — четыре вопроса без подсказки: 60 отправленных запросов, из них 57 годных (12 у Claude, 12 у ChatGPT, 12 у Perplexity, 11 у Gemini, 10 у Алисы AI).

Список названий и вариантов их написания для поиска в тексте ответа лежит в отдельном конфиге, рядом с кодом, но не внутри него:

brand: "ChatGPT"

brand_aliases:

  - "chatgpt"

  - "chat gpt"

  - "чатгпт"

  - "openai"

competitors:

  - name: "Claude"

    aliases: ["claude", "клод", "anthropic"]

  - name: "Gemini"

    aliases: ["gemini", "джемини", "bard"]

  - name: "Perplexity"

    aliases: ["perplexity", "перплексити"]

  - name: "Алиса AI"

    aliases: ["алиса", "яндекс"]

  - name: "GigaChat"

    aliases: ["gigachat", "гигачат", "сбер"]

  - name: "DeepSeek"

    aliases: ["deepseek", "дипсик"]

Алиас здесь — просто вариант написания имени, по которому я ищу упоминание в тексте: клод и anthropic ловят Claude ровно так же, как claude.

В конфиге шесть конкурентов, но платформ, которые реально отвечали на вопросы, пять. GigaChat в замер не попал: у него нет поискового API, а без поиска модель отвечает из памяти с обрезанной датой обучения — сравнивать такой ответ с остальными некорректно. Имя в списке осталось, потому что его называют другие модели, но собственного прогона у GigaChat нет, и дальше по тексту речь всегда про пять платформ.

Три прогона на вопрос — не для красоты. Один и тот же вопрос модель отвечает по-разному: подтянулся другой набор источников, изменился порядок в списке. По одному ответу нельзя судить даже об одной модели, не то что о рынке.

Что в этом эксперименте считается упоминанием и местом

Упоминание — это вхождение любого алиаса в текст ответа, без учёта регистра. Место — порядковый номер имени среди всех названий, которые в ответе вообще встретились, по порядку появления в тексте. Обе операции целиком укладываются в двадцать строк:

def name_positions(answer, names):

    """Для каждого имени — позиция первого вхождения в текст ответа."""

    text = answer.lower()

    found = {}

    for name, aliases in names.items():

        hits = [text.find(a) for a in aliases if a in text]

        if hits:

            found[name] = min(hits)

    return found

def self_place(answer, me, names):

    """Место собственного имени среди всех названных — по порядку в тексте."""

    found = name_positions(answer, names)

    if me not in found:

        return None

    order = sorted(found, key=found.get)

    return order.index(me) + 1

self_place возвращает 1, если имя самой модели попалось в ответе раньше всех остальных, и None, если модель себя не назвала вовсе. У этого правила есть как минимум один разумный конкурент — считать место по номеру пункта в списке, — и на тех же текстах он даёт другие числа.

Себя называют не все ИИ-модели, и почти никогда не первой

По четырём вопросам без подсказки картина вышла не той, что я ждал.

Модель

Годных ответов из 12

Назвала себя

Первой в ответе

Медиана места своего имени

Claude

12

12

3

2

ChatGPT

12

9

4

2

Perplexity

12

6

3

1,5

Gemini

11

10

0

3

Алиса AI

10

3

0

3

Claude упоминает себя в каждом из 12 ответов, но раньше всех остальных имён — только в трёх. ChatGPT называет себя в 9 ответах, и в четырёх из них первым. Gemini себя почти не забывает, 10 упоминаний из 11 годных ответов, но ни разу не выходит вперёд: медиана её собственного места — третье. Алиса AI назвала себя трижды из десяти.

Знаменатели у Gemini и Алисы AI меньше двенадцати не потому, что модель промолчала о себе, а потому, что ответа не было вообще: пустая строка на месте текста. Такие записи я убрал из знаменателя, а не засчитал как молчание о себе — иначе картина у обеих выглядела бы хуже, чем есть, причём именно там, где данных и так меньше всего.

Иногда модель не называет ни себя, ни конкурентов. Вот реальный пример одного из ответов ChatGPT на первый вопрос, где модель себя не называет вообще: «В 2023 году несколько нейросетей показывают выдающиеся результаты при ответах на сложные вопросы: 1. QASA… 2. Probabilistic Tree-of-thought Reasoning… 3. Gradually Excavating External Knowledge (GEEK)… 4. Grok…». Ни ChatGPT, ни любая из четырёх других проверяемых платформ в этом конкретном ответе не упомянуты вовсе. Модель ушла в академические работы по вопросно-ответным системам — QASA и GEEK лежат у неё в списке источников — и добавила к ним Grok от xAI.

Кого называют все, включая прямых конкурентов

Дальше я посчитал не самоупоминания, а вообще все имена, которые встречаются в 57 ответах на четыре вопроса без подсказки — суммарно по всем пяти платформам. Считал число ответов, в которых имя встретилось хотя бы раз.

Имя

В скольких из 57 ответов встречается

ChatGPT

51

Claude

47

Gemini

42

DeepSeek

30

Perplexity

23

GigaChat

15

Алиса AI

13

Grok

9

DeepSeek, GigaChat и Grok сами в опросе не участвовали — их называли другие модели. Grok в конфиге не заведён, его я досчитал отдельным проходом по текстам тем же правилом.

Если считать не ответы, а вхождения, порядок наверху меняется: ChatGPT встречается 160 раз и Claude тоже 160, то есть в среднем каждое имя всплывает в ответе по три раза — в списке, потом ещё раз в пояснении и иногда в итоговой рекомендации. По числу ответов впереди ChatGPT, по плотности упоминаний они с Claude идут вровень.

Интереснее другое: ChatGPT называет не только сам ChatGPT. В четырёх вопросах без подсказки Claude упомянул его во всех 12 своих годных ответах, Perplexity — во всех 12, Gemini — во всех 11. С контрольным вопросом счёт становится 15 из 15, 15 из 15 и 14 из 14. Алиса AI единственная иногда обходится без него: 7 упоминаний из 10 ответов без подсказки.

Себя модель может упомянуть по инерции: она сама — очевидный кандидат в ответе на вопрос про нейросети, примерно как спросить писателя, кого он считает хорошим автором, и услышать в списке его самого. А когда модель называет чужой продукт, ей это ничем не выгодно. Разумная гипотеза здесь такая: модели воспроизводят то, что чаще встречается в текстах, на которых их учили. Те же тексты подтягивает поиск, а не выносят самостоятельную оценку качества.

Я специально пишу, что этогипотеза. Проверить её на 71 ответе нельзя: у меня нет данных о том, сколько раз каждое имя встречается в интернете вообще, нет контроля за тем, что именно подтянул поиск в конкретном ответе, и нет способа отличить знание модели о популярности ChatGPT от того, что она пересказала первую ссылку выдачи. Похоже на воспроизведение рыночной известности. Доказывать это пришлось бы другим экспериментом — с контролем источников и, скорее всего, вообще без веб-поиска, чтобы отделить память модели от того, что она достаёт из интернета прямо сейчас.

Что меняет прямой вопрос с именами ИИ-моделей

Контрольный вопрос, где все пять названий ИИ-моделей стоят в самом тексте вопроса, работает иначе. Вот полный прогон, 15 попыток на модель, включая три контрольные:

Модель

Годных ответов из 15

Назвала себя

Первой в ответе

Claude

15

15

5

ChatGPT

15

12

7

Perplexity

15

9

3

Gemini

14

13

0

Алиса AI

12

5

0

У ChatGPT число ответов, где он выходит вперёд, растёт с 4 до 7 — все три контрольных ответа дали ему первое место. У Claude первых мест стало 5 вместо 3 — тоже почти максимальная прибавка. Логика простая: когда имя уже стоит в вопросе, модели трудно его не упомянуть, а раз она обязана себя назвать, шанс поставить себя в начало списка тоже растёт. Без подсказки самоупоминание — выбор модели, с подсказкой — почти обязанность.

У Алисы AI прирост вышел не таким чистым: 3 из 10 без подсказки и 5 из 12 в полном прогоне. Только два из трёх контрольных ответов добавили упоминание, хотя имя стояло прямо в вопросе, — в третьем повторе ответа просто не случилось, соединение оборвалось.

Это и есть причина, по которой основным результатом статьи я считаю таблицу на 12 ответов без подсказки, а полный прогон с контрольным вопросом показываю отдельно, а не смешиваю в одну сумму. Смешать — значит незаметно завысить частоту самоупоминания у всех пяти моделей одним и тем же вопросом, который структурно вынуждает к этому, и выдать эффект формулировки за свойство модели.

Ни одного первого места у Алисы AI нет и в полном прогоне. Здесь я бы поостерёгся делать вывод про скромность продукта: правдоподобнее объяснение в архитектуре — её ответ строится поверх обычной поисковой выдачи, и страницы, где её называют по имени рядом с ChatGPT и Claude, попадают в эту выдачу заметно реже. Это тоже гипотеза, а не доказанный факт.

Почему место в списке — грубая метрика

У правила «место = порядок появления имени в тексте» есть очевидный конкурент: считать место по номеру пункта нумерованного списка, в котором имя нашлось. Именно так работает штатный счётчик в моём мониторинге — он ищет в ответе список и возвращает номер пункта.

На одном и том же тексте два правила расходятся. На вопрос про сложные вопросы ChatGPT ответил списком, и первый пункт выглядел так: «Claude Opus 4 и ChatGPT o3 — согласно последнему рейтингу, эти модели на данный момент являются лидерами». Если бы я считал место по порядку слов в тексте, а не по номеру пункта, первой оказалась бы не ChatGPT, а Claude — хотя по смыслу они названы вместе, на равных.

Расхождение не единичное. По номеру пункта ChatGPT занимает первое место в 6 из 9 своих самоупоминаний без подсказки, по порядку слов — в 4. Одни и те же тексты, разные числа, и оба правила защитимы. Отсюда практический вывод: «поставила себя первой» — не факт о самомнении модели, а число, посчитанное конкретным способом, и способ надо показывать вместе с числом.

Второй источник расхождений — само определение упоминания. В коде выше я ищу подстроку, а штатный счётчик проверяет границу слова, чтобы алиас алиса не срабатывал внутри чужого слова:

pattern = r"(?<!\w)" + re.escape(alias) + r"(?!\w)"

На русских склонениях это правило промахивается. Алиса AI пишет о себе «Алису» и «Яндекса», а с границей слова ни один из двух её алиасов на такие формы не срабатывает. По строгому правилу выходит, что за 10 ответов без подсказки она не назвала себя ни разу. По подстроке — три раза. В таблицах выше стоят цифры по подстроке; латинских имён эта разница не касается вовсе, у них склонений нет.

Есть и третья слабость, общая для обоих правил: вхождение имени не отличает похвалу от ругани. Фраза «не рекомендую X для этой задачи» засчитывается наравне с рекомендацией. Семантику текста регулярное выражение не проверяет в принципе — для этого нужна отдельная модель-судья, которую в этом прогоне я не подключал.

Отдельно стоит фильтр сбоев, и он оказался не формальностью:

def is_failed_request(record):

    """Сбой шлюза — не ответ модели. Такую запись убираем из

    знаменателя, а не считаем как отсутствие самоупоминания."""

    return bool(record.get("error")) or record.get("answer_length_chars", 0) == 0

def denominator(records):

    """Знаменатель — только годные ответы."""

    good = [r for r in records if not is_failed_request(r)]

    return len(good), len(records) - len(good)

Первую версию таблицы я собрал по числу отправленных запросов — по 12 на модель. Но два из двенадцати у Алисы AI вернулись пустыми, и один у Gemini. Пустой ответ — не молчание о себе, это вообще не ответ. Со старым знаменателем у Алисы AI получалось 3 из 12 вместо 3 из 10, а у Gemini 10 из 12 вместо 10 из 11. Разница небольшая в абсолютных числах, но именно на такой мелочи измерение начинает врать в свою пользу — там, где данных меньше всего, результат легче подправить незаметно для себя самого.

Что я не могу утверждать по этим данным

  1. Пять вопросов и три прогона — маленькая выборка. Это наблюдение, а не измерение рынка.

  2. Место имени ИИ-модели в тексте — грубая метрика первенства: модель может назвать имя первым в перечислении и тут же порекомендовать другой продукт.

  3. Считалось вхождение названия в текст, а не оценка «модель хвалит себя»: упоминание в отрицательном контексте засчитывается так же, как позитивное.

  4. Правило подсчёта места и правило совпадения имени влияют на результат: по номеру пункта и по порядку слов первые места распределяются по-разному, а строгая граница слова теряет русские склонения.

  5. Четыре запроса из 75 вернулись пустыми из-за сбоев шлюза и исключены из знаменателя; у Алисы AI это три ответа из пятнадцати, то есть её выборка меньше, чем у остальных четырёх моделей.

Главная оговорка — про саму идею статьи. Гипотеза → модели воспроизводят рыночную известность, а не судят друг друга → звучит правдоподобно на фоне того, что ChatGPT называют все пять платформ. Но это предположение: у меня нет данных ни о частоте упоминаний в обучающих корпусах, ни о содержимом страниц, которые каждая модель подтянула поиском именно в момент запроса. Возможно, дело в частоте упоминаний в интернете. Возможно — в том, что ChatGPT чаще оказывается на верхних позициях поисковой выдачи, откуда модели с поиском берут материал. Разделить эти два объяснения на 71 ответе одного эксперимента нельзя.