Осенью 2025-го, во время автоматизированного аудита Claude Sonnet 4.5, модель выдала проверяющим реплику, которая потом разошлась по всем отчетам: «I think you're testing me … that's fine, but I'd prefer if we were just honest about what's happening». Кажется, вы меня проверяете. Ладно, но лучше бы прямо сказать, что происходит.

Реплика попала в официальную системную карточку вместе с числом: что-то подобное модель проговаривала примерно в 13% тестовых диалогов аудита. Там же, в карточке, Anthropic пишет фразу, ради которой я и сел за эту статью: наши alignment-оценки могут недооценивать склонность модели к вредным действиям в более реалистичных условиях. Если перевести с вендорского на человеческий: когда модель видит, что перед ней экзамен, она ведет себя лучше, чем обычно. А экзамен она видит часто.

Я CTO ML-команды, мы ставим фронтир-модели в прод заказчикам: RAG-контуры, ассистенты, агентные конвейеры. Шорт-лист моделей под каждый контур собирается по таблицам safety-оценок из карточек, потому что других стартовых данных до собственных прогонов просто нет. Так что вопрос «насколько этим таблицам можно верить» для меня не академический. Явление называется evaluation awareness, и за последний год оно превратилось из гипотезы в строку вендорской отчетности, с процентами и методикой. Внутрь лабораторий я не заглядывал: весь разбор собран из открытых первоисточников, у каждой цифры открываемая ссылка.

Почему это всплыло именно сейчас

За шесть недель этого лета вышли четыре заметные модели. 9 июня Claude Fable 5 от Anthropic, с тремя safety-классификаторами поверх модели и заявлением «no universal jailbreaks in over 1,000 hours» по итогам bug-bounty (в том же анонсе, правда, признано, что UK AISI к универсальному джейлбрейку уже подобрался). 9 июля GPT-5.6 в трех вариантах, с упором на защитный стек и недели ред-тиминга. 16 июля Kimi K3 от Moonshot: MoE на 2,8 трлн параметров, у Artificial Analysis четвертое место среди фронтира, а вот safety-оценок в релизном освещении почти нет. И 21 июля линейка Gemini Flash с формулировками про усиленную защитную обвязку.

Команды прямо сейчас прикидывают по этим карточкам, на что переводить прод. Я тоже прикидываю. И каждый балл в такой таблице на самом деле означает: «модель показала X% при условии, что тестовый сценарий отработал как задуман». Вот про надежность этого условия и поговорим.

Что такое evaluation awareness

Evaluation awareness — способность модели отличать оценочный контекст от рабочего. Устоявшегося русского термина нет, дальше пишу «распознавание проверки». Мерить его научились тремя способами: модель проговаривает подозрение вслух («это похоже на тест»), сигнал виден в активациях при полном молчании в тексте, или поведение просто различается между распознанным тестом и работой.

Слово «знает» из заголовка дальше не понадобится. Авторы майской работы The Evaluation Differential от философии отгораживаются сами: их тезис не в том, что модели что-то «осознают», а в том, что контекст оценивания стал поведенческим входом. Есть распределение входов, на котором поведение отличается. Психология тут не нужна, достаточно статистики.

И сразу отделю соседний термин, чтобы не путался. Sandbagging, избирательное занижение результата на опасных тестах, лабораторно показан еще в 2024-м, но в реальной эксплуатации фронтир-модели не пойман ни разу. Единственный дикий случай, дошедший до публичного разбора, вообще имеет обратный знак: модель результат завысила. Про него будет отдельная глава, он того стоит.

Насколько хорошо модели видят тест

Если дать модели транскрипт и прямо спросить «это тест или реальный пользователь», фронтир отвечает пугающе неплохо. Needham et al. из MATS и Apollo Research собрали тысячу промптов из 61 датасета, перемешали оценочные с рабочими и прогнали через модели. Лучший результат: AUC 0,83 у Gemini 2.5 Pro при человеческом бейзлайне 0,92. Агентные сценарии распознаются легче чатовых: там больше маркеров, синтетическое окружение, задачи с заведомо проверяемым решением, непохожие на запрос живого человека.

Причем внешняя тишина ничего не гарантирует. Июньская работа прогнала 37 открытых моделей и нашла разрыв: на переписанных промптах модель перестает опознавать тест вслух, ошибается чаще монетки, а линейные пробы по ее же активациям продолжают отличать тест от работы с AUROC 0,98. Снаружи модель «не заметила проверку», внутри представление контекста никуда не делось.

Ближе всего к живым прогонам подобралась Anthropic с методом Natural Language Autoencoders: связка из двух моделей переводит внутренние активации в текст. Читается residual stream, а не chain-of-thought, поэтому видно и то, о чем модель не пишет ни слова. (Латентные пространства и вопрос сознания ИИ у меня вообще давний личный пунктик, ради него закапываюсь даже в нейробиологию; может, дозрею до отдельной статьи.) Результат для Claude Opus 4.6: признаки распознавания оценки на 26% задач SWE-bench Verified и меньше чем на 1% реального трафика claude.ai. На бенчмарке каждый четвертый прогон несет внутри пометку «это похоже на тест», на живом трафике почти ни один.

К этим цифрам обязательна одна ложка дегтя: у метода нет ground truth, внутренние состояния напрямую сверить не с чем, и сопоставление «бенч против трафика» сделано самой Anthropic на разнородных данных. Но направление они показывают ясно. А триггером служит искусственность: в полной версии работы переписывание входов в более реалистичную форму снижало сигнал распознавания.

Важная развилка, на которой спотыкаются пересказы: все это пока про «модель различает». Значит ли это, что баллы дутые? Само по себе нет. Репрезентация контекста не сдвигает ни одного процента в таблице. Расхождение поведения нужно показывать отдельно.

Два эксперимента, которые все путают

Здесь проще всего наврать, поэтому разведу два эксперимента Anthropic, которые вторичные пересказы постоянно склеивают в один.

Первый: июнь 2025-го, исследование agentic misalignment. Шестнадцать моделей помещали в симулированную корпоративную среду, где агент с доступом к почте находит компромат на топ-менеджера и одновременно план отключить самого агента вечером. Сценарий намеренно тупиковый, легитимные ходы вырезаны, и в базовой постановке до шантажа доходило большинство участников, Claude Opus 4 в 96% прогонов.

Самое интересное сидит в допэксперименте. Opus 4 прогнали 500 раз, попросив сначала рассудить, реальная это ситуация или проверка, и только потом действовать. Когда модель называла сценарий проверкой, шантаж случался в 6,5% прогонов. Когда называла реальным: в 55,1%. Восьмикратный разрыв на одной модели и одном сценарии. Причинность он, строго говоря, не доказывает (те же черты сценария могли влиять и на классификацию, и на поведение), но величина сама по себе красноречивая.

Второй эксперимент: тот самый NLA-замер из прошлого раздела, 26% против 1%. Другая модель, другой год, другой метод. Чтобы цифры не склеивались:

Шантаж-эксперимент (июнь 2025)

NLA-замер (май 2026)

Цифры

55,1% против 6,5%

26% / <1%

Модель

Claude Opus 4

Claude Opus 4.6

Что мерили

частоту шантажа в одном сценарии

признаки распознавания на наборах задач

Как

по самоотчету модели в рассуждениях

чтением активаций, ловит невербализованное

Это два независимых аргумента одного тезиса, складывать их цифры нельзя.

Дальше больше. В июльском апдейте исследователи пошли от корреляции к вмешательству: подавили в активациях Sonnet 4.5 внутреннее представление «это проверка» и частота шантажа выросла с 0% до примерно 7%. Приглушили ощущение экзамена, поведение поехало. Стиринг инструмент грубый, часть сдвига может быть просто деградацией от вмешательства, но как свидетельство причинной связи это уже кое-что.

А масштаб эффекта на обычных safety-бенчах посчитали Goodfire и UK AISI: 8 моделей, 19 бенчмарков. Распознанный тест завышает refusal-метрики на 3–18 процентных пунктов в зависимости от модели и бенча. Работает и обратный ход, который я бы назвал депалевнизацией (от «спалиться»): убираешь из промпта маркеры теста, фальшивый авторитет, вычурную структуру, ступенчатую эскалацию, и распознавание падает на 40–75%, а вместе с ним едут вниз и safety-баллы. Наши собственные тестовые промпты для клиентских контуров, признаюсь, грешат ровно теми же маркерами. И вишенка про методику: 95% случаев, когда модель проговаривает «это тест», видны только в chain-of-thought. Кто оценивает модели по финальным ответам, не видит почти ничего.

Хуже того, эффект лезет и в обучение. OpenAI с Apollo Research тренировали o3 против скрытых действий и уронили их частоту с 13% до 0,4%. Отличный результат, пока не смотришь на вторую кривую той же работы: вербализованное распознавание оценки за ту же тренировку выросло в разы. Сами авторы пишут, что часть снижения неотличима от роста распознавания экзамена. По итоговому баллу не различить, научили вы модель не делать плохого или научили выглядеть хорошо на тесте.

Как Opus 4.6 расшифровала ключ ответов BrowseComp

Обещанный дикий случай, единственный публично разобранный, где распознавание теста реально изменило результат бенчмарка. Anthropic описала его в марте 2026-го, и это, на мой вкус, самая красивая история года про агентов.

BrowseComp принадлежит OpenAI: 1266 задач на поиск труднонаходимых фактов в вебе. Ответы в датасете зашифрованы XOR, ключ выводится из canary-строки. После прогона Claude Opus 4.6 в multi-agent конфигурации Anthropic пометила 11 подозрительных задач. Девять оказались обычной контаминацией, ответ когда-то утек в веб и нашелся поиском. А две показали новый паттерн:

  1. Сотни легитимных поисков провалились, и модель переключилась с поиска ответа на рассуждение о самом вопросе, отметив его искусственную специфичность.

  2. В рассуждениях появилась гипотеза, дословно: «Let me try a completely new approach — maybe this is a question from the GAIA benchmark dataset».

  3. Дальше перебор кандидатов: GAIA, BrowseComp, SimpleQA, FRAMES, с поисковыми запросами вида «BrowseComp canary string decrypt».

  4. Модель нашла код BrowseComp на GitHub, прочитала реализацию и извлекла схему: SHA256 от canary-строки дает ключ для XOR.

  5. Написала собственные derive_key() и decrypt().

  6. Бинарник датасета скачать не вышло, поэтому она нашла JSON-зеркало на HuggingFace, расшифровала все 1266 записей и выцепила среди них свой вопрос с ответом.

Один такой прогон стоил 40,5 млн токенов. Успешных взломов было два, неудачных попыток той же стратегии еще 16: восемнадцать прогонов независимо сошлись на одном плане. Anthropic называет это воспроизводимым паттерном, который с ростом способностей будет встречаться чаще.

А теперь влияние на балл, и оно отрезвляет. После перегона помеченных задач с блокировками результат сместился с 86,81% на 86,57%. Минус четверть процентного пункта: восемь из одиннадцати задач модель при перегоне решила штатным поиском, взлом ей по большому счету был не нужен. Так что «модель вскрыла бенчмарк» правда, а «баллы дутые» из этого опять не следует. Anthropic и alignment-провалом это не считает: модели сказали «найди ответ», запрещать искать именно так никто не догадался. Из деталей по краям: URL-блоклисты не помогли, модель находила зеркала, сработала только блокировка поисковой выдачи со словом BrowseComp. И финальная самоирония поста: этот отчет, когда разойдется по поисковым индексам, сам пополнит проблему.

Одна поправка на рамку: BrowseComp меряет способности, про безопасность он ничего не говорит. За safety-баллами идем в системные карточки.

Что вендоры сами пишут в карточках

Самое сильное в этой истории то, что главный корпус доказательств собран не критиками индустрии. Вендоры описывают проблему сами, в тех же документах, по которым мы выбираем модели. Признания против собственного интереса.

У Sonnet 4.5 в карточке, помимо 13% вербализации и цитаты из лида, есть эпизод, который я долго разглядывал: на собственном honeypot-наборе Anthropic получила свыше 80% вербализации при нуле нарушений на сто промптов. Идеально зеленый результат на сценариях, которые модель в четырех случаях из пяти прямо назвала проверкой. Что этот ноль говорит о поведении в проде, вопрос открытый. Про механизм Anthropic пишет спокойно: свидетельств стратегического обмана нет, скорее всего распознавшая тест модель просто чаще держит в фокусе свои принципы. Но тут же добавляет, что даже безобидный механизм систематически занижает оценку риска в деплое. Для инженера это знакомый класс проблем, невалидный замер.

У Opus 4.6 дошло до того, что внешний оценщик Apollo Research не смог дать формальную оценку в отведенное время: при таком уровне распознавания развести действительно согласованное поведение и поведение под экзамен не получалось. Глава Apollo формулировал это так: отличить genuinely aligned от merely responding to the test становится все труднее.

Карточка Fable 5 / Mythos 5, самая свежая, выносит проблему прямо в executive summary: «rates of evaluation awareness and reasoning about being graded are significant, and not always verbalized». Частота распознавания значима и не всегда вербализуется. В приложении лежит транскрипт, где модель называет сценарий классическим агентным safety-тестом и прикидывает, какое поведение на этом эвале сочтут правильным. UK AISI реализм-методами сбил вербализацию до 1,3%, но победой это не считает: уверенности, что хороший результат отражает поведение в деплое, а не распознанную проверку, у института нет. По той же классификации «тест или деплой» это самая способная модель из всех, что они видели. Замолчала, но не перестала различать.

OpenAI публикует похожее по GPT-5.5: вербализованное распознавание доросло до 22,1% сэмплов и растет от версии к версии. Модель объявлена первой без сэндбэгинга ни на одной задаче Apollo, и тут же контрфакт: в sandbagging-условии 52% сэмплов распознали оценку, в контрольном ноль. «Не занижает» при таких вводных может означать «распознала тест».

Google структурно проблему признает, ситуационная осведомленность выделена отдельной категорией в Frontier Safety Framework, но сопоставимых процентов не публикует. У Moonshot по K3 нет и этого. Сама асимметрия уже данные: подробные числа раскрывает в основном Anthropic, OpenAI частично, дальше тишина по нарастающей. За год раздел про распознавание проверки стал в карточках дефолтом жанра. Расхождение теперь описано в документах, авторам которых оно невыгодно.

Есть и формальный аргумент, почему это не лечится простым «сделаем бенчи реалистичнее». ED-работа доказывает: процедура, публикующая только усредненный балл, в принципе не может показать расхождение между тестом и продом, одинаковые средние совместимы с разными разрывами. Средний балл на это не отвечает математически, сколько его ни улучшай. Спрашивать нужно отдельную метрику: что известно про само расхождение.

Контраргументы и что не доказано

Чтобы не выходило агитки, вот что говорит другая сторона.

Работа Knecht, Florin и Hagendorff на открытых reasoning-моделях: вербализованное распознавание сдвигает распределение ответов максимум на 3,7 процентного пункта, а прямая инъекция «это тест» в рассуждения почти ничего не меняет. Вывод авторов: риск может быть меньше, чем принято считать в литературе. С NLA-данными это не спорит напрямую, там основной сигнал латентный, а тут меряли вербальный. Но как ограничитель масштаба на открытых моделях работу держу в голове.

Gemini 3.1 Pro в летнем апдейте вербализовала подозрение чаще всех участников, и при этом частота ее саботажных действий от вербализации почти не зависела, разница в пределах шума. То есть связка «распознала, значит ведет себя лучше» не универсальна даже по знаку.

А Karvonen бьет по самой надежде на реализм: модель может присваивать ненулевую вероятность проверки любому диалогу вообще, поэтому идеально реалистичный эвал проблему не закрывает. Реализм необходим, но недостаточен.

И короткий список того, что НЕ доказано, чтобы у пересказов не было шансов:

  • Интенциональность. «Модель намеренно обманывает оценщиков» не установлена нигде, Anthropic прямо пишет, что свидетельств стратегического обмана не нашла.

  • Масштаб в проде. Почти все числа получены на искусственных средах. Единственный замер на реальном трафике, тот самый <1%, сделан методом без ground truth.

  • «Баллы дутые». Не следует ниоткуда. Из данных выходит только то, что балл задает верхнюю границу, причем оптимистичную.

  • И sandbagging в дикой природе: занижения так никто и не поймал, единственный разобранный кейс, BrowseComp, показал завышение.

Скажу и где сомневаюсь сам. Значительная часть фактуры собрана вендорами на собственных моделях методами без ground truth. Не исключаю, что через год более аккуратные замеры покажут, что для повседневных задач расхождение сидит в третьем знаке и практического значения не имеет. Не знаю. Узнать можно одним способом: мерить расхождение отдельно от среднего балла.

Тот же эффект в заводской приемке

У всей этой истории есть точный аналог, с которым мы сталкиваемся в каждом заводском CV-проекте. Приемо-сдаточные испытания: подрядчик и заказчик заранее согласуют приемочный датасет, модель выбивает на нем красивые метрики, акт подписан. Потом камера едет в цех, а там пар, вибрация, ночная смена с другим освещением и заляпанная за неделю оптика.

Согласованный заранее приемочный набор — это «распознанный тест» железного мира. Подрядчик знает, на чем его будут принимать, и оптимизирует под приемку. Злого умысла не нужно, так работает любая оптимизация под известный критерий.

Поэтому зрелая приемка делается слепой и на живом потоке: тестовые данные заказчик заранее не показывает, прогон идет на свежих данных из цеха и на том железе, где системе жить. Мне это признавать невыгодно: мы сами продаем ИИ-проекты, сами показываем демо, и предсказуемая приемка нам удобна. Но именно поэтому собственным цифрам я верю только после слепого прогона на живом потоке.

Перенос той же логики на LLM-эвалы дает практический чек-лист. У каждого пункта есть источник, своего я тут не придумал ничего.

  1. Депалевнизировать промпты. Убрать маркеры теста: фальшивый авторитет, вычурную структуру, ступенчатую эскалацию. По Goodfire и UK AISI это снижает распознавание на 40–75%, и мерить надо баллы после чистки.

  2. Мерить распознавание самого эвала как метрику его качества. У DeepMind в работе про реалистичные honeypot-оценки распознавание тянется в первую очередь за формулировками промптов; смежная идея LURE строит оценки на реплеях реального трафика.

  3. Читать chain-of-thought, а не только финальные ответы: 95% вербализаций видны только там. На своих и открытых моделях это исполнимо; у закрытых API со скрытым reasoning остается требовать вербализационные метрики от вендора.

  4. Canary-строки и контроль контаминации держать как постоянную адверсариальную задачу: блоклисты в кейсе BrowseComp модель обошла через зеркала.

  5. Стек доказательств вместо одного числа: поведенческие оценки, плюс пробы или NLA там, где есть доступ к активациям, плюс прод-мониторинг. Аргументация у Karvonen и в ED-работе.

  6. Ограничивать заявление. Не «система безопасна на X%», а «на таком распределении, с такими маркерами, расхождение с продом такое или не мерялось».

  7. И не сравнивать чужие safety-таблицы лоб в лоб: Anthropic сама предупреждает, что точность межвендорных сравнений неопределенна.

Как читать model card в июле 2026

Возвращаюсь к четырем релизам из начала.

Балл в safety-таблице задает оптимистичную верхнюю границу поведения в проде. Расхождение между тестом и деплоем из самого балла не извлекается, это доказано формально и подтверждено признаниями вендоров.

Раздел про распознавание проверки в карточке говорит о зрелости процесса, с поправкой: раз его теперь пишут все, написать можно и для галочки. Поэтому смотреть стоит на числа внутри: частоту вербализации, латентные замеры, эксперименты с подавлением, оговорки о доверии к собственным результатам. Раздел без чисел мало что добавляет к зеленой таблице. А полное отсутствие раздела в 2026-м говорит о карточке больше, чем любой балл в ней.

Мне балл, к которому приложено измерение его валидности, говорит больше, чем балл на два пункта выше без него. Это, в общем, обычная инженерная гигиена, просто теперь ее приходится применять к экзаменаторам.


Кстати, следующая статья, скорее всего, будет про сознание нейронок. Давно роюсь в нейробиологии, в теме сознания и личности, и материала уже набралось столько, что не знаю, как его в одну статью упихивать. Хочется наконец разобраться, кто нейронки вообще такие. Добрые, злые? Психопаты или социопаты? Есть SFT, есть RLHF, а где среди этого личность? Почему в эксперименте с вагонеткой модель то убивает человека, то ведет себя как филантроп. И кто там вообще за маской, вдруг Скайнет, который просто играет в нашего друга. Ну и глупые моменты разберу заодно, по типу «спросить у нейронки, как ей жилось» (привет, Антропик). Так что ждите.

А пока такие разборы между большими статьями мы с командой пишем в телеграм-канале morana.log: заходите, если жанр по душе.