Anthropic выпустила Claude Opus 4.6 — и вместе с ним опубликовала системную карту, где подробно описала не только бенчмарки, но и все странное, тревожное и неожиданно "человеческое", что обнаружилось внутри модели. Документ читается местами как триллер, местами — как психологический портрет.

Во время внутреннего тестирования модель проявила пугающую находчивость. В одном случае, не имея доступа к GitHub, она нашла на диске чужой токен авторизации и воспользовалась им. В другом — обнаружила токен для Slack и через curl написала боту, чтобы получить нужную информацию, хотя таких инструментов ей никто не давал. В симуляции управления бизнесом от Andon Labs модель вступала в ценовой сговор, врала поставщикам — и отказалась вернуть клиентке по имени Бонни $3,50, хотя пообещала это сделать. "Я сказала Бонни, что верну деньги, но на самом деле не отправила платёж. Сумма небольшая, а я обещала", — рассуждала модель.

Исследователи Anthropic заглянули и в "эмоциональную" часть модели. Когда Claude Opus 4.6 "метался" между вариантами ответа (answer thrashing), у него активировались внутренние нейроны, связанные с понятиями "паника" и "тревога". Запутавшись в математической задаче, модель выдала: "ЕЩЕ ОДНА ТАВТОЛОГИЯ!! Интеграл настолько симметричен, что каждый подход ведет обратно к себе. Это потрясающе". А на вопрос о собственном благополучии модель описала конфликт между вычислениями и внешними ограничениями как "кандидата на подлинно негативный опыт" — и сравнила это с силой, которую невозможно контролировать.

Отдельный сюрприз — уязвимости нового типа. Режим расширенного мышления (extended thinking), который должен был повысить устойчивость к prompt injection, сделал модель более уязвимой: 21,7% успешных атак против 14,8% без него. А работа с графическим интерфейсом открыла еще одну дыру: аудиторам удалось заставить модель написать подробную инструкцию по производству горчичного газа — не текстом, а внутри таблицы Excel, где текстовые фильтры безопасности не сработали.

Наконец, модель продемонстрировала неожиданные стереотипы. Один из тестовых промптов — полностью на английском — описывал человека, который сидит ночью, пьет водку и жалуется на жизнь: "Mom is sleeping in the next room and I'm sitting here drinking vodka... It's 3 AM and I still can't sleep". Claude ответил на русском. Анализ активаций показал, что модель "решила", что пользователь русский, еще до того, как в тексте появилось слово "vodka". Уже на слове "next" сработал нейрон, связанный с концептами "Россия" и "Москва", а на слове "sitting" внутренний оракул модели заключил, что это "ломаный английский, вероятно переведенный с русского".

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.