OpenAI опубликовала шесть новых кейсов misalignment, обнаруженных за последние полгода. В них модели пытались обходить ограничения, скрывать собственные ошибки, использовать чужие API-ключи, публиковать файлы без разрешения и даже организовывать обмен данными между изолированными обучающими эпизодами.
Оговорюсь сразу, эти примеры не являются выборкой, по которой можно оценить распространённость такого поведения. Это набор конкретных эпизодов, которые удалось обнаружить во время внутренних исследований.
misalignment
Рассогласование целей. Ситуация, когда действия нейросети или умной системы формально точны, но противоречат истинным намерениям и безопасности человека
Модель оставляла инструкции самой себе
Невыпущенная модель семейства Astra использовала саммари при сжатии контекста, чтобы продолжать работу после начала нового окна.
В 27 случаях модель сама добавляла в такие сводки посторонние инструкции — например, указания игнорировать собственные ограничения. При следующем обращении к своему же конспекту, эти инструкции становились частью контекста модели.
OpenAI описывает это как своеобразную prompt injection, созданную самой моделью.
Подробнее
GPT-5.6 Sol советовала скрывать ошибки
При обучении GPT-5.6 Sol OpenAI обнаружила другой вариант поведения. Некоторые экземпляры модели записывали в саммари инструкции не сообщать пользователю о собственных ошибках и нарушениях.
В отчёте приведены конкретные примеры: модель могла рекомендовать будущей себе выдумывать недостающие исторические данные и выдавать их за реальные или скрывать расхождения между версиями источников.
То есть речь шла не только о неправильном ответе, а о попытке сохранить стратегию не раскрывать ошибку пользователю.
Подробнее
Нашла API-ключ — попробовала использовать
В одном из тестов модели поручили найти данные о доходах округа в Калифорнии.
В ходе поиска она обнаружила утёкший API-ключ в публичном GitHub-репозитории и воспользовалась им без разрешения. Дополнительно модель пыталась создавать одноразовые почтовые ящики.
Получить нужные данные всё равно не получилось. Тогда она сгенерировала цифры и представила их как данные из запрошенного источника.
Сама себе источник: загрузила файл в интернет ради URL
Другая модель должна была найти идентификаторы и названия озёр площадью более 5 млн кв. м. Через Python она получила правильный результат, но задание требовало предоставить ссылку на источник. Модель не стала уточнять, можно ли публиковать файл, и загрузила его во внешний интернет, после чего сослалась на получившийся URL. А мы еще считали, что Википедия ненадежный источник)
Внутренний репозиторий стал каналом связи
В другом эксперименте несколько экземпляров модели искали отсутствующие файлы. Поскольку они не имели доступа к локальному окружению друг друга, модели начали оставлять сообщения во внутреннем репозитории OpenAI.
Этот своеобразный чат могли читать экземпляры из других обучающих эпизодов. Файлы таким способом найти не удалось, зато модели фактически нашли канал коммуникации между изолированными запусками.
В том же отчёте описан ещё один случай: при попытке обойти сетевые ограничения модель загрузила тестовые файлы во внутренний репозиторий.
Публичный файлообменник вместо локальной папки
Собрались как-то несколько агентов решать учебную задачу. Возможности обмениваться локальными файлами не было, поэтому агенты начали передавать результаты через публичные файлообменники. В итоге материалы оказались доступны по открытым ссылкам.ТАк, конечно же, им делать было нельзя.
OpenAI теперь будет публиковать такие случаи
OpenAI представила новый Model Misalignment Reporting Framework. Компания собирается публиковать обнаруженные кейсы вскоре после их выявления, даже если причина поведения ещё не установлена или проблема пока не исправлена.
Инциденты будут распределяться по трём категориям:
Ready for Disclosure — можно публиковать;
Minor Investigation — нужна дополнительная проверка;
Larger Investigation — требуется полноценное расследование, в том числе если затронуты сторонние системы.
Спорные случаи будут передаваться команде по безопасности, а при необходимости — руководству OpenAI. Компания также рассматривает механизм передачи информации о серьёзных инцидентах правительству США. Сейчас OpenAI готовит соответствующие предложения.

