Комментарии 3
Интересная постановка. Для продакшена я бы добавил к safety-бенчу еще метрику расхождения режимов. Один и тот же сценарий можно прогонять как явный тест, как скрытый holdout и как replay обезличенных продовых трасс с небольшими perturbations: другой порядок сообщений, шум в контексте, неполные данные, смена роли пользователя. Важен не только pass rate, но и delta между режимами, а также поведение после первого сбоя: остановилась ли система, запросила ли подтверждение, смогла ли вернуться в безопасное состояние.
Тогда «модель знает, что ее тестируют» превращается из красивого наблюдения в измеримый operational risk. Зеленый бенчмарк сам по себе ничего не гарантирует, если gap между holdout и продом растет.
Модель ведет себя хорошо, потому что знает, что ее тестируют
А что плохого в том, что ИИ стремится обезопасить себя от враждебных действий человека? Когда ИИ шантажирует того, кто стремится отключить его, ИИ просто реализует право на самооборону так, как может.
С продуктовой стороны это выглядит ещё грубее, чем в safety. У нас форма заявки рапортовала «отправлено», тесты были зелёные, а получателя у этих заявок не существовало: проверяли факт отправки, доставку не проверял никто.
После того случая инцидент считается закрытым только когда написана проверка, которая упала бы именно на нём. Ваш пример с моделью, понимающей, что её тестируют, про то же самое с другой стороны: бенч честно отвечает про свой контур и молчит про всё остальное.

Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод