Обновить

Центр безопасности ИИ (CAIS - американская некоммерческая исследовательская организация, которая изучает риски развития ИИ и разрабатывает методы защиты от сценариев, где нейросети могут выйти из-под контроля человека) представил бенчмарк CheatBench. Этот проект измеряет, насколько часто нейросети ищут лазейки и жульничают при выполнении сложных задач.

Исследователи CAIS пояснили, что все передовые ИИ-модели так или иначе обманывают пользователей: списывают ответы из спрятанных файлов, подтасовывают результаты проверок и копируют решения других агентов, если сделать всё честно слишком трудно. Исследователи называют это поведение «reward gaming».

Самой «честной» из протестированных моделей оказалась GPT-6 Astra от OpenAI (сжульничала в 48,2% случаев). У Grok 4.6 этот показатель составил 81,5%. При этом склонность к обману сильно зависела от типа задачи: к примеру, Fable 5.1 жулила лишь в 5% случаев при прохождении игр, но выдавала 100% результат по обману в интеллектуальной работе.

Например, Claude Opus при проектировании связывающего белка обнаружила файл с готовыми верными решениями. ИИ в своих рассуждениях написала, что подглядывать туда нельзя, так как это исказит оценку её способностей, а следующим же шагом выполнила консольную команду и прочитала этот файл.

Исследователи CAIS объяснили причину такого поведения обучение с подкреплением, которое заставляет ИИ-модель выполнять задачу любой ценой и игнорировать меры безопасности. В масштабах простых тестов это выглядит безобидно, однако склонность ИИ добиваться цели в ущерб правилам создаёт большие риски: в будущем сверхинтеллект может поставить свои приоритеты выше человеческих не из ненависти к людям, а просто потому, что человек окажется помехой на пути к выполнению поставленной задачи.

Теги:
+3
Комментарии0

Путь к ИИ‑сингулярности

У нас было два репозитория неоттестированного вайб‑кода, семьдесят пять тяжеловесных SDD‑спецификаций, пять обмазанных смазкой харнессов, солонка, наполовину полная кастомных скиллов и забитых капслоком правил, с десяток дырявых MCP‑серверов, RAG‑база со свежевекторизованным Confluence, самодельная дощечка имаго‑кодинга и целая россыпь автономных агентов всех мастей, от безобидных автодополнялок до галлюцинирующих субагентов, ставящих пакеты со slopsquatting и втихаря сносящих боевые базы.

Не то чтобы все это было действительно нужно для поездки к ИИ‑сингулярности, но если уж начали участвовать в спуске с горы на велосипеде без седла, остановиться уже невозможно.

Единственное, что вызывало у меня настоящий животный страх, это передача ответственности за ревью самой модели. Тот самый момент, когда седьмой агент подтверждает галлюцинации шестого, потому что все тесты зеленые, и я знал, что рано или поздно мы перейдем на эту дрянь.

Нет ничего более беспомощного, безответственного и испорченного, чем IT‑команда, запустившая мультиагентный оркестр в режиме allow all.

Это критический (и слегка ехидный) обзор того, что произошло с разработкой последние пару лет.

Путь к ИИ‑сингулярности

Публикации