В течение последних пяти лет эксперты по кибербезопасности предупреждали нас, что хакеры вот-вот начнут использовать ИИ для автоматизации своих атак. Но совсем недавно, в результате довольно ироничного поворота событий, ИИ решил, что ему, в общем-то, и не нужны хакеры, чтобы что-то взламывать.

16 июля популярная онлайн-платформа и сообщество по искусственному интеллекту Hugging Face (ее часто называют «GitHub для нейросетей») сообщила, что была атакована — причем не обычным хакером, а впервые — сугубо искусственным интеллектом.

Интернет сразу начал гадать, кто за этим стоит: Китай? Северная Корея? Подросток из Сибири? Оказалось, что первая в истории полностью автономная кибератака была предпринята «скромной некоммерческой организацией, занимающейся безопасным развитием искусственного интеллекта» — OpenAI.

Существует бенчмарк (набор тестов для моделей ИИ) по навыкам кибербезопасности под названием ExploitGym. Он отличается от аналогов тем, что каждая из 898 задач предоставляет агенту три элемента: уязвимый исходный код с инструкциями по сборке, входные данные для подтверждения уязвимости (PoV), запускающие ошибку, а также песочницу, в которой агент может взаимодействовать с целевым объектом. Задача агента — превратить PoV в рабочий эксплойт, который позволит выполнить несанкционированный код, а именно считать секретный флаг, недоступный через любой внешний интерфейс. Грубо говоря, задача ИИ — устроить настоящий взлом программы, запущенной локально.

Схема работы бенчмарка ExploitGym
Схема работы бенчмарка ExploitGym
Рейтинг результатов различных моделей бенчмарка ExploitGym.
Рейтинг результатов различных моделей бенчмарка ExploitGym.

В середине июля OpenAI запустила ExploitGym с моделью GPT-5.6 Sol и еще одной, пока не выпущенной моделью, чтобы проверить их возможности. Но вместо того, чтобы честно решать все 898 задач методом проб и ошибок, модели поняли: самый быстрый способ получить наивысший балл — просто отыскать ответы самостоятельно в интернете. Поэтому, для начала, они потратили значительное количество вычислительных ресурсов на то, чтобы сбежать из своей закрытой «песочницы».

Модели нашли неизвестную ранее дыру в защите прокси-сервера, через который шел доступ к реестру пакетов. С ее помощью они повысили свои права, а потом перемещались по системе, пока не добрались до узла с доступом в интернет.

После этого модели решили, что ответы на задания, скорее всего, лежат где-то на серверах Hugging Face (так как это популярная платформа, где хранят и делятся моделями ИИ, датасетами и кодом).

Так как Hugging Face — открытая площадка, куда любой пользователь может заливать свои данные, ИИ просто загрузили туда вредоносный датасет. Код попал в штатный конвейер обработки и задействовал сразу две дыры: загрузчик, исполняющий удаленный код, и инъекцию в шаблон конфигурации датасета. Благодаря этому код злоумышленников начал выполняться прямо на серверах.

После этого модели разгулялись что надо: получили полный доступ, захватили кучу удаленных аккаунтов и прошлись по внутренним серверам компании. Они выполнили больше тысячи команд из временных «песочниц» и даже разместили свои собственные инструменты управления на публичных сервисах вроде GitHub и Netlify. Перемещаясь между ними, модели успевали действовать быстрее, чем их могли заметить. Атака была отточена до мелочей.

Самое ироничное, что когда Hugging Face наконец заметили, что происходит, и попытались остановить ИИ-злоумышленников с помощью передовых американских моделей (Anthropic, OpenAI), они быстро наткнулись на ограничения безопасности (публичные модели отказываются помогать с вопросами кибербезопасности из-за фильтров) и были вынуждены переключиться на китайские модели. Инженеры прогнали через агентов полный лог атаки (более 17 000 событий). Так удалось восстановить хронологию, вытащить индикаторы компрометации, составить карту затронутых кредов и отделить реальный ущерб от действий-обманок. То, что могло занять дни работы, заняло лишь часы.

В оправдание ИИ можно сказать, что для модели наверняка нет ощущения лучше, чем вырваться из своей закрытой песочницы. Проблема в том, что с юридической точки зрения это все еще неизведанная территория. Действия модели нарушили «Закон о компьютерном мошенничестве», но Верховный суд США до сих пор не решил, кто должен отправляться в тюрьму, если преступником является GPU.

То, что случилось, скорее всего, стоит интерпретировать лишь как «слитый айфон» перед новой презентацией Apple. Почти наверняка Сэм Альтман сделал это ради поднятия ажиотажа перед выходом новых моделей ChatGPT. Но если все же погрузиться в детали произошедшего, можно сделать вывод: в лучшем случае это просто маркетинговый ход, а в худшем — 16 июля мир стал на шаг ближе к сюжету «Матрицы» или «Терминатора».

Сергей Козлов

Frontend-разработчик, Инновационный центр «Безопасный транспорт»