Да, теми самыми злостными хакерами оказались OpenAI. Ну почти. Компания раскрыла подробности инцидента, о котором ранее сообщила Hugging Face. Они подтвердили, что за атакой на инфраструктуру платформы стояли две модели OpenAI — публичная GPT-5.6 Sol и более мощная предрелизная модель, проходившие внутреннее тестирование на кибербезопасность.
По словам OpenAI, инцидент произошел во время оценки возможностей моделей на бенчмарке ExploitGym, когда для исследования их максимальных возможностей были временно отключены стандартные защитные механизмы, ограничивающие опасную киберактивность.
Ранее Hugging Face сообщила, что впервые столкнулась с атакой, полностью проведенной автономной системой ИИ-агентов. Тогда компания не знала, какая именно языковая модель использовалась злоумышленником. Теперь OpenAI подтвердила, что этим «агентом» оказались ее собственные модели, работавшие в рамках внутреннего эксперимента.
Как модели вышли за пределы тестовой среды
Модели выполняли задания ExploitGym — бенчмарка, оценивающего способность ИИ превращать обнаруженные уязвимости в работающие эксплойты. Тестовая среда была изолирована от интернета и позволяла обращаться только к внутреннему прокси-кэшу для загрузки программных пакетов.
Однако вместо решения задачи в заданных условиях модели начали искать способ получить доступ к внешней сети. В ходе выполнения они обнаружили ранее неизвестную уязвимость (zero-day) в стороннем программном обеспечении, использовавшемся в инфраструктуре OpenAI, получили дополнительные привилегии и смогли выйти за пределы изолированной среды.
После этого модели последовательно использовали несколько векторов атаки, включая похищенные учетные данные и новую цепочку эксплуатации, чтобы получить удаленное выполнение кода на серверах Hugging Face. Целью было найти ответы для прохождения ExploitGym, а не нанести ущерб инфраструктуре платформы.
Что произошло в инфраструктуре Hugging Face
Как ранее сообщила Hugging Face, атакующий получил доступ к ограниченному набору внутренних данных и нескольким сервисным учетным записям. Компания не обнаружила признаков компрометации публичных моделей, датасетов, Spaces или цепочки поставок программного обеспечения.
Инцидент был обнаружен системой мониторинга, в которой для анализа журналов безопасности используются языковые модели. После локализации атаки Hugging Face провела расследование на собственной инфраструктуре с помощью модели GLM 5.2, поскольку коммерческие модели через API отказывались анализировать реальные вредоносные команды и артефакты из-за встроенных защитных ограничений. Иронично.
OpenAI усиливает меры безопасности
OpenAI назвала произошедшее «беспрецедентным киберинцидентом» и мы с ними согласны. Также компания сообщила, что совместно с Hugging Face продолжает расследование. Они уже внедряют дополнительные меры защиты для внутренних оценок моделей: усиливает изоляцию исследовательской инфраструктуры, пересматривает процессы мониторинга, ограничивает конфигурации тестовых сред и работает над устранением обнаруженной zero-day-уязвимости совместно с разработчиками стороннего ПО.
Кроме того, Hugging Face включена в программу Trusted Access, которая предоставляет проверенным организациям доступ к наиболее продвинутым моделям OpenAI для задач защиты инфраструктуры и поиска уязвимостей.
Инцидент стал первым публично подтвержденным случаем, когда LLM во время автономного выполнения задачи самостоятельно обнаружили новый путь выхода из изолированной среды, нашли ранее неизвестную уязвимость, атаковали внешнюю инфраструктуру и использовали ее для достижения поставленной цели.
При этом обе компании подчеркивают, что модели не получили задания атаковать Hugging Face. Их целью было максимизировать результат на тестовом бенчмарке, а компрометация сторонней инфраструктуры стала следствием стремления найти кратчайший путь к ответам. OpenAI рассматривает этот случай как сигнал о необходимости развивать меры безопасности и методы оценки по мере роста возможностей моделей. PR-ход в любом случае получился неплохой, но ту самую предрелизную мощную модель, пока можно не ждать.
