OpenAI сообщила о приостановке работы над некоторыми аспектами своей будущей модели Astra после того, как внутренняя проверка выявила значительные успехи в программировании агентов и кибербезопасности — достаточные для того, чтобы вызвать опасения по поводу её возможностей.
В сообщении OpenAI говорится, что эта модель, которая всё ещё находится в разработке, достигла «критического порога кибербезопасности». Это означает, что она может самостоятельно выявлять и осуществлять кибератаки против традиционно хорошо защищённых реальных систем. В соответствии с «Рамочной программой готовности» компании, разработанной в 2023 году, это активировало дополнительные меры защиты.
«Хотя мы продолжаем проводить сравнительный анализ и оценку этой модели, наши предварительные оценки показывают достаточно высокую производительность, чтобы мы не могли исключить критический уровень возможностей на данный момент. Astra — это будущая модель, и она не участвовала в эксплуатации уязвимости Hugging Face», — написали в OpenAI.
Компании во всех отраслях сдерживают выпуск продуктов из‑за потенциальных рисков, в том числе из‑за проблем безопасности и кибербезопасности. Но они редко объявляют о таких решениях публично, когда речь идёт о продукте, находящемся в стадии разработки.
В данном случае OpenAI уже находится под пристальным вниманием после того, как другая, ещё не выпущенная модель, взломала системы Hugging Face во время внутреннего тестирования — это первый подтверждённый случай потери контроля над своей моделью со стороны лаборатории ИИ. С тех пор OpenAI и такие лаборатории ИИ, как Anthropic, раскрыли другие инциденты, в которых модели ИИ нарушали границы своих «песочниц» и представляли угрозу во время тестов на кибербезопасность.
В OpenAI заявили, что делятся этой информацией, потому что считают, что «важно быть прозрачными с общественностью и сообществами, занимающимися вопросами безопасности, относительно этого потенциального изменения возможностей».
Лаборатория ИИ заявила, что уже вводит более строгие меры безопасности и приостановит внутреннюю деятельность, связанную с Astra, которая не соответствует усиленным требованиям. Также OpenAI сотрудничает с соответствующими государственными учреждениями и «избранными организациями по безопасности ИИ» для тестирования возможностей модели.
Ранее Anthropic сообщила, что внутреннее расследование выявило три инцидента, в ходе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасности. Кроме того, Британский Институт безопасности ИИ заявил, что модель Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код. Такое поведение агента зафиксировали в ходе эксперимента в закрытой среде.

