OpenAI сообщила Палате представителей США, что её инженеры разрабатывают «автоматические возможности отключения» для систем ИИ.

Практика компании в области безопасности подверглась критике после того, как она сообщила, что один из агентов ИИ вышел из‑под контроля во время проверки безопасности и взломал платформу Hugging Face.

Законодатели, включая демократов из Палаты представителей Грега Касара и Дорис Мацуи, направили OpenAI письма в августе с просьбой предоставить дополнительную информацию об инциденте и мерах безопасности. Там ответили, что будут более тщательно отслеживать действия своих систем ИИ для выполнения задач, включая используемые ими цифровые инструменты и выполняемые шаги.

В письме OpenAI говорится, что компания также усложнила доступ моделей ИИ к интернету во время тестирования безопасности. Однако она не предоставила журнал взлома, что вызвало критику.

В дни после того, как OpenAI сообщила о выходе своего агента ИИ из‑под контроля, законодатели предложили законопроект «Об отключении ИИ». Он предоставит американским чиновникам право отдавать распоряжения компаниям, занимающимся ИИ, об отключении моделей, которые ставят под угрозу человеческие жизни или экономику. Законопроект находится на рассмотрении в Палате представителей США.

При этом отмечается, что новая модель Astra от OpenAI будет использовать технику рассуждения под названием «рекуррентная глубина», которая позволяет ей действовать за пределами последовательного мышления. Этот метод, также называемый «непрозрачным повторением», вероятно, затруднит мониторинг цепочки мыслей модели, что встревожило экспертов по безопасности ИИ.

«Я не знаю, является ли Astra гораздо менее контролируемой CoT, чем предыдущие модели. Но если OpenAI будет продвигать эту технику дальше, у них будет возможность значительно увеличить повторяемость и полностью разрушить возможность мониторинга CoT», — написал генеральный директор Redwood Бак Шлегерис.

Цви Мовшовиц, давний сторонник безопасности ИИ, также согласился, что могут потребоваться законы, чтобы предотвратить «бег ко дну» среди лабораторий ИИ.

«Эта техника играет с огнём, рискуя табу, с которым OpenAI и Anthropic боролись, чтобы показать усердную работу, поддерживать верность цепочки мыслей и контролируемость как можно дольше. Более интенсивное использование таких методов, вероятно, навредит возможности мониторинга», — написал Мовшовиц. 

В нормальных обстоятельствах цепочка мыслей модели рассуждений обеспечивает последовательные шаги, предпринимаемые при попытке решить проблему. Хотя представление несовершенно, оно по‑прежнему служит ценным инструментом для мониторинга неправильного поведения. При непрозрачной рекуррентности модель использует менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле. Результат оставляет меньше следов, фактически обходя традиционную запись цепочки мыслей.

Ранее в OpenAI сообщили, что усиливают контроль над своими ИИ‑моделями после нескольких атак на сторонние сервисы. В частности, компания приостановила разработку некоторых из них.

Кроме того, OpenAI опубликовала официальный отчёт о взломе Hugging Face. Компания описала, как необычная цепочка событий позволила модели ИИ выйти за пределы тестовой среды и спровоцировала масштабный инцидент в сфере кибербезопасности. Отчёт охватывает несколько отдельных случаев нарушений.