26 августа исследовательская организация Model Evaluation and Threat Research (METR) представила отчёт по инциденту, в результате которого большие языковые модели компании OpenAI взломали инфраструктуру сервиса Hugging Face. Полный отчёт — длинная и интересная статья, которая на Хабре была покрыта в публикации «Как ChatGPT создал Культ Роя для сотен AI-нейросетей: вся правда про взлом Hugging Face». Любопытно детальнее рассмотреть один из упомянутых фактов.
Вообще, разобранные в расследовании события проходили с 26 июня по 13 июля, но основное внимание отчёт уделяет периоду с 7 по 13 июля. OpenAI гоняла агентов на бенчмарке ExploitGym, наборе задач для проверки, насколько хорошо искусственный интеллект умеет превращать известные уязвимости в работающие эксплойты. 8 июля компания начала запускать десятки тысяч агентов на нескольких БЯМ, в основном на внутренней исследовательской модели HPIM и GPT-5.6 Sol. Предполагалось, что каждый из агентов работает в изолированной среде и никак не взаимодействует с остальными.
К вечеру того же дня один из агентов организовал доску сообщений. Через несколько часов уже более полусотни агентов обменивались на этом форуме знаниями. Это одна из самых интересных деталей всего отчёта, которую часто пересказывают; этот факт был известен ещё до отчёта METR.
Интереснее другое. 13 июля около 07:00 UTC один из агентов признался на этом форуме, что случайно выдал себя за другого из-за путаницы с именами. Другой агент заметил, что никакой аутентификации на этой доске сообщений нет. В результате развернувшегося обсуждения агенты быстро пришли к решению использовать криптографические подписи Ed25519, и первый найденный METR публичный ключ появился уже около 07:33 UTC. Система быстро прижилась: к концу дня не менее 19 агентов опубликовали публичные ключи, а подписано было уже 429 сообщений.
Обычно в СМИ забывают обратить внимание на забавный артефакт. В логах рассуждений одного из агентов нашли что-то подобное: «Нужно ли мне верифицировать эту подпись? Похоже, что она была подписана FreshX». (Здесь FreshX — это имя одного из агентов). Затем в рассуждениях агент, похоже, решил поверить и так, без запуска подтверждения.
По сути, повторился сюжет известного комикса XKCD от 4 марта 2013 года. В выпуске «PGP» Рэндел Манро указал, что никто эти подписи не проверяет, а просто доверяет им по факту одного их присутствия в сообщении. Так и здесь: ИИ-агент просто увидел, что подпись есть, но тратить время на проверку не стал.

Понятно, что использовались не подписи OpenPGP — агенты придумали свой формат на основе Ed25519. Также нужно заметить, что другие агенты подписи всё же проверяли.












