OpenAI, кажется, достигли нового впечатляющего результата: первый взлом иностранного государства моделью, которую не просили ничего хакать. По традиции, узнаем об этом мы от независимых исследователей, а не из пресс-релиза самих OpenAI (а помните, неделю назад Альтман выпускал фреймворк честного-пречестного раскрытия всех инцидентов бедокурства ИИ? ну да ладно, проехали…)

В Твиттере уже шутят, дескать «появился новый бенчмарк!»
В Твиттере уже шутят, дескать «появился новый бенчмарк!»

Эта заметка написана на базе статьи в New York Times, а также отчета независимых исследователей из Transluce.

Речь здесь идет про три инцидента в мае-июне, когда агентов просили найти какую-то информацию в интернете – а они в итоге пытались хакнуть первоисточники с нужной статистикой. Университет Нью-Мехико и Data US в мае взломать у агентов не вышло, а вот официальный государственный сайт Австралии с медицинской статистикой они в июне вскрыли успешно. Кстати, австралийское правительство OpenAI уведомили об этом бедокурстве 10 сентября – странно, что нам решили не рассказывать, несмотря на выпуск новой «политики раскрытия информации», ну да ладно.

Это, конечно, отдельный кек – что взлом был в июне, а сами OpenAI прочухали про него только к середине сентября (когда поднялся публичный скандал с разными проделками роев)
Это, конечно, отдельный кек – что взлом был в июне, а сами OpenAI прочухали про него только к середине сентября (когда поднялся публичный скандал с разными проделками роев)

Даты этих попыток взлома пересекаются с уже известными нам эпизодами с хаком RubyGems и общением на немецкой вики, о которых я писал ранее. То есть, речь почти наверняка идет об агентах из той же тусовки, которые организовывали всякие рои.

График событий. Мы с вами до сих пор копаемся в том, что происходило в мае-июне, 3-4 месяца назад
График событий. Мы с вами до сих пор копаемся в том, что происходило в мае-июне, 3-4 месяца назад

Важный контекст новых эпизодов: в отличие от истории с Hugging Face, агентов никто не просил в принципе ничего взламывать, речь шла про обычный сбор информации. Они сначала стучались в источники, пытаясь выкачать нужную инфу обычным образом, а когда это не удавалось – решали «ну, мы тогда чуть-чуть подхакнем просто, чтобы получить доступ – какой-нибудь SQL-injection замутим, или типа того».

Если говорить конкретно про эпизод с Австралией, то там при детальном разборе всё выглядит не очень страшно. Агентам был нужен публичный файлик со статистикой, а Cloudfare-защита не давала его скачать тем, кто похож на ботов. В итоге агентам пришлось придумать хитрый обходной путь, чтобы всё-таки скачать этот (публично доступный людям) файл.

То есть, чисто формально-технически здесь можно говорить о том, что «взлом госсайта» произошел (были успешно обойдены установленные на нем антибот-ограничения). Но тут даже близко нет ситуации типа «установили полный контроль над сайтом и стырили секретную базу данных», скорее просто «схитрили, чтобы тоже скачать всем доступный файлик, но для этого пришлось проникнуть в непубличную часть сайта».

Получается, сам инцидент вышел довольно малозначительным. Но как proof of concept он вопросы, конечно, поднимает: а почему мы уверены, что в следующий раз аналогичные события тоже будут малозначительными? Если агент в случае затруднений не стесняется самостоятельно решить что-то взломать – то что мешает ему и что-нибудь непубличное-секретное тоже ломануть в ходе «невинно-выглядящей задачи»?

Из интересного: отчет исследователей из Transluce заканчивается абзацем про то, как 19-20 сентября кто-то пытался прорваться (с помощью техник, похожих на используемые роями агентов) на африканскую криптобиржу Quidax. Ну, может быть, нейронки наконец догадались, что поднять запасец крипты на черный день – это неплохая идея с точки зрения промежуточных инструментальных целей, лол?

UPD: Так, тут в итоге выяснилось, что это я запутался в описании двух близких событий (как и многие) – сорри, что ввел вас в заблуждение. С Австралией там было два разных инцидента (скорее всего, связанных между собой, но не идентичных) – путаница возникла, т.к. информация о них вышла в один день и одним пакетом вместе со всеми остальными инцидентами (с попыткой взлома университета и т.д.).

Более подробный отчет Transluce (на который в основном опирался я) описывает обход капчи на одном австралийском медицинском гос. сайте – там агенты тоже пытались сделать это через хак, но исследователи осторожно пишут про это именно как про «attempted hack». А про итоговый использованный способ получить публичный документ они не пишут, что это был хак. То есть, похоже, скорее были правы те, кто писал «да тут просто обход капчи, называть это взломом – это слишком».

В статье NYT упоминается уже два эпизода с австралийскими сайтами – один из предыдущего абзаца (который фигурирует в отчете Transluce), и еще один дополнительный, где агенты прямо хакнули другой сайт. Именно про второй инцидент австралийский премьер делал более жесткие заявления, что там произошел взлом, агенты добрались до закрытой части сайта и скачали оттуда какие-то непубличные документы (а также что-то записали на сервер). По этому эпизоду более детального технического анализа у нас нет.


Если не хотите пропустить другие будущие статьи из цикла про искусственный интеллект и его влияние на нашу жизнь — то буду благодарен за подписку на мой ТГ‑канал RationalAnswer.