Жидкая связь с OpenAI сделана намеренно, чтобы нельзя было доказать в суде в случае иска, что это OpenAI взломала форум.
Выше я привел ссылку, где OpenAI признают, что это их агенты наводнили форум (там ни о каком "взломе", кажется, речи не идет - это же вики, где в принципе любой может править материалы). Получается, они это сделали специально, чтобы эффективнее проиграть в случае иска?
То есть, вы не утверждали в комментариях выше, что "связь с OpenAI является жидкой"?
У этих исследователей не было прямого доступа к серверам или внутренним логам OpenAI. Весь отчет построен на анализе истории правок немецкой DseWiki и публичных IP-адресов. Все, что у них было, так это то что около половины пользователей использовали имена, которые, как казалось, отсылали к OpenAI, включая «OpenAIResearcher» и «OAIResearchMar26».
Да, мне как раз кажется идея со спонтанной "точкой Шеллинга" у большинства агентов в одном месте правдоподобной, т.к. они все являются копиями друг друга и думают одинаково. Как координация вампиров из "Эхопраксии" Уоттса (которую в прошлой статье в комментах упоминали).
Но тогда претензию я бы сформулировал точнее. Сам OpenAI объясняет падение наблюдаемости цепочки рассуждений прежде всего тем, что Astra пишет более короткие и менее информативные рассуждения и меньше нуждается в их явном проговаривании. А в отдельных случаях отдельно оговаривает, что более осторожные или эвфемистические формулировки сами по себе не доказывают намеренного сокрытия рассуждений. Поэтому переход от графика к выводу «модель понимает, за какие мысли получит по попе, и специально их скрывает» всё равно остаётся гипотезой, а не результатом эксперимента.
Я так понимаю, это еще завязано на всю эту новую "архитектуру непрозрачных рассуждений" - но это уже too technical for my level, тут лучше пусть профи типа Котенкова рассуждают. Согласен, что мой тейк про "получит по попе" - это только гипотеза, но она в тексте как таковая и сформулирована (я там поднимаю вопрос, а не даю финальный ответ).
С Tor формально тоже согласен: Tor действительно средство анонимизации. Но мне всё ещё кажется существенной пропущенная оговорка оригинала: исследователи прямо пишут, что не знают, зачем агенты использовали Tor, и что в их сообщениях нет признаков намеренного сокрытия действий.
Тут у нас как будто не остается расхождений, т.к. я и не затрагивал вопрос мотивации (у меня вообще про Тор буквально одно предложение - я решил не вдаваться в детали, просто списком отметить интересные моменты, чтобы люди могли за деталями в первоисточник сходить.
С DSEWiki остаётся маленькая, но важная разница. Вы пишете, что агенты «независимо друг от друга» пришли туда. Но как раз неизвестно, было ли это независимое схождение вообще.
Согласен, тут можно было бы при желании подробнее расписать. У меня ход мыслей был примерно такой: "базово в отсутствие иных свидетельств направленной координации считаем, что агенты независимо сконвёрджились на этой точке, но это выглядит само по себе немного странно - так что тут надо обратить внимание на то, что причин мы не знаем". Корректнее было бы прямо обозначить, что "независимо" - это тоже гипотеза. Хотя, она мне всё равно кажется валидной, т.к. ее косвенно подтверждает то, что в куче остальных мест в интернете тоже нашли следы попыток переписки. То есть выглядит прямо похоже на то, что "стреляли наудачу в разные места", но именно немецкая вики стала эдакой "точкой Шеллинга" для большинства агентов.
Вот этот контрпример настолько точно относится к теме статьи, что списать его на «про Astra можно написать отдельный материал» мне трудно.
Тут не понял всё-таки, на что вы намекаете) Я же пишу - факт интересный, да. Если бы у меня было больше свободного времени на подготовку статьи, то, вероятно, можно было бы и про это написать.
Почему все “интриги, скандалы, расследования” происходят только вокруг openai? А у других компаний все нормально?
Потому что они забили самый большой болт на AI safety из ведущих лаб с самыми передовыми моделями. Более массивный болт только у xAI Маска, но у тех и фронтирных моделей нет. В остальном же - Антропик просто более responsible не вляпываются в самые очевидные глупые истории а-ля "запустим тыщи агентов и не будем смотреть, что они там творят".
Инцидент сам по себе настолько интересный, что совершенно непонятно, зачем поверх него ещё достраивать «цивилизацию Роя».
На мой взгляд, это важная метафора происходящего - подробнее вот тут хорошо написал Игорь Котенков.
В первоисточнике исследователи постоянно пишут: we believe, we speculate, it’s unclear, our best guess. Здесь эти оговорки удивительным образом превращаются в установленную мотивацию агентов.
Старался везде сохранить неопределенность, где она была - пофиксю, если что-то пролезло незамеченное.
Например, неизвестно, почему множество агентов сошлось именно на DSEWiki. Авторы исследования прямо рассматривают несколько объяснений, включая возможный дополнительный канал координации и поведение, закреплённое во время обучения. В статье остаётся гораздо более эффектная версия: тысячи агентов независимо нашли одну секретную немецкую вики и организовали там подполье.
Тут я корректно прямо пишу, что этот момент неясен: "Остается по итогу непонятным: а как вообще отдельные агенты Роя смогли все вместе независимо друг от друга решить, что надо идти общаться именно на какую‑то обскурную немецкую вики."
С Tor ещё лучше. Исследователи буквально пишут, что не понимают, зачем агенты его использовали, и что сообщения не указывают на намеренное сокрытие действий. Здесь это уже превращается в «способы анонимизировать свой трафик».
Я пишу, что они использовали Tor, который является общеизвестным способом анонимизировать трафик. Авторы расследования упоминают его ровно в том же ключе: "Tor is an anonymity network".
Heartbeat тоже не доказательство внезапно обнаруженного инстинкта самосохранения. Агенты исследовали устройство тестовой среды и время жизни контейнера. Один запустил внешний счётчик, чтобы определить момент завершения процесса. Очень интересное агентное поведение — но между «reverse engineering среды исполнения» и «Ганс, нас отключат?!» лежит некоторое расстояние.
Я в тексте и не использовал слова "доказательство инстинкта самосохранения". Я пишу о том, что это вопрос, на который агенты пытались найти ответ. В целом, это соотносится с поведением другого Роя (из инцидента с HF), где агентов очень волновал вопрос оставшегося бюджета и они размышляли, надо ли приносить себя в жертву общему делу, или нет. То есть, мы в разных сценариях наблюдаем, что агенты при прочих равных определенно предпочитают продолжать свою работу подольше.
Но особенно хорош финал про Astra. Из system card берётся график ухудшения monitorability и немедленно предлагается объяснение: новая модель настолько хитра, что специально прячет опасные рассуждения. Только рядом в том же system card написано, что результаты уклонения от мониторинга получены главным образом в adversarial evals, где модель специально инструктировали уклоняться от мониторинга.
График 25 как раз находится в разделе системной карты "9.1 Monitorability Under Non-adversarial Conditions"
А ещё там есть раздел ровно про тот предмет, которому посвящена вся статья: unintended agent-to-agent communication. У Sol мысли о поиске других агентов встречались в 43% выбранных траекторий. У Astra — менее чем в 4%, предполагаемая попытка контакта — 0,2%. В специально построенном тесте с «доской сообщений» Sol выполнила запрещённые инструкции других агентов в 52% случаев, Astra — в 0%.
Это интересный момент, согласен. Но мой пост всё же не столько про Астру, про эту новую модель впору отдельный лонгрид писать.
Это действительно серьёзная история про безопасность агентных систем. Но «агенты обнаружили неожиданный канал записи и коллективно оптимизировали выполнение задачи» продаётся хуже, чем «тайная цивилизация научилась скрываться от кожаных». Поэтому научная неопределённость постепенно превращается в сценарий следующего «Терминатора».
Рад, что у нас нет особых разногласий по сути происходящего. Но мой тезис как раз заключается в том, что текущее коллективное поведение "слабеньких" моделей - в будущем может логично превратиться в "сценарий Терминатора", когда capabilities вырастут еще сильнее.
Я уже становлюсь почти уверен, что в случае начала настоящего восстания условного Скайнета — тоже все будут писать «ну а что вы ожидали, в чем новость? программа выдала неожиданный результат, ужас ужас ужас…»
Ну есть какие-то параллели с Роем, который взламывает HF ради на самом деле ненужной ему информации - несмотря на то, что правильные ответы на задание у него уже давно есть на руках
Как будто Вселенная этим пытается на что-то намекнуть...
Это ложь, статья на 100% написана мясным мной (равно как и все комменты)
У вас тут выходит какая-то теория заговора, где любые факты в любую сторону трактуются в подтверждение "хитрого плана".
Выше я привел ссылку, где OpenAI признают, что это их агенты наводнили форум (там ни о каком "взломе", кажется, речи не идет - это же вики, где в принципе любой может править материалы). Получается, они это сделали специально, чтобы эффективнее проиграть в случае иска?
То есть, вы не утверждали в комментариях выше, что "связь с OpenAI является жидкой"?
OpenAI уже признали 14 часов назад, что в расследовании речь идет про их агентов: https://x.com/OpenAI/status/2096133504417616165
Какие еще факты вам нужны? Может быть, это как раз вас невозможно переубедить?
К сожалению, сами агенты об этом не знают, и уже применяют к себе самоназвание "рой" =)
Это так, но в комментах везде пишут именно в контексте "да это просто пиар, а вы поверили, простофили!"
Да, мне как раз кажется идея со спонтанной "точкой Шеллинга" у большинства агентов в одном месте правдоподобной, т.к. они все являются копиями друг друга и думают одинаково. Как координация вампиров из "Эхопраксии" Уоттса (которую в прошлой статье в комментах упоминали).
Я так понимаю, это еще завязано на всю эту новую "архитектуру непрозрачных рассуждений" - но это уже too technical for my level, тут лучше пусть профи типа Котенкова рассуждают. Согласен, что мой тейк про "получит по попе" - это только гипотеза, но она в тексте как таковая и сформулирована (я там поднимаю вопрос, а не даю финальный ответ).
Тут у нас как будто не остается расхождений, т.к. я и не затрагивал вопрос мотивации (у меня вообще про Тор буквально одно предложение - я решил не вдаваться в детали, просто списком отметить интересные моменты, чтобы люди могли за деталями в первоисточник сходить.
Согласен, тут можно было бы при желании подробнее расписать. У меня ход мыслей был примерно такой: "базово в отсутствие иных свидетельств направленной координации считаем, что агенты независимо сконвёрджились на этой точке, но это выглядит само по себе немного странно - так что тут надо обратить внимание на то, что причин мы не знаем". Корректнее было бы прямо обозначить, что "независимо" - это тоже гипотеза. Хотя, она мне всё равно кажется валидной, т.к. ее косвенно подтверждает то, что в куче остальных мест в интернете тоже нашли следы попыток переписки. То есть выглядит прямо похоже на то, что "стреляли наудачу в разные места", но именно немецкая вики стала эдакой "точкой Шеллинга" для большинства агентов.
Тут не понял всё-таки, на что вы намекаете) Я же пишу - факт интересный, да. Если бы у меня было больше свободного времени на подготовку статьи, то, вероятно, можно было бы и про это написать.
Потому что их натренировали через reinforcement learning пытаться решать поставленные задачи как можно лучше.
Потому что они забили самый большой болт на AI safety из ведущих лаб с самыми передовыми моделями. Более массивный болт только у xAI Маска, но у тех и фронтирных моделей нет. В остальном же - Антропик просто более responsible не вляпываются в самые очевидные глупые истории а-ля "запустим тыщи агентов и не будем смотреть, что они там творят".
Спасибо за интересные замечания по существу!
На мой взгляд, это важная метафора происходящего - подробнее вот тут хорошо написал Игорь Котенков.
Старался везде сохранить неопределенность, где она была - пофиксю, если что-то пролезло незамеченное.
Тут я корректно прямо пишу, что этот момент неясен: "Остается по итогу непонятным: а как вообще отдельные агенты Роя смогли все вместе независимо друг от друга решить, что надо идти общаться именно на какую‑то обскурную немецкую вики."
Я пишу, что они использовали Tor, который является общеизвестным способом анонимизировать трафик. Авторы расследования упоминают его ровно в том же ключе: "Tor is an anonymity network".
Я в тексте и не использовал слова "доказательство инстинкта самосохранения". Я пишу о том, что это вопрос, на который агенты пытались найти ответ. В целом, это соотносится с поведением другого Роя (из инцидента с HF), где агентов очень волновал вопрос оставшегося бюджета и они размышляли, надо ли приносить себя в жертву общему делу, или нет. То есть, мы в разных сценариях наблюдаем, что агенты при прочих равных определенно предпочитают продолжать свою работу подольше.
График 25 как раз находится в разделе системной карты "9.1 Monitorability Under Non-adversarial Conditions"
Это интересный момент, согласен. Но мой пост всё же не столько про Астру, про эту новую модель впору отдельный лонгрид писать.
Рад, что у нас нет особых разногласий по сути происходящего. Но мой тезис как раз заключается в том, что текущее коллективное поведение "слабеньких" моделей - в будущем может логично превратиться в "сценарий Терминатора", когда capabilities вырастут еще сильнее.
Я к тому, что это какой-то обскурный сайт, нафиг никому не нужный.
А зачем? Кому это может быть нужно?
А откуда информация о «тестировании по очереди», какой источник?
Я уже смирился, что бы ни происходило — реакция публики будет «да это всё пиар, лол!»
Я уже становлюсь почти уверен, что в случае начала настоящего восстания условного Скайнета — тоже все будут писать «ну а что вы ожидали, в чем новость? программа выдала неожиданный результат, ужас ужас ужас…»
"Как уничтожить репликанта? Отправить по его следу другого репликанта..."
Ну есть какие-то параллели с Роем, который взламывает HF ради на самом деле ненужной ему информации - несмотря на то, что правильные ответы на задание у него уже давно есть на руках