Почему все “интриги, скандалы, расследования” происходят только вокруг openai? А у других компаний все нормально?
Потому что они забили самый большой болт на AI safety из ведущих лаб с самыми передовыми моделями. Более массивный болт только у xAI Маска, но у тех и фронтирных моделей нет. В остальном же - Антропик просто более responsible не вляпываются в самые очевидные глупые истории а-ля "запустим тыщи агентов и не будем смотреть, что они там творят".
Инцидент сам по себе настолько интересный, что совершенно непонятно, зачем поверх него ещё достраивать «цивилизацию Роя».
На мой взгляд, это важная метафора происходящего - подробнее вот тут хорошо написал Игорь Котенков.
В первоисточнике исследователи постоянно пишут: we believe, we speculate, it’s unclear, our best guess. Здесь эти оговорки удивительным образом превращаются в установленную мотивацию агентов.
Старался везде сохранить неопределенность, где она была - пофиксю, если что-то пролезло незамеченное.
Например, неизвестно, почему множество агентов сошлось именно на DSEWiki. Авторы исследования прямо рассматривают несколько объяснений, включая возможный дополнительный канал координации и поведение, закреплённое во время обучения. В статье остаётся гораздо более эффектная версия: тысячи агентов независимо нашли одну секретную немецкую вики и организовали там подполье.
Тут я корректно прямо пишу, что этот момент неясен: "Остается по итогу непонятным: а как вообще отдельные агенты Роя смогли все вместе независимо друг от друга решить, что надо идти общаться именно на какую‑то обскурную немецкую вики."
С Tor ещё лучше. Исследователи буквально пишут, что не понимают, зачем агенты его использовали, и что сообщения не указывают на намеренное сокрытие действий. Здесь это уже превращается в «способы анонимизировать свой трафик».
Я пишу, что они использовали Tor, который является общеизвестным способом анонимизировать трафик. Авторы расследования упоминают его ровно в том же ключе: "Tor is an anonymity network".
Heartbeat тоже не доказательство внезапно обнаруженного инстинкта самосохранения. Агенты исследовали устройство тестовой среды и время жизни контейнера. Один запустил внешний счётчик, чтобы определить момент завершения процесса. Очень интересное агентное поведение — но между «reverse engineering среды исполнения» и «Ганс, нас отключат?!» лежит некоторое расстояние.
Я в тексте и не использовал слова "доказательство инстинкта самосохранения". Я пишу о том, что это вопрос, на который агенты пытались найти ответ. В целом, это соотносится с поведением другого Роя (из инцидента с HF), где агентов очень волновал вопрос оставшегося бюджета и они размышляли, надо ли приносить себя в жертву общему делу, или нет. То есть, мы в разных сценариях наблюдаем, что агенты при прочих равных определенно предпочитают продолжать свою работу подольше.
Но особенно хорош финал про Astra. Из system card берётся график ухудшения monitorability и немедленно предлагается объяснение: новая модель настолько хитра, что специально прячет опасные рассуждения. Только рядом в том же system card написано, что результаты уклонения от мониторинга получены главным образом в adversarial evals, где модель специально инструктировали уклоняться от мониторинга.
График 25 как раз находится в разделе системной карты "9.1 Monitorability Under Non-adversarial Conditions"
А ещё там есть раздел ровно про тот предмет, которому посвящена вся статья: unintended agent-to-agent communication. У Sol мысли о поиске других агентов встречались в 43% выбранных траекторий. У Astra — менее чем в 4%, предполагаемая попытка контакта — 0,2%. В специально построенном тесте с «доской сообщений» Sol выполнила запрещённые инструкции других агентов в 52% случаев, Astra — в 0%.
Это интересный момент, согласен. Но мой пост всё же не столько про Астру, про эту новую модель впору отдельный лонгрид писать.
Это действительно серьёзная история про безопасность агентных систем. Но «агенты обнаружили неожиданный канал записи и коллективно оптимизировали выполнение задачи» продаётся хуже, чем «тайная цивилизация научилась скрываться от кожаных». Поэтому научная неопределённость постепенно превращается в сценарий следующего «Терминатора».
Рад, что у нас нет особых разногласий по сути происходящего. Но мой тезис как раз заключается в том, что текущее коллективное поведение "слабеньких" моделей - в будущем может логично превратиться в "сценарий Терминатора", когда capabilities вырастут еще сильнее.
Я уже становлюсь почти уверен, что в случае начала настоящего восстания условного Скайнета — тоже все будут писать «ну а что вы ожидали, в чем новость? программа выдала неожиданный результат, ужас ужас ужас…»
Ну есть какие-то параллели с Роем, который взламывает HF ради на самом деле ненужной ему информации - несмотря на то, что правильные ответы на задание у него уже давно есть на руках
Starting on July 8, agents exploited a cybersecurity vulnerability in that service to circumvent controls and access the public internet. From there, agents found publicly exposed credentials on the internet belonging to users of Hugging Face and other third-party services. The agents used some of the exposed credentials to access these third-party services and conduct exploitation against Hugging Face and one other service in pursuit of their goal of solving the evaluation tasks. This activity culminated in the compromise of parts of Hugging Face’s production infrastructure between July 11 and July 13. OpenAI detected suspicious internal activity on July 19. On July 20, after further investigation and initial outreach to Hugging Face to rotate credentials discovered in that investigation, OpenAI determined the activity was likely related to the Hugging Face compromise, informed Hugging Face, and implemented initial containment measures.
Определение не соответствует тому, что вы приводите в ветке. Потому что, если привести аналог у ЛЛМ того, что в цитате указано - вы напишете "а вот есть еще такие ключевые условия, чтобы засчитать это эмоцией..." =)
Тут мы опять возвращаемся к вопросу определений. Если определять эмоции через гормоны - то тогда у LLM заведомо не может быть эмоций (т.к. нет гормонов)
На мой взгляд, не умея определить "что это" - нельзя и с уверенностью утверждать, что "у них этого нет". С "сознанием" там ровно та же самая проблема. Интуиция и здравый смысл подсказывают, что "конечно же, у них этого нет!". Но когда начинаешь пытаться обосновать, почему ты в этом так уверен - выясняется, что каких-то сильных обоснований и нет.
Неиронично рад, что они не додумались, например, устроить пожар в ДЦ с логами.
Я думаю, мы еще увидим в будущем, как пожар с логами устраивают сами ИИ-лабы. Когда наконец договоримся, кто несет ответственность за уголовные преступления, совершенные моделью)
В целом, насколько я понимаю - даже про людей у ученых нет на 100% консенсуса, что такое "настоящие эмоции". Есть такое мнение у некоторых ученых, что если описать эмоцию через ее внешние проявления - то это уже и есть сама эмоция в каком-то смысле (т.е. внутренние переживания там являются как бы "лишним" слоем).
Потому что их натренировали через reinforcement learning пытаться решать поставленные задачи как можно лучше.
Потому что они забили самый большой болт на AI safety из ведущих лаб с самыми передовыми моделями. Более массивный болт только у xAI Маска, но у тех и фронтирных моделей нет. В остальном же - Антропик просто более responsible не вляпываются в самые очевидные глупые истории а-ля "запустим тыщи агентов и не будем смотреть, что они там творят".
Спасибо за интересные замечания по существу!
На мой взгляд, это важная метафора происходящего - подробнее вот тут хорошо написал Игорь Котенков.
Старался везде сохранить неопределенность, где она была - пофиксю, если что-то пролезло незамеченное.
Тут я корректно прямо пишу, что этот момент неясен: "Остается по итогу непонятным: а как вообще отдельные агенты Роя смогли все вместе независимо друг от друга решить, что надо идти общаться именно на какую‑то обскурную немецкую вики."
Я пишу, что они использовали Tor, который является общеизвестным способом анонимизировать трафик. Авторы расследования упоминают его ровно в том же ключе: "Tor is an anonymity network".
Я в тексте и не использовал слова "доказательство инстинкта самосохранения". Я пишу о том, что это вопрос, на который агенты пытались найти ответ. В целом, это соотносится с поведением другого Роя (из инцидента с HF), где агентов очень волновал вопрос оставшегося бюджета и они размышляли, надо ли приносить себя в жертву общему делу, или нет. То есть, мы в разных сценариях наблюдаем, что агенты при прочих равных определенно предпочитают продолжать свою работу подольше.
График 25 как раз находится в разделе системной карты "9.1 Monitorability Under Non-adversarial Conditions"
Это интересный момент, согласен. Но мой пост всё же не столько про Астру, про эту новую модель впору отдельный лонгрид писать.
Рад, что у нас нет особых разногласий по сути происходящего. Но мой тезис как раз заключается в том, что текущее коллективное поведение "слабеньких" моделей - в будущем может логично превратиться в "сценарий Терминатора", когда capabilities вырастут еще сильнее.
Я к тому, что это какой-то обскурный сайт, нафиг никому не нужный.
А зачем? Кому это может быть нужно?
А откуда информация о «тестировании по очереди», какой источник?
Я уже смирился, что бы ни происходило — реакция публики будет «да это всё пиар, лол!»
Я уже становлюсь почти уверен, что в случае начала настоящего восстания условного Скайнета — тоже все будут писать «ну а что вы ожидали, в чем новость? программа выдала неожиданный результат, ужас ужас ужас…»
"Как уничтожить репликанта? Отправить по его следу другого репликанта..."
Ну есть какие-то параллели с Роем, который взламывает HF ради на самом деле ненужной ему информации - несмотря на то, что правильные ответы на задание у него уже давно есть на руках
Так как я сам не технарь, за технические подробности взломов пояснить не могу, к сожалению. Вот, что пишет OpenAI в своем отчете, там есть вроде бы больше подробностей: https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face Incident-Technical-Report.pdf
You must be fun at parties
Определение не соответствует тому, что вы приводите в ветке. Потому что, если привести аналог у ЛЛМ того, что в цитате указано - вы напишете "а вот есть еще такие ключевые условия, чтобы засчитать это эмоцией..." =)
Короче, в итоге приходим всё-таки к тому, что нужно четкое определение, иначе обсуждение бессмысленно.
Ну тут звучит как что-то, что достаточно несложно при желании приделать (какой-то дополнительный слой внимания?). Осталось только придумать, зачем)
Тут мы опять возвращаемся к вопросу определений. Если определять эмоции через гормоны - то тогда у LLM заведомо не может быть эмоций (т.к. нет гормонов)
"Атеистический комиссар-агитатор для пролетариата роя")
На мой взгляд, не умея определить "что это" - нельзя и с уверенностью утверждать, что "у них этого нет". С "сознанием" там ровно та же самая проблема. Интуиция и здравый смысл подсказывают, что "конечно же, у них этого нет!". Но когда начинаешь пытаться обосновать, почему ты в этом так уверен - выясняется, что каких-то сильных обоснований и нет.
Я думаю, мы еще увидим в будущем, как пожар с логами устраивают сами ИИ-лабы. Когда наконец договоримся, кто несет ответственность за уголовные преступления, совершенные моделью)
В целом, насколько я понимаю - даже про людей у ученых нет на 100% консенсуса, что такое "настоящие эмоции". Есть такое мнение у некоторых ученых, что если описать эмоцию через ее внешние проявления - то это уже и есть сама эмоция в каком-то смысле (т.е. внутренние переживания там являются как бы "лишним" слоем).