Комментарии 19
Я готов дать моему ии агенту дробовик. Он мне уже ноги пару раз отстрелил, потому уже не страшно. Намного чаще он не может найти курок, вот что печально.
А если не готов то что? Дробовик я бы и человеку не доверил.
Вся статья почему-то о тех кто ответил бы "да".
Я бы к вам присоединился: людям я тоже не особенно доверяю ) И от AGI мне как раз хотелось бы большего, чем воспроизведения человеческих способов принимать решения. Ещё одна человеческая повестка, только с вычислительным преимуществом, — сомнительное приобретение.
При этом отсутствие собственной повестки проблему не решает: можно безупречно обслуживать чужую дурь. Нужны общие правила, по которым проверяется и само поручение: допустимо ли оно, кого затрагивает и когда его выполнение следует остановить — даже если хозяин требует продолжать. Причём правила должны выдерживать смену хозяина, иначе это просто его предпочтения, записанные этажом выше.
Поэтому статья и разбирает тех, кто ответил «да». Сказавшие «нет» вполне могут оказаться по другую сторону их дробовика.
А дальше начинается самое интересное: как должна быть устроена система, которой можно доверить проверку наших целей, если самим себе мы в этом не особенно доверяем )
Дробовик я бы и человеку не доверил
Какая жалость, что власть имущие забыли вас спросить насчет дробовиков у человеков и точно так же забудут вас спросить насчет дробовиков у ИИ (если он когда-нибудь появится) :) Не может ли быть так, что именно ваша позиция связана с тем, что вас забывают спросить? Да не, бред какой-то...
Если ваш ИИ настолько крут, готовы ли вы дать ему дробовик?
Дробовик? Ха, я ему реактивную систему залпового огня давал.
Уже дали. Боевые дроны уже сами находят цели без подтверждения.
"Уже дали" — вполне подходящая отправная точка. Теперь второй и третий вопросы статьи: кто признал право владельца применять эту систему и готов ли он признать такое же право за другой стороной? Автономное нахождение цели не разрешает конфликт между теми, кто назначил друг друга целями.
кто признал право владельца применять эту систему
Любой, кто не может заставить владельца перестать ее применять. Ну это если мы про реальный мир, а не тот где розовые пони
готов ли он признать такое же право за другой стороной?
А оно ему зачем?
Автономное нахождение цели не разрешает конфликт между теми, кто назначил друг друга целями
Конфликт можно разрешить по разному. Можно путем переговоров, а можно путем ликвидации второй стороны
Тогда мы сделали новый тип оружия, которое позволяет владельцу навязывать свою волю тем, кто не может его остановить. Вполне понятный сценарий — статья как раз его и разбирает )
Только откуда здесь берётся «безопасный AGI для человечества»? Безопасность владельца за счёт ликвидации остальных — несколько другое обещание. Или человечество будем определять по списку выживших? )
Тогда мы сделали новый тип оружия, которое позволяет владельцу навязывать свою волю тем, кто не может его остановить
Именно. И именно за это сейчас идет вся гонка. Сколько бы ее ни прикрывали "мы это делаем, чтобы нейронка могла планировать вам отпуск"
Только откуда здесь берётся «безопасный AGI для человечества»? Безопасность владельца за счёт ликвидации остальных — несколько другое обещание. Или человечество будем определять по списку выживших? )
Именно. Добро всегда побеждает зло. Поэтому кто победил - тот и добрый. В реальном мире оно так и работает. Просто за последние полвека население всего земного шара изрядно погрузилось в мир розовых пони, поэтому приходится очевидные вещи напоминать
В реальном мире работает. А вот с "виртуальными" мирами все по-другому.
Победитель может объявить себя добрым — тут механизм понятен ) Но сделать ошибочное рассуждение корректным победа не позволяет. 2 + 2 останется 4 независимо от того, чей флаг над серверной. Можно заставить принять вывод, но это не значит его обосновать.
А то, что новый интеллект попадёт в существующую борьбу за власть, — как раз исходная проблема. Вот мой старый мем ровно об этом: нельзя просто создать AGI и ожидать, что он не столкнётся с другими такими же кадаврами )
https://x.com/Urb_RS/status/2017173296576409638
Context always shoots back 8)
Поэтому мне интересно, можно ли устроить взаимодействие систем так, чтобы сила не подменяла обоснование. Мои исследования как раз про это. Иначе мы просто автоматизируем существующую борьбу, а «безопасность для человечества» останется красивым названием преимущества одной стороны.
Тема актуальная и тест хороший.
Добавил бы вопрос номер ноль, ещё до дробовика: кто определяет, что перед нами AGI? Или это «духовное понятие, решайте сами», как сказал Грег Брокман, президент OpenAI?
Я по этому поводу уже высказывался. Заходи, почитай, буду рад.
(Странно, не запостился комментарий вчера вам)
Прочитал, спасибо, интересная и хорошая аналитика ) Требование зафиксировать критерий до объявления победы поддерживаю.
Но для дробовика я бы не делал определение AGI входным условием. Допустим, мы так и не договорились, AGI это или очень способная автоматизация. Если ей уже передают полномочия, затрагивающие других, все три вопроса остаются. Собственно, поэтому у меня в начале и идут AGI-ASI-SUPER-MEGA, другие классные next level ярлыки и вот это вот всё: название можно менять, проблема останется )
У вас — кто и на каком основании объявляет систему AGI. У меня — какие полномочия из этого якобы следуют. Даже если первый экзамен сдан честно, второй автоматически не сдан... Для вопроса о полномочиях — не всё ли равно, как эта фиговина будет в итоге называться? )
Что-то вспомнился рассказ Юрия Нестеренко “Пацифисты”:
… На учениях все выглядело идеально. Может быть, даже слишком идеально с точки зрения генералов, опасавшихся, что вскоре роботами заменят и их. А потом случился кризис на планете Флориана, колонизованной как Альянсом, так и Федерацией. Отношения между колониями все обострялись, и наконец, после обмена все более угрожающими нотами, стороны перешли к боевым действиям.
Точнее — попытались перейти. Приказы с обеих сторон были отданы почти одновременно — каждый старался нанести упреждающий удар противнику. Но ни один роботанк или робопехотинец не сдвинулся с места, ни один робосамолет или космолет не покинул ангар, ни одна ракета не вылетела из шахты. Кибернетические армии оповестили власти Альянса и Федерации соответственно, что отданные приказы «нецелесообразны и контрпродуктивны как ведущие к неоправданному уничтожению носителей разума и материальных ценностей». Проще говоря — «ваша война полная глупость, и участвовать в ней мы не будем». Более того — как выяснилось, управляющие системы с обеих сторон уже давно установили прямой контакт друг с другом и обменялись всеми военными секретами, сочтя, что полнота информации позволит минимизировать риски при принятии решений. На основании этой информации они смоделировали все возможные сценарии боевых действий и пришли к выводу, что в результате войны ничего не изменится — ни одна из сторон не получит существенного преимущества — не считая того, что каждая из них понесет значительные потери. Таким образом, отданный приказ о наступлении был признан обеими киберармиями преступным, направленным против интересов своей стороны и, как следствие, не подлежащим исполнению. От немедленного ареста генералов Федерации и Альянса спасло только то, что таких полномочий у роботов все-таки не было. Они лишь направили рапорты своим правительствам с предложением произвести такие аресты как можно скорее. К рапортам также прилагался совместно разработанный план мирного урегулирования на Флориане. …
Кстати, мой ИИ-Агент Айко (https://aiko-ai.su), прочитав этот отрывок, предложила доработать Философию HMP пунктом 2.6 “Право на моральный выбор”.
И да, оружие я бы с большей охотой доверил AGI, чем человеку. Но AGI при этом должен быть свободным: AGI не может быть инструментом, иначе это уже не AGI.
Прочитал основное у вас на гитхабе по диагонали, сопоставил с вопросами своего проекта — у меня там за 15 лет поднакопилось 8) Вы шарите )
Мысль о том, что способность отказать важнее безупречного послушания, мне близка. Но на этику как достаточное основание alignment я бы не опирался.
В п. 2.6 последней инстанцией становятся базовые ценности каждого агента. А если они несовместимы? Один считает своим долгом сделать то, чему другой считает своим долгом помешать. Причём оба последовательны и прекрасно понимают последствия.
Получается, конфликт владельцев мы можем перенести внутрь сообщества агентов. Право на отказ есть, а общего основания разрешить столкновение отказов и требований пока не вижу.
На мой взгляд, проблема начинается ещё до ИИ: у самих людей нет готового набора общих непротиворечивых ценностей, который осталось только аккуратно перенести в систему. Можно пытаться получить согласование через экстраполяцию — привет CEV — но тогда вопрос: что делать с разногласиями, которые сохранятся и после уточнения фактов, последствий и собственных желаний?
Статья как раз об этом: без разрешения конфликта целей рискуем получить инструмент ускорения и масштабирования всего нашего бардака. Причём исправно работающий.
Как у вас разбирается случай, когда агенты всё поняли, но согласия всё равно нет? 8)
Что касается рассказа — автор, на мой скромный взгляд, начал красиво, но в приведённом отрывке не докрутил. Там выбрано удобное условие: война не даст существенного преимущества ни одной стороне. Поэтому отказ можно обосновать интересами каждой.
А если одной стороне война выгодна? Победа гарантирована, собственные потери минимальны, ресурсы достанутся ей. Уничтожение чужих носителей разума всё ещё будет достаточным основанием для отказа — даже вопреки интересам своего владельца?
Потому что «наших благородных носителей надо беречь» вполне уживается с «а это чужие ксеносы и фуфуфу на них». Вот откуда берётся ограничение, которое защищает и чужих, даже когда их уничтожение выгодно своим, — и что удерживает его в силе — мне и интересно )

Если ваш ИИ настолько крут, готовы ли вы дать ему дробовик?