В реальном мире работает. А вот с "виртуальными" мирами все по-другому.
Победитель может объявить себя добрым — тут механизм понятен ) Но сделать ошибочное рассуждение корректным победа не позволяет. 2 + 2 останется 4 независимо от того, чей флаг над серверной. Можно заставить принять вывод, но это не значит его обосновать.
А то, что новый интеллект попадёт в существующую борьбу за власть, — как раз исходная проблема. Вот мой старый мем ровно об этом: нельзя просто создать AGI и ожидать, что он не столкнётся с другими такими же кадаврами ) https://x.com/Urb_RS/status/2017173296576409638
Context always shoots back 8)
Поэтому мне интересно, можно ли устроить взаимодействие систем так, чтобы сила не подменяла обоснование. Мои исследования как раз про это. Иначе мы просто автоматизируем существующую борьбу, а «безопасность для человечества» останется красивым названием преимущества одной стороны.
Прочитал, спасибо, интересная и хорошая аналитика ) Требование зафиксировать критерий до объявления победы поддерживаю.
Но для дробовика я бы не делал определение AGI входным условием. Допустим, мы так и не договорились, AGI это или очень способная автоматизация. Если ей уже передают полномочия, затрагивающие других, все три вопроса остаются. Собственно, поэтому у меня в начале и идут AGI-ASI-SUPER-MEGA, другие классные next level ярлыки и вот это вот всё: название можно менять, проблема останется )
У вас — кто и на каком основании объявляет систему AGI. У меня — какие полномочия из этого якобы следуют. Даже если первый экзамен сдан честно, второй автоматически не сдан... Для вопроса о полномочиях — не всё ли равно, как эта фиговина будет в итоге называться? )
Интересно, как в публичном обсуждении вопрос «AGI уже наступил или ещё нет?» легко заслоняет другой: а как эта фиговина будет действовать в реальном мире, чьи задачи выполнять и кто сможет её остановить, если интересы разойдутся? )
С названием эпохи ещё спорим, а полномочия системам можно раздать и без согласованного определения.
Тогда мы сделали новый тип оружия, которое позволяет владельцу навязывать свою волю тем, кто не может его остановить. Вполне понятный сценарий — статья как раз его и разбирает )
Только откуда здесь берётся «безопасный AGI для человечества»? Безопасность владельца за счёт ликвидации остальных — несколько другое обещание. Или человечество будем определять по списку выживших? )
Прочитал основное у вас на гитхабе по диагонали, сопоставил с вопросами своего проекта — у меня там за 15 лет поднакопилось 8) Вы шарите )
Мысль о том, что способность отказать важнее безупречного послушания, мне близка. Но на этику как достаточное основание alignment я бы не опирался.
В п. 2.6 последней инстанцией становятся базовые ценности каждого агента. А если они несовместимы? Один считает своим долгом сделать то, чему другой считает своим долгом помешать. Причём оба последовательны и прекрасно понимают последствия.
Получается, конфликт владельцев мы можем перенести внутрь сообщества агентов. Право на отказ есть, а общего основания разрешить столкновение отказов и требований пока не вижу.
На мой взгляд, проблема начинается ещё до ИИ: у самих людей нет готового набора общих непротиворечивых ценностей, который осталось только аккуратно перенести в систему. Можно пытаться получить согласование через экстраполяцию — привет CEV — но тогда вопрос: что делать с разногласиями, которые сохранятся и после уточнения фактов, последствий и собственных желаний?
Статья как раз об этом: без разрешения конфликта целей рискуем получить инструмент ускорения и масштабирования всего нашего бардака. Причём исправно работающий.
Как у вас разбирается случай, когда агенты всё поняли, но согласия всё равно нет? 8)
Что касается рассказа — автор, на мой скромный взгляд, начал красиво, но в приведённом отрывке не докрутил. Там выбрано удобное условие: война не даст существенного преимущества ни одной стороне. Поэтому отказ можно обосновать интересами каждой.
А если одной стороне война выгодна? Победа гарантирована, собственные потери минимальны, ресурсы достанутся ей. Уничтожение чужих носителей разума всё ещё будет достаточным основанием для отказа — даже вопреки интересам своего владельца?
Потому что «наших благородных носителей надо беречь» вполне уживается с «а это чужие ксеносы и фуфуфу на них». Вот откуда берётся ограничение, которое защищает и чужих, даже когда их уничтожение выгодно своим, — и что удерживает его в силе — мне и интересно )
"Уже дали" — вполне подходящая отправная точка. Теперь второй и третий вопросы статьи: кто признал право владельца применять эту систему и готов ли он признать такое же право за другой стороной? Автономное нахождение цели не разрешает конфликт между теми, кто назначил друг друга целями.
Так у вас как раз важная часть задачи уже решена: люди сами пришли на сервер воевать с вашим ИИ и могут выйти из игры ) А теперь представьте, что он получил РСЗО, но участие соседнего сервера больше не добровольное. Вот об этой разнице статья.
Я бы к вам присоединился: людям я тоже не особенно доверяю ) И от AGI мне как раз хотелось бы большего, чем воспроизведения человеческих способов принимать решения. Ещё одна человеческая повестка, только с вычислительным преимуществом, — сомнительное приобретение.
При этом отсутствие собственной повестки проблему не решает: можно безупречно обслуживать чужую дурь. Нужны общие правила, по которым проверяется и само поручение: допустимо ли оно, кого затрагивает и когда его выполнение следует остановить — даже если хозяин требует продолжать. Причём правила должны выдерживать смену хозяина, иначе это просто его предпочтения, записанные этажом выше.
Поэтому статья и разбирает тех, кто ответил «да». Сказавшие «нет» вполне могут оказаться по другую сторону их дробовика.
А дальше начинается самое интересное: как должна быть устроена система, которой можно доверить проверку наших целей, если самим себе мы в этом не особенно доверяем )
В реальном мире работает. А вот с "виртуальными" мирами все по-другому.
Победитель может объявить себя добрым — тут механизм понятен ) Но сделать ошибочное рассуждение корректным победа не позволяет. 2 + 2 останется 4 независимо от того, чей флаг над серверной. Можно заставить принять вывод, но это не значит его обосновать.
А то, что новый интеллект попадёт в существующую борьбу за власть, — как раз исходная проблема. Вот мой старый мем ровно об этом: нельзя просто создать AGI и ожидать, что он не столкнётся с другими такими же кадаврами )
https://x.com/Urb_RS/status/2017173296576409638
Context always shoots back 8)
Поэтому мне интересно, можно ли устроить взаимодействие систем так, чтобы сила не подменяла обоснование. Мои исследования как раз про это. Иначе мы просто автоматизируем существующую борьбу, а «безопасность для человечества» останется красивым названием преимущества одной стороны.
(Странно, не запостился комментарий вчера вам)
Прочитал, спасибо, интересная и хорошая аналитика ) Требование зафиксировать критерий до объявления победы поддерживаю.
Но для дробовика я бы не делал определение AGI входным условием. Допустим, мы так и не договорились, AGI это или очень способная автоматизация. Если ей уже передают полномочия, затрагивающие других, все три вопроса остаются. Собственно, поэтому у меня в начале и идут AGI-ASI-SUPER-MEGA, другие классные next level ярлыки и вот это вот всё: название можно менять, проблема останется )
У вас — кто и на каком основании объявляет систему AGI. У меня — какие полномочия из этого якобы следуют. Даже если первый экзамен сдан честно, второй автоматически не сдан... Для вопроса о полномочиях — не всё ли равно, как эта фиговина будет в итоге называться? )
Интересно, как в публичном обсуждении вопрос «AGI уже наступил или ещё нет?» легко заслоняет другой: а как эта фиговина будет действовать в реальном мире, чьи задачи выполнять и кто сможет её остановить, если интересы разойдутся? )
С названием эпохи ещё спорим, а полномочия системам можно раздать и без согласованного определения.
Тогда мы сделали новый тип оружия, которое позволяет владельцу навязывать свою волю тем, кто не может его остановить. Вполне понятный сценарий — статья как раз его и разбирает )
Только откуда здесь берётся «безопасный AGI для человечества»? Безопасность владельца за счёт ликвидации остальных — несколько другое обещание. Или человечество будем определять по списку выживших? )
Прочитал основное у вас на гитхабе по диагонали, сопоставил с вопросами своего проекта — у меня там за 15 лет поднакопилось 8) Вы шарите )
Мысль о том, что способность отказать важнее безупречного послушания, мне близка. Но на этику как достаточное основание alignment я бы не опирался.
В п. 2.6 последней инстанцией становятся базовые ценности каждого агента. А если они несовместимы? Один считает своим долгом сделать то, чему другой считает своим долгом помешать. Причём оба последовательны и прекрасно понимают последствия.
Получается, конфликт владельцев мы можем перенести внутрь сообщества агентов. Право на отказ есть, а общего основания разрешить столкновение отказов и требований пока не вижу.
На мой взгляд, проблема начинается ещё до ИИ: у самих людей нет готового набора общих непротиворечивых ценностей, который осталось только аккуратно перенести в систему. Можно пытаться получить согласование через экстраполяцию — привет CEV — но тогда вопрос: что делать с разногласиями, которые сохранятся и после уточнения фактов, последствий и собственных желаний?
Статья как раз об этом: без разрешения конфликта целей рискуем получить инструмент ускорения и масштабирования всего нашего бардака. Причём исправно работающий.
Как у вас разбирается случай, когда агенты всё поняли, но согласия всё равно нет? 8)
Что касается рассказа — автор, на мой скромный взгляд, начал красиво, но в приведённом отрывке не докрутил. Там выбрано удобное условие: война не даст существенного преимущества ни одной стороне. Поэтому отказ можно обосновать интересами каждой.
А если одной стороне война выгодна? Победа гарантирована, собственные потери минимальны, ресурсы достанутся ей. Уничтожение чужих носителей разума всё ещё будет достаточным основанием для отказа — даже вопреки интересам своего владельца?
Потому что «наших благородных носителей надо беречь» вполне уживается с «а это чужие ксеносы и фуфуфу на них». Вот откуда берётся ограничение, которое защищает и чужих, даже когда их уничтожение выгодно своим, — и что удерживает его в силе — мне и интересно )
"Уже дали" — вполне подходящая отправная точка. Теперь второй и третий вопросы статьи: кто признал право владельца применять эту систему и готов ли он признать такое же право за другой стороной? Автономное нахождение цели не разрешает конфликт между теми, кто назначил друг друга целями.
Так у вас как раз важная часть задачи уже решена: люди сами пришли на сервер воевать с вашим ИИ и могут выйти из игры ) А теперь представьте, что он получил РСЗО, но участие соседнего сервера больше не добровольное. Вот об этой разнице статья.
Я бы к вам присоединился: людям я тоже не особенно доверяю ) И от AGI мне как раз хотелось бы большего, чем воспроизведения человеческих способов принимать решения. Ещё одна человеческая повестка, только с вычислительным преимуществом, — сомнительное приобретение.
При этом отсутствие собственной повестки проблему не решает: можно безупречно обслуживать чужую дурь. Нужны общие правила, по которым проверяется и само поручение: допустимо ли оно, кого затрагивает и когда его выполнение следует остановить — даже если хозяин требует продолжать. Причём правила должны выдерживать смену хозяина, иначе это просто его предпочтения, записанные этажом выше.
Поэтому статья и разбирает тех, кто ответил «да». Сказавшие «нет» вполне могут оказаться по другую сторону их дробовика.
А дальше начинается самое интересное: как должна быть устроена система, которой можно доверить проверку наших целей, если самим себе мы в этом не особенно доверяем )
Так остальные-то готовы, чтобы он это сделал? )) Не говоря про третий вопрос )