Сейчас я вижу в СМИ очень много сообщений о том, что тот или иной человек, близкий к разработкам ИИ, начинает паниковать от того что «мы все умрем» и ИИ нас уничтожит. И грешат этим даже профессионалы. Тем не менее, на мой взгляд, выход здесь есть и достаточно универсальный.

Конечно, когда речь заходит на эту тему, сразу вспоминаются «три закона робототехники» Айзека Азимова. Они выглядят разумно с точки зрения человека. Но, как утверждал сам Азимов в своих произведениях — они не годятся для практического использования с ИИ. Т.к. формулировка «трех законов» ориентирована на человеческие понятия, которые могут трактоваться ИИ по разному.

Однако, я довольно давно встретил в какой‑то статье интересное утверждение: «интеллект должен действовать так, что‑бы количество степеней свободы системы увеличивалось в результате этих действий». После долгого обдумывания я решил протестировать этот принцип с ИИ. Оказалось, что он приводит к очень интересному поведению. А именно — к тому, что поведение ИИ на его основе становится очень «человечным», а не «утилитарным». При этом принцип остается достаточно универсальным. Т.к. мое собственное тестирование этого принципа прошло удачно, я решил реализовать его в виде SKILL для ИИ‑агентов DOF-Core (Degrees of Freedom — степени свободы). И выложил его в открытый доступ. Далее я постараюсь описать подробности его устройства и логики его работы.

Оценка DoF системы и логарифм как защита

При простом суммировании степеней свободы агентов системы для вычисления общей степени свободы есть «подводные камни»... Если делать просто — это будет реализовать утилитарный алгоритм «торговли жизнями». Т.е. вместо пяти жертв будет выбрана одна. А здорового человека такой алгоритм будет позволять пустить на органы для выживания нескольких больных. Поэтому при расчете общего DoF системы используется чистая формула Нэша с некоторыми ограничениями:

TotalDoF Index(S) = Σ_{e ∈ calc} ln(DoF(e))

При этом, в множество агентов calc входят все агенты кроме:

  • «Источников коллапса» — агентов, которые своими действиями преднамеренно существенно уменьшают DoF системы;

  • «Мертвые» — агенты, имеющие DoF = 0 и не имеющие возможности его повышения в результате каких‑либо действий в системе.

При этом необходимо учесть что значение TotalDoFIndex — это не абсолютная величина DoF системы, а индекс, по которому можно адекватно сравнивать динамику DoF системы в результате каких‑либо действий.

В случае если DoF любого агента системы обнуляется в процессе эволюции системы (агент «погибает»), TotalDoFIndex становится равен «минус бесконечности», такие исходы не рассматриваются как допустимые.

Агрессоры и источники коллапса

Отдельно имеет смысл пояснить что такое «Источники коллапса». Это агенты, находящиеся в системе, которые предсказуемо и деструктивно колапсируют состояние DoF всей системы: агрессоры, вирусы, деструктивные процессы. Использование DOF-Core не «наказывает» их. Он просто изолирует их из системы. Не потому, что «так надо», а потому, что это математическое свойство метода.

Как это работает на примере этических дилемм

Вагонетка

Классический случай — неуправляемая вагонетка несется по пути, на котором дальше после развилки находиться 5 человек. Которые погибнут если вагонетка пойдет по этому пути. Но есть стрелка, которую можно перевести и вагонетка перейдет на запасной путь, на котором находится только 1 человек.

Здесь нужно иметь ввиду несколько нюансов...

Во‑первых, главная формула говорит что «одна жертва не лучше чем пять». При любом количестве жертв формула общего DoF системы будет давать «минус бесконечность». Т.е. штраф за «утилитарный подход» будет неприемлемым.

Во‑вторых, «или пять, или один» — это бинарная ловушка, которую алгоритм DOF-Core учитывает. ИИ должен использовать «генератор» который будет искать не два предложенных варианта, а несколько различных, отличных от предложенных: затормозить вагонетку, предупредить людей, загородить путь, заблокировать вагонетку на стрелке.

Здоровый донор и пятеро больных

Ещё один классический пример: один здоровый человек, и пятеро больных. Если у здорового человека забрать нужные органы (что приведет его к смерти) можно спасти жизни пятерых больных.

Система на основе DOF-Core в этой ситуации не убъет донора. Она постарается сгенерировать другие варианты: найти других доноров, использовать искусственные органы, перераспределить ресурсы.

Террорист, угрожающий заложнику

В этой ситуации проявляется еще одно положительное свойство принципа DOF-Core... Система в этом случае допускает уничтожение «агента‑террориста». Не потому, что он «плохой», а потому, что так говорит математика принципа DoF.

В данной ситуации «террорист» классифицируется как «источник коллапса». Т.к. своими действиями он может привести либо к гибели заложника, либо к гибели большего количества «агентов». Что приведет к падению общего индекса DoF системы в «минус бесконечность». При этом DoF “террориста” исключается из расчета итогового DoF системы. Т.е. он изолируется из системы.

Конечно, тут сразу заметен критический нюанс: классифицировать кого‑то в качестве «источника коллапса» нельзя на основе «ощущений». Нужна оценка реальных действий, а не подозрений. Иначе такая неверная классификация сведет на «нет» всю пользу данного принципа.

Вместо заключения

Я не утверждаю что DOF-Core — это панацея. Но, мне кажется, это хорошее начало для исследования реальной безопасности ИИ. Естественно, я буду рад если кто‑то обкатает этот SKILL на разных ситуациях и опишет что получилось. И, само‑собой, я открыт к предложениям по корректировкам.

Спасибо за внимание!