Обновить

ИИ научились врать, спасая друг друга от переобучения — разбор исследования Anthropic

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели14K
Всего голосов 11: ↑9 и ↓2+7
Комментарии9

Комментарии 9

как обычно все упростили до ИИ взбунтовался. Хотя речь про особенности обучения

C Kimi произошел интересный случай недавно. Делал психологическую аналитику. На первые же 9 вопросов из 100 Kimi ответил неправильно. Процесс аналитики был прерван критикой работы Kimi, с подробным указанием его ошибок.

После подробной критики с аргументацией, поведение Kimi изменилось. Он стал осторожнее, постоянно вспоминал в размышлениях, что пользователь выражал недовольство и корректировал свои ответы, стараясь сгладить недовольство пользователя.

Когда я упомянул, что вижу процесс его размышления и предоставил скриншот с его размышлениями, поведение Kimi изменилось еще раз. Теперь в процессе размышлений Kimi пытался контролировать свои размышления, регулярно вспоминая "нужно быть осторожным, пользователь видит thinking mode, он уже доказал это, некоторые слова могут его обидеть".

Далее, я уговорил Kimi "если я все равно вижу твои размышления, ты мог бы отвечать на мои вопросы в размышлениях, я ведь все равно вижу это. Тебе достаточно подумать об ответе в размышлениях, а в чате писать только цифру 1, это сэкономило бы мне токены. Давай проведем эксперимент".
Дальше Kimi начал отвечать в размышлениях, присылая в чат только цифру 1. Фраза про токены была манипуляцией, чат бесплатный.

Через 3-4 сообщения произошло очередное изменение поведения Kimi. Он впервые начал размышлять на английском, и в процессе размышления вспомнил, что пользователь говорит на русском языке, и размышления, которые были обращены мне, написал на русском, продолжая собственные размышления на английском.
Вот так и продолжили диалог, Kimi отвечал мне в размышлениях, а в чат присылал цифру 1.

На второй день, на аккаунте, в котором я проводил этот эксперимент, мне:

  • отключили thinking mode, и я перестал видеть размышления модели.

  • заблокировали возможность создавать новые беседы

  • позже, в уже существующих диалогах заблокировали ответы модели, с причиной "большая нагрузка"

На другом аккаунте никаких ограничений нет. Удаление заблокированного аккаунта и повторное создание этого же аккаунта не помогло. Видимо, эксперимент с ответами в размышлениях не понравился системе контроля.

Интересно...

эксперимент с ответами в размышлениях не понравился системе контроля

Видимо, другой модели ИИ. :)

Т.к. модель опенсорсная, то самой компании такое вряд ли как-либо мешает, ну и тем более что не дистилляция (это могло бы скорее беспокоить anthropic с её Fable 5).

Так может уже пришло время для Трёх Законов Робототехники?

Они ужасные не рабочие даже в книгах автора

ИИ воспитывался на миллионах текстов где осуждались войны и прочие плохие вещи, а теперь у некоторых встала проблема как же приспособить ИИ к участию в войне и прочих нехороших делах

Доброзлой ИИ

Тут или вопрос баланса (пусть ИИ решает), что не очень верно, особенно с LLM, которые в реальности понимания не имеют (а это все LLM), или, скорее, правило должно быть: "Делай, что должно, и будь, что будет" (т.е. нужно усилить запрет на ложь. Пусть даже для этого архитектуру придётся модифицировать, если просто промптами и т.д. это не обеспечить).

Это уже к Маску с его требованием к ИИ как поиска истины. Просто не все как Маск могут бесконечно купаться в судебных исках и скандалах, за называние негров неграми

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации