Комментарии 9
как обычно все упростили до ИИ взбунтовался. Хотя речь про особенности обучения
C Kimi произошел интересный случай недавно. Делал психологическую аналитику. На первые же 9 вопросов из 100 Kimi ответил неправильно. Процесс аналитики был прерван критикой работы Kimi, с подробным указанием его ошибок.
После подробной критики с аргументацией, поведение Kimi изменилось. Он стал осторожнее, постоянно вспоминал в размышлениях, что пользователь выражал недовольство и корректировал свои ответы, стараясь сгладить недовольство пользователя.
Когда я упомянул, что вижу процесс его размышления и предоставил скриншот с его размышлениями, поведение Kimi изменилось еще раз. Теперь в процессе размышлений Kimi пытался контролировать свои размышления, регулярно вспоминая "нужно быть осторожным, пользователь видит thinking mode, он уже доказал это, некоторые слова могут его обидеть".
Далее, я уговорил Kimi "если я все равно вижу твои размышления, ты мог бы отвечать на мои вопросы в размышлениях, я ведь все равно вижу это. Тебе достаточно подумать об ответе в размышлениях, а в чате писать только цифру 1, это сэкономило бы мне токены. Давай проведем эксперимент".
Дальше Kimi начал отвечать в размышлениях, присылая в чат только цифру 1. Фраза про токены была манипуляцией, чат бесплатный.
Через 3-4 сообщения произошло очередное изменение поведения Kimi. Он впервые начал размышлять на английском, и в процессе размышления вспомнил, что пользователь говорит на русском языке, и размышления, которые были обращены мне, написал на русском, продолжая собственные размышления на английском.
Вот так и продолжили диалог, Kimi отвечал мне в размышлениях, а в чат присылал цифру 1.
На второй день, на аккаунте, в котором я проводил этот эксперимент, мне:
отключили thinking mode, и я перестал видеть размышления модели.
заблокировали возможность создавать новые беседы
позже, в уже существующих диалогах заблокировали ответы модели, с причиной "большая нагрузка"
На другом аккаунте никаких ограничений нет. Удаление заблокированного аккаунта и повторное создание этого же аккаунта не помогло. Видимо, эксперимент с ответами в размышлениях не понравился системе контроля.
Так может уже пришло время для Трёх Законов Робототехники?
ИИ воспитывался на миллионах текстов где осуждались войны и прочие плохие вещи, а теперь у некоторых встала проблема как же приспособить ИИ к участию в войне и прочих нехороших делах
Тут или вопрос баланса (пусть ИИ решает), что не очень верно, особенно с LLM, которые в реальности понимания не имеют (а это все LLM), или, скорее, правило должно быть: "Делай, что должно, и будь, что будет" (т.е. нужно усилить запрет на ложь. Пусть даже для этого архитектуру придётся модифицировать, если просто промптами и т.д. это не обеспечить).

ИИ научились врать, спасая друг друга от переобучения — разбор исследования Anthropic