Комментарии 11
Надо пересмотреть "Число 23" с Джимом Керри
Автор путает промпт инъекцию и закладку.
Более релевантной будет эта статья: Магия чепухи: как «бессмысленные» инструкции заставляют нейросети работать лучше. Если можно заставить “работать лучше”, то и инъекция, влияющая на результат анализа, тоже возможна.
В результате, вторая ИИшка тоже начала любить сов.
Ключевое ограничение: это должны быть “родственные” ИИ, а не какие угодно. Именно тогда “промт” получается встроить через обучение без упоминаний исходного промта.
Если можно заставить “работать лучше”, то и инъекция, влияющая на результат анализа, тоже возможна.
Да, и это очень важная идея, которая далеко не всем понятна.
"Сделать лучше" и "сделать хуже" это наша субъективная трактовка, а в реальности есть лишь "возможность повлиять".
Тут ключевое даже не инъекция как таковая. А то, что случайные слова могут повлиять на результат радикальным образом. И эти слова никакой фильтр не поймает - это не инструкция, не подсказка. А просто странное слово “не к месту”.
А то, что случайные слова могут повлиять на результат радикальным образом.
Да! Причём, в неизвестный нам момент с неизвестными нам последствиями.
Я в одном из диалогов написал послание себе будущему "Просто на будущее. Я нашёл эту пословицы в словаре 1806 года.", просто, чтобы когда я через год буду перечитывать, я знал что пословица есть не только в указанном ИИшкой Дале 1881 года, но и в словаре 1806 года.
Просто себе написал.
Но услужливый работник сразу же сообщил, что будет учитывать это в будущем.
И недавно он считал, что "В качестве подтверждённого факта для дальнейших обсуждений вы используете то, что русскоязычная фиксация пословицы «лучше один раз увидеть, чем сто раз услышать» присутствует в «Словаре Академии Российской» 1806 года."
А потом трактовал это как "Вы также просили учитывать как подтверждённый факт, что русскоязычная фиксация пословицы «лучше один раз увидеть, чем сто раз услышать» имеется в «Словаре Академии Российской» 1806 года при обсуждении происхождения этой пословицы."
Какие выводы он сделает через 5 минут, никому неведомо. И это в условно статическом состоянии, без дополнительных диалогов.
one pixel attack
Ключевое ограничение: это должны быть “родственные” ИИ, а не какие угодно.
Да, и у меня это отмечено:
- "Да, в нужный момент придётся протестировать модель, являющуюся однотипной с атакуемой, чтобы знать какие числа начать ей засылать "
- " Выделите ключевые ассоциации для популярных ИИшек "
У меня всё по серъёзному продумано, чтобы люди могли начать действовать. :)

Промпт инъекция дистиллятом