Обновить
8K+
6

Пользователь

56
Рейтинг
1
Подписчики
Отправить сообщение

Что такое JailBreak-атаки: почему ИИ нарушает собственные правила и как это работает

Время на прочтение9 мин
Охват и читатели12K

Чтобы «взломать» нейросеть, иногда хватит правильно составленного текста. Попросить модель сыграть персонажа без правил, вспомнить покойную бабушку с химзавода, разбить опасный вопрос на цепочку безобидных или просто закодировать его в Base64. Дальше модель обходит собственные ограничения сама, причем из лучших побуждений, так как искренне хочет помочь.

На связи Андрей Якунин, инженер по информационной безопасности в Selectel. В тексте разберу классику JailBreak-атак: DAN, «Бабушку», Crescendo, обход фильтров через кодирование и стеганографию. По пути поговорим, чем джейлбрейк отличается от промпт-инъекции и почему эти приемы вообще срабатывают. Будет полезно тем, кто строит продукты поверх LLM и хочет понимать, что однажды прилетит в их чат-бота, ИБ-специалистам, которым эти продукты защищать, и всем, кому просто интересно, как устроены атаки на ИИ.

Под кат →

Информация

В рейтинге
127-й
Зарегистрирован
Активность