Обновить

FlautGuard: как мы построили многоуровневую защиту LLM от prompt injection и утечек данных

Уровень сложностиСложный
Время на прочтение7 мин
Охват и читатели6.4K
Всего голосов 2: ↑1 и ↓1+2
Комментарии1

Комментарии 1

Действительно нельзя складывать проценты обнаружения на разных уровнях защиты и выдавать полученное число за безопасность всей системы. Имеет смысл хранить каждого спорного запроса журнал, включающий исходный и нормализованный текст, решение каждого уровня и окончательный ответ. После изменения модели без такого набора будет сложно воспроизвести инцидент и определить, какой уровень пропустил угрозу. Возможно, полезно также раздельно оценивать конечные последствия, раскрытие персональных данных, иных данныз и выполнение недопустимого действия

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации