Pull to refresh
3
Aleksey@aveml

ML Engineer

Send message

Поймай jailbreak, если сможешь

Level of difficultyMedium
Reading time12 min
Reach and readers6K

«Люди понимают то, что им дают понять», — говорил Фрэнк Абигнейл. Модели — тоже. Статья о том, как jailbreak обходит защиту LLM не силой, а формой: легендой, стилем, поддельной ролью.

Читать далее

Иллюзия контроля: почему промпты не защищают ИИ‑агентов

Level of difficultyMedium
Reading time13 min
Reach and readers7.2K

Почему указание вида «не отправляй конфиденциальные данные наружу» не работает?

Разбираем уязвимость Permission Boundary Bypass, а также техники scope creep и capability chaining, позволяющие злоумышленникам обходить ограничения через цепочки легитимных действий. В статье приводятся аргументы, почему prompt‑level enforcement проигрывает, зачем математическая строгость (язык Дика) нужна в конфигах политик, и как выстроить безопасную архитектуру, где проверки живут в runtime. В конец статье вы найдете 7 принципов защиты агентов и таблицу‑чеклист для аудита вашей системы.

Читать далее

Information

Rating
Does not participate
Registered
Activity