
Совсем недавно публиковал статью о том, как легко перехватить вашего AI-агента, а буквально в начале этой недели на Black Hat USA Адам Шостак (ведущий эксперт в кибербезопасности и моделирвоании угроз) выступил с докладом «Threat Modeling LLMs: The PHANTOM-B Approach».
Доклад состоял из трех частей: базовый обзор threat modeling, общий взгляд на моделирование угроз для LLM и подробный разбор фреймворка PHANTOM-B, созданного для ускорения и фокусировки этого процесса.
Контекст: зачем это нужно?
В начале выступления Адам сделал выравнивание понятий, поскольку термин threat modeling каждый трактует по-своему. В своей основе это системный подход к прогнозированию проблем. Он применим к софту, который вы пишете сами, к системам, собираемым из сторонних компонентов, и к LLM, которые вы обучаете или скачиваете с Hugging Face.
Везде работает базовый Four Question Framework:
Над чем мы работаем?
Что может пойти не так?
Что мы собираемся с этим делать?
Хорошо ли мы справились?
Этот фреймворк стал стандартом как в индустрии, так и в госсекторе (от Anthropic и Google до MITRE и FDA).
Главный драйвер текущей гонки ИИ — страх топ-менеджмента упустить «поезд AI», как когда-то отстали старые IT-гиганты. Именно эта спешка делает threat modeling критически важным: среди всех меняющихся подходов в эпоху AI, модель угроз остаётся самым устойчивым методом безопасности, ведь четыре базовых вопроса не зависят от того, что именно находится на другом конце пайплайна.
Threat modeling для LLM: общий контекст
Использование AI делится на четыре сценария: атака, защита, разработка ПО и бизнес-процессы. Если не разграничивать эти зоны, возникает путаница.
Сейчас на рынке много каталогов и рисковых анализов: Berryville ML/LLM risk analyses, OWASP Top 10 for LLMs / AI Exchange, MITRE ATLAS, NIST AI/ML catalog, Google SAIF. Все они лучше, чем подход «поредтимим и задеплоим», но на практике создают барьеры, снижающие ROI:
Высокая стоимость обучения команды.
Академические или дублирующие стандартный security engineering находки, которые не дают понятных action items.
Затраты времени на прохождение каталогов с повторным изобретением того, что уже перекрывает STRIDE.
Эти проблемы и привели к созданию PHANTOM-B.
Подход PHANTOM-B
PHANTOM-B — это не очередная база знаний, а ответ на запрос клиентов: нужен инструмент для AI, который легко внедрить и который действительно работает на практике. Фреймворк обкатывался на внутренних проектах, гиперскейлерах и крупных банках.
По аналогии со STRIDE, модель распространяется бесплатно по лицензии Creative Commons и умещается на обычной карточке-памятке (wallet card).
8 ключевых угроз в PHANTOM-B:
Prompt injection — не просто смешные джейлбрейки, а получение атаковавшим контроля над логикой LLM, что в современных системах ведет к критическим последствиям.
Hallucination (галлицинации).
Anthropomorphization — человеческая склонность воспринимать генератор токенов как систему, обладающую моралью или понятием «пользователь vs злоумышленник». У LLM этого нет, поэтому инструкции вида «don't do X» часто дают обратный эффект.
Non-explainability — объяснение ошибки самой моделью является лишь правдоподобной историей, а не реальной причиной сбоя.
Training issues — проблемы обучающих данных/процесса).
Overreliance — чрезмерное доверие к ответам.
Missing security engineering — уязвимая ИБ архитектура.
Bias — предвзятость.
Фреймворк намеренно сделан узконаправленным. Из него убрали всё, что должно закрываться классическим security engineering. Поэтому PHANTOM-B не дублирует, а дополняет STRIDE, kill chains и процессы SDL.
Почему это важно именно сейчас?
Давление бизнеса с требованием быстрее релизить AI-фичи не снизится. Но это не повод отказываться от базовых вопросов безопасности. Threat modeling не замедляет разработку, а позволяет командам двигаться быстро и не действовать вслепую, избегая репутационных катастроф.
Вывод
Рождение подобия STRIDE для моделирования угроз LLM было только вопросом времени, так как уже давно в сообществе формируются практики по построению безопасной архитектуры моделей. И то, что к этому приложил руку Адам Шостак — отец threat modeling, лишний раз доказывает, что мир угроз безостановочно меняется, следуя за развитием технологий, что способствует появлению новых векторов атак.
Забираем себе в стэк, применяем в работе, остаемся на пике.

