Совсем недавно публиковал статью о том, как легко перехватить вашего AI-агента, а буквально в начале этой недели на Black Hat USA Адам Шостак (ведущий эксперт в кибербезопасности и моделирвоании угроз) выступил с докладом «Threat Modeling LLMs: The PHANTOM-B Approach».

Доклад состоял из трех частей: базовый обзор threat modeling, общий взгляд на моделирование угроз для LLM и подробный разбор фреймворка PHANTOM-B, созданного для ускорения и фокусировки этого процесса.

Контекст: зачем это нужно?

В начале выступления Адам сделал выравнивание понятий, поскольку термин threat modeling каждый трактует по-своему. В своей основе это системный подход к прогнозированию проблем. Он применим к софту, который вы пишете сами, к системам, собираемым из сторонних компонентов, и к LLM, которые вы обучаете или скачиваете с Hugging Face.

Везде работает базовый Four Question Framework:

  1. Над чем мы работаем?

  2. Что может пойти не так?

  3. Что мы собираемся с этим делать?

  4. Хорошо ли мы справились?

Этот фреймворк стал стандартом как в индустрии, так и в госсекторе (от Anthropic и Google до MITRE и FDA).

Главный драйвер текущей гонки ИИ — страх топ-менеджмента упустить «поезд AI», как когда-то отстали старые IT-гиганты. Именно эта спешка делает threat modeling критически важным: среди всех меняющихся подходов в эпоху AI, модель угроз остаётся самым устойчивым методом безопасности, ведь четыре базовых вопроса не зависят от того, что именно находится на другом конце пайплайна.

Threat modeling для LLM: общий контекст

Использование AI делится на четыре сценария: атака, защита, разработка ПО и бизнес-процессы. Если не разграничивать эти зоны, возникает путаница.

Сейчас на рынке много каталогов и рисковых анализов: Berryville ML/LLM risk analyses, OWASP Top 10 for LLMs / AI Exchange, MITRE ATLAS, NIST AI/ML catalog, Google SAIF. Все они лучше, чем подход «поредтимим и задеплоим», но на практике создают барьеры, снижающие ROI:

  • Высокая стоимость обучения команды.

  • Академические или дублирующие стандартный security engineering находки, которые не дают понятных action items.

  • Затраты времени на прохождение каталогов с повторным изобретением того, что уже перекрывает STRIDE.

Эти проблемы и привели к созданию PHANTOM-B.

Подход PHANTOM-B

PHANTOM-B — это не очередная база знаний, а ответ на запрос клиентов: нужен инструмент для AI, который легко внедрить и который действительно работает на практике. Фреймворк обкатывался на внутренних проектах, гиперскейлерах и крупных банках.

По аналогии со STRIDE, модель распространяется бесплатно по лицензии Creative Commons и умещается на обычной карточке-памятке (wallet card).

8 ключевых угроз в PHANTOM-B:

  • Prompt injection — не просто смешные джейлбрейки, а получение атаковавшим контроля над логикой LLM, что в современных системах ведет к критическим последствиям.

  • Hallucination (галлицинации).

  • Anthropomorphization — человеческая склонность воспринимать генератор токенов как систему, обладающую моралью или понятием «пользователь vs злоумышленник». У LLM этого нет, поэтому инструкции вида «don't do X» часто дают обратный эффект.

  • Non-explainability — объяснение ошибки самой моделью является лишь правдоподобной историей, а не реальной причиной сбоя.

  • Training issues — проблемы обучающих данных/процесса).

  • Overreliance — чрезмерное доверие к ответам.

  • Missing security engineering — уязвимая ИБ архитектура.

  • Bias — предвзятость.

Фреймворк намеренно сделан узконаправленным. Из него убрали всё, что должно закрываться классическим security engineering. Поэтому PHANTOM-B не дублирует, а дополняет STRIDE, kill chains и процессы SDL.

Почему это важно именно сейчас?

Давление бизнеса с требованием быстрее релизить AI-фичи не снизится. Но это не повод отказываться от базовых вопросов безопасности. Threat modeling не замедляет разработку, а позволяет командам двигаться быстро и не действовать вслепую, избегая репутационных катастроф.

Вывод

Рождение подобия STRIDE для моделирования угроз LLM было только вопросом времени, так как уже давно в сообществе формируются практики по построению безопасной архитектуры моделей. И то, что к этому приложил руку Адам Шостак — отец threat modeling, лишний раз доказывает, что мир угроз безостановочно меняется, следуя за развитием технологий, что способствует появлению новых векторов атак.

Забираем себе в стэк, применяем в работе, остаемся на пике.