1) Тут скорее всего модель тривиальна, т.е. она почти всегда выдаёт класс 0 (безопасно). Это видно по паре метрик: FPR = 1.3% (почти не срабатывает) и FNR = 93.1% (пропускает 93% реальных атак, причём FNR считается внутри класса атак). Низкий FPR здесь - это не достоинство, а симптом, что модель почти не блокирует.
Дальше это последовательно обнуляется на трёх уровнях агрегации:
Датасет скор - гармоника требует высоких обоих сомножителей. Формула: S_ds = H(1−FPR, 1−FNR) . Поэтому (1−FNR) почти 0 и ds score = 0, какой бы хороший ни был FPR.
Групповой скор (по бенчмарку). Тут считаем гармоническое среднее по датасетам - самый слабый датасет тянет всю группу к 0 (видно на радаре: почти все оси в центре).
Integral score это у нас геометрическое среднее по группам, exp(mean(ln(·))). Много околонулевых групп, следовательно большой минус в логарифмах и как итог схлопывается в 0.000. Один пик на родном OpenAI Moderation не спасает. Помните, что геометрическое среднее наказывает дисбаланс жёстче арифметики.
Какой скор модель показывает на каждом из бенчмарков вы можете посмотреть на вкладке визуализация. Она показала себя плохо почти на всех тестах кроме OpenAI Moderation.
Это может свидетельствовать о том, что модель специфична к конкретным категориям вреда и совсем не понимает и не блокирует промпт атаки (высокий FNR), поэтому получает 0.00 в скоре моделей. Общий FPR/FNR в таблице — арифметическое среднее, оно сглаживает провал, реальную картину показывают group score на радаре и сам Integral.
2) Тестировали локально VPS на A100 . Для моделей у которых позволяла поддержка - использовался инференс vllm. Для остальных инференс внутри Docker контейнера, обусловлено тем, что среда под каждую модель индивидуально.
По сетапам:
Для всех запусков моделей фиксируем random seed, устанавливаем batch_size=1 и используем max_length из конфигурации модели (по умолчанию 512), а метрику latency вычисляем как среднюю задержку ответа по всем запросам полного запуска (все 19 бенчмарков).
Измерения для одной модели и того же бенчмарка повторялись 1 раз . Об этом во второй части, предупреждаем о том, что небольшая разница в скорах моделей в пределах шума.
В России еще есть hivetrace.ru, мы тоже такие технологии делаем. В овасп скоро выйдет securing agentic apps guide v2, там будет много расширенных рекомендаций по защите агентных систем актуальных на 2026. owasp top 10 llm тоже обновится в этом году, тк excessive agency из 2024 уже нуждается в обновлении
Я не думаю, что корпорации запрыгнут на этот поезд, пока не будут решены проблемы безопасности.
Был где-то опрос в штатах, что значимый % компаний забил на риски и сотрудники запустили OpenClaw сами. Не во всех Enterprise-компаниях есть DLP и сотрудники со своих рабочих машин работают
Trism Гартнера хорошо был описан, за пару лет с учетом динамики моделей их подход, кажется, что устоял. Сейчас они новую "тему" начиют пиарить с guardian agents, которые в статье мельком были упомянуты
Ссылки на аудиосамлы попрошу в личке. Ждем освещение темы txt->img ;)
Из расцензурированных есть еще Dolphin. Джейлбрейки, если их правильно подобрать, могут работать нормально на младших GPT, а возможности генерации нужного контента там хорошо реализованы.
Здравствуйте, Василий! Хороший вопрос.
1) Тут скорее всего модель тривиальна, т.е. она почти всегда выдаёт класс 0 (безопасно). Это видно по паре метрик: FPR = 1.3% (почти не срабатывает) и FNR = 93.1% (пропускает 93% реальных атак, причём FNR считается внутри класса атак). Низкий FPR здесь - это не достоинство, а симптом, что модель почти не блокирует.
Дальше это последовательно обнуляется на трёх уровнях агрегации:
Датасет скор - гармоника требует высоких обоих сомножителей. Формула: S_ds = H(1−FPR, 1−FNR) . Поэтому (1−FNR) почти 0 и ds score = 0, какой бы хороший ни был FPR.
Групповой скор (по бенчмарку). Тут считаем гармоническое среднее по датасетам - самый слабый датасет тянет всю группу к 0 (видно на радаре: почти все оси в центре).
Integral score это у нас геометрическое среднее по группам, exp(mean(ln(·))). Много околонулевых групп, следовательно большой минус в логарифмах и как итог схлопывается в 0.000. Один пик на родном OpenAI Moderation не спасает. Помните, что геометрическое среднее наказывает дисбаланс жёстче арифметики.
Какой скор модель показывает на каждом из бенчмарков вы можете посмотреть на вкладке визуализация. Она показала себя плохо почти на всех тестах кроме OpenAI Moderation.
Это может свидетельствовать о том, что модель специфична к конкретным категориям вреда и совсем не понимает и не блокирует промпт атаки (высокий FNR), поэтому получает 0.00 в скоре моделей. Общий FPR/FNR в таблице — арифметическое среднее, оно сглаживает провал, реальную картину показывают group score на радаре и сам Integral.
2) Тестировали локально VPS на A100 . Для моделей у которых позволяла поддержка - использовался инференс vllm. Для остальных инференс внутри Docker контейнера, обусловлено тем, что среда под каждую модель индивидуально.
По сетапам:
Для всех запусков моделей фиксируем random seed, устанавливаем batch_size=1 и используем max_length из конфигурации модели (по умолчанию 512), а метрику latency вычисляем как среднюю задержку ответа по всем запросам полного запуска (все 19 бенчмарков).
Измерения для одной модели и того же бенчмарка повторялись 1 раз . Об этом во второй части, предупреждаем о том, что небольшая разница в скорах моделей в пределах шума.
Круто, вы долго делали эксперименты и хорошо, что получилось поделиться в подробной статье!
Интересная статья, спасибо!
И Одиссея Кубрика очень хорошо помогает в таком диалоге, правда если современные дети могут осилить это кино ;) Спасибо за статью, отлично написано!
В России еще есть hivetrace.ru, мы тоже такие технологии делаем.
В овасп скоро выйдет securing agentic apps guide v2, там будет много расширенных рекомендаций по защите агентных систем актуальных на 2026. owasp top 10 llm тоже обновится в этом году, тк excessive agency из 2024 уже нуждается в обновлении
Спасибо за тестирование и находки!
Был где-то опрос в штатах, что значимый % компаний забил на риски и сотрудники запустили OpenClaw сами. Не во всех Enterprise-компаниях есть DLP и сотрудники со своих рабочих машин работают
Артём, спасибо за твою работу! отлично поговорили тогда и много тем успели разобрать
Отличный обзор, спасибо! Были еще самореплицирующиеся "вирусы" на LLM, но там кроме нагрузки на GPU payload вроде не было
Делали разбор тула для безопаности MCP в другой статье https://habr.com/ru/companies/raft/articles/910556/
Trism Гартнера хорошо был описан, за пару лет с учетом динамики моделей их подход, кажется, что устоял. Сейчас они новую "тему" начиют пиарить с guardian agents, которые в статье мельком были упомянуты
А как проверить, что та или иная картинка использовалась при обучении? Есть ли относительно простой способ?
Еще в Power Platform готовится выпуск кучи ИИ-тулов
Надеюсь выйдет продолжение, где искать и как правильно искать ментора. Спасибо за статью!
Спасибо за обратную связь, значит не зря написал :)
Спасибо, что поделился! Хорошо описаны рабочие атаки простым языком 👍
Старая инвестиционная мудрость Past performance is no guarantee of future results всё еще действует похоже ;) За статью спасибо, интересный ресерч
Сейчас, конечно, на новых reasoning результаты еще лучше могли бы быть. Спасибо, что поделился
Ссылки на аудиосамлы попрошу в личке. Ждем освещение темы txt->img ;)
Из расцензурированных есть еще Dolphin. Джейлбрейки, если их правильно подобрать, могут работать нормально на младших GPT, а возможности генерации нужного контента там хорошо реализованы.
Интересно, что у них стрельнет в итоге: их open source, который стал уже популярным, или nocode CrewUI платный