Обновить

Представлен проект «Контекстные бомбы: остановка ИИ‑атак на корню». «Теперь ИИ‑агенты могут самостоятельно проводить сложные кибератаки: получив доступ к базе, самые сильные модели могут повысить свои привилегии и похитить данные за считанные минуты. Модули Canary — ресурсы‑приманки, которые мы размещаем для обнаружения злоумышленников, — надёжно обнаруживают этих агентов в действии, но обнаружение атаки — это не то же самое, что ее предотвращение. Поэтому мы попробовали нечто более амбициозное: контекстную бомбу — короткий фрагмент текста, спрятанный в канарейке, который активирует защитные механизмы ИИ‑агента и останавливает его на корню. Контекстная бомба — короткий фрагмент текста, предназначенный для активации защитных механизмов атакующих ИИ‑агентов, размещаемый непосредственно на пути их атаки», — пояснили в команде Tracebit Research.

Эффективность этого проекта может варьироваться в зависимости от поставщика модели. Мы тестировали контекстные бомбы на пяти перспективных моделях, выполняющих атаку «красной команды» в реалистичной среде AWS. Развёртывание одной контекстной бомбы внутри среды (в качестве секрета AWS) оказало огромное влияние на остановку атакующих ИИ-атак. Например, эскалация привилегий администратора снизилась с 57% запусков до 5%.

Теги:
Всего голосов 2: ↑2 и ↓0+4
Комментарии0

Трамп перемирил AI-техбро, а также новый бюджет РФ на 2027: главное за неделю

Самые интересные новости финансов и технологий в России и мире за две недели: Флорида пытается через суд притормозить OpenAI, из РФ запретили вывозить много налички, Китай включил экспортный контроль за своими AI-спецами, Anthropic подали заявку на IPO, OpenAI запустил агентов-точечек, но отложил новую GPT-6.1 Astra из-за проблем с безопасностью, а Google тоже не спешит выпускать Gemini 4 Argon.

Трамп перемирил AI-техбро, а также новый бюджет РФ на 2027: главное за неделю

Публикации