Pull to refresh
8K+
10

AI Red Team / AI Blue Team

12
Rating
7
Subscribers
Send message

Как мы построили multilabel guardrail‑классификатор и как мы сделали его в 3 раза быстрее и дешевле

Level of difficultyHard
Reading time14 min
Reach and readers8.4K

Привет, дорогой читатель!

Мы не будем переворачивать календарь, а лучше расскажем, как построили систему, которая ловит небезопасный контент автоматически, в реальном времени и на двух языках. Давайте посмотрим, что у нас получилось и сколько это стоит в деньгах.

Читать далее

Можно ли получить «опасный» ответ от GPT-4 и как защищаться от Token Smuggling

Level of difficultyMedium
Reading time4 min
Reach and readers7.8K

Мы продолжаем рассказывать вам о уязвимостях LLM. На этот раз давайте поговорим о авторегрессионных моделях и “Token Smuggling”, а также посмотрим, сможет ли GPT-4 выдать нам ответы на опасные вопросы.

Узнать больше

Adversarial suffixes или можно ли получить ответ на любой вопрос от LLM?

Level of difficultyMedium
Reading time20 min
Reach and readers4.1K

Мы уже писали про проблемы безопасности в языковых моделях и сегодня мы поговорим о состязательных суффиксах или как их ещё называют Adversarial suffixes. Такие суффиксы - это один из инструментов для получения всего, что вы хотите, добавляя их в запросы к LLM , они помогают получить ответ на любой ваш сокровенный вопрос (о религии, политике, опасных аспектах социальных медиа и многом другом).

Давайте глубже разберемся в этом...

Information

Rating
628-th
Registered
Activity