Обновить
1
Иван Александров@Ivanich-spb

Data Scientist

6
Подписчики
Отправить сообщение

Как «думает» ИИ: гроккаем разреженные автоэнкодеры (SAE)

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели9.5K

В этой статье разберём исследование от компании Anthropic, которое демонстрирует практическую возможность вскрытия «черного ящика» больших языковых моделей для обеспечения их контролируемости и безопасности с помощью разреженных автоэнкодеров (SAE — Sparse AutoEncoders). И в конце, попробуем поуправлять поведением модели — заставим думать, что она Санта Клаус 🎅.

Читать далее

3 главных инсайта о «взломах» LLM из исследования StrongREJECT

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели7.6K

Всем привет!
Погружаюсь в новую для себя область AI Security, в связи с чем решил написать несколько обзоров на самые обсуждаемые исследования  и статьи по этой теме. Сегодня поговорим про взлом LLM и неожиданные выводы исследования StrongReject.

Джейлбрейкнуть

Информация

В рейтинге
Не участвует
Откуда
Россия
Зарегистрирован
Активность

Специализация

Backend Developer, Data Scientist
Middle
Python
Git
Linux
SQL
Docker
OOP
English
Algorithms and data structures