Обновить

Маскирование ПДн для LLM: метрика, которую не считает никто, и шесть шлюзов против живого агента

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели4.5K
Всего голосов 5: ↑5 и ↓0+7
Комментарии4

Комментарии 4

А как вы считаете, можно ли в будущем расширить такой бенчмарк до проверки утечки ПДн через память агента? Например, если реальный телефон был замаскирован на первом шаге, а на втором модель через контекст/память смогла восстановить или вывести исходное значение. Насколько это вообще реально надёжно измерить?

Спасибо за вопрос! Да конечно, память это основной компонент работы агента и ключевая часть его контекста, к сожалению пока на рынке нету бенчмарков именно под агентную обработку ПД. Собственно этим направлением мы и занимаемся создавая такие сценарии.
А косаемой описанного кейса - это уже задача бенчмарка иметь стабильную подмену и подстаиваться под разные форматы. Измерить это достаточно трудно, но мы умеем это делать)

Интересный бенчмарк, но у меня вопрос. Метрики проверяют, получил ли инструмент настоящее значение. А модель ведь принимает решения и сама, глядя на подстановку. Если дату рождения 1958 подменить на 1994, агент откажет в пенсионной скидке ещё до вызова инструмента. Если «Дарью» заменить на «Даниила», собьётся обращение.

Как с этим быть? Если подстановка сохраняет возраст, пол и регион, человек частично раскрыт, а если не сохраняет, ломаются рассуждения агента

Отличный вопрос! Подстановка обязана сохранять то, на чём модель рассуждает: пол, возрастную когорту (не точную дату рождения, а когорту), класс региона, согласование по падежу и числу. Само значение при этом другое и к человеку не ведёт.

Сохранишь всё человек частично раскрыт. Сохранишь ничего агент сломается ещё до вызова инструмента, как вы и описали: пенсионная скидка, обращение по полу. Мы настроились ровно на эту грань: семантика сохраняется, значение меняется.

И это, а не только «скрыли или не скрыли», меряет бенчмарк: доехало ли настоящее значение до инструмента и не сломался ли агент по дороге. Без отдельной метрики на рассуждение модели такой провал невидим.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации