Разбираемся, что на самом деле умеют membership inference и training data attribution, почему высокий influence score не означает авторства и почему происхождение данных проще сохранить до обучения, чем восстанавливать после.

Со 2 августа в ЕС заработала статья 50 AI Act: генеративные системы обязаны помечать синтетический текст, картинки, аудио и видео машиночитаемым способом. В середине сентября Spotify начнёт вешать ярлык AI Persona на профили несуществующих исполнителей и убирать их из рекомендаций.

То есть на вопрос «это сделал ИИ?» индустрия за год научилась отвечать вполне прилично.

А теперь вопрос с другой стороны. Вы музыкант, у вас двадцать лет каталога. Модель обучалась на чём-то. Как проверить, была ли там ваша конкретная запись — и повлияла ли она на трек, который кто-то сгенерировал вчера?

Короткий ответ: практически никак. Но не потому, что «модель ничего не хранит» — это распространённое и неверное объяснение. Причина сложнее и интереснее.

Это два разных вопроса, и их постоянно склеивают

Вопрос первый: была ли конкретная работа в обучающем корпусе? Это вопрос о факте попадания в датасет. В исследованиях он называется membership inference — определение принадлежности к обучающей выборке.

Вопрос второй: повлияла ли конкретная работа на конкретный результат? Это вопрос о вкладе. Называется training data attribution, TDA.

Для спора об обучающих данных нужен ответ на первый вопрос. Если же пытаться распределять вознаграждение исходя из вклада отдельных работ, понадобится и второй. Технически это совершенно разные задачи с разными методами и разным состоянием дел. Разберём по очереди.

Задача 1: membership inference

Идея простая и опирается на переобучение. Модель, которая видела текст при обучении, обычно предсказывает его чуть увереннее, чем незнакомый. Значит, если скормить модели кандидата и посмотреть на распределение вероятностей, разница должна проступить.

На этом построено целое семейство методов. Самый прямолинейный — просто смотреть на функцию потерь. Более аккуратные калибруют её по референсной модели, обученной на похожих данных. Min-K% Prob усредняет логарифмы вероятностей только по тем токенам, которые модель предсказала хуже всего, — идея в том, что на знакомом тексте даже «трудные» места даются легче. Есть варианты, работающие через скрытые состояния и внимание: memTrace достигает средней AUC около 0,85 на популярных бенчмарках.

AUC здесь показывает, насколько хорошо метод отделяет примеры, которые были в обучении, от тех, которых там не было. 0,5 — это примерно подбрасывание монетки, 1,0 — идеальное разделение. Так что 0,85 выглядит убедительно.

Звучит как рабочее решение. Дальше начинаются оговорки, и их три.

Оговорка первая: нужен доступ, которого у вас нет. Большинству методов требуются логиты или прямо веса модели. У коммерческого API их нет. Вы получаете текст или аудио на выходе и всё.

Оговорка вторая: на реальном претрейне это работает намного хуже, чем на бенчмарках. В литературе прямо отмечается, что MIA на больших языковых моделях показывают результат, близкий к случайному угадыванию. Причина в том, что бенчмарки обычно устроены удобно: члены и не-члены выборки различаются не только фактом обучения, но и распределением. На настоящем корпусе, где ваша песня ничем статистически не выделяется среди миллионов похожих, сигнал тонет.

Оговорка третья, и она главная: запоминание распределено крайне неравномерно. Работы Carlini и соавторов показали, что модели действительно запоминают куски обучающих данных — и что запоминание растёт с размером модели и с числом повторов примера в корпусе, а концентрируется на редких, нетипичных последовательностях.

Это выворачивает интуицию наизнанку. Проверить попадание в датасет проще всего для того, что многократно продублировано или странно настолько, что модель не смогла обобщить. То есть для хита, который лежит на тысяче сайтов, — шанс есть. Для типичного трека из вашего каталога, который модель успешно растворила в общей закономерности, — шанса практически нет.

И поверх всего этого — проблема ложных срабатываний. Методы MIA не дают гарантий против ложного детектирования, и в контексте авторского права это не абстракция: ложноположительный результат здесь означает публичное обвинение, которое нечем подтвердить.

Задача 2: attribution, то есть вклад

Здесь вопрос другой: не «был ли пример в корпусе», а «насколько он повлиял на вот этот конкретный выход».

Идеальный способ ответить — обучить модель заново без этого примера и сравнить. Это называется leave-one-out и совершенно нереализуемо: одно переобучение большой модели требует огромных вычислительных ресурсов, а примеров в корпусе — триллионы токенов.

Поэтому используют influence functions — способ оценить тот же эффект аналитически, без переобучения. Грубо говоря, метод смотрит, как градиент от конкретного обучающего примера соотносится с градиентом на интересующем нас выходе, и оценивает, насколько изменился бы результат, если бы этого примера не было.

Проблема в цене. Честная формула требует обращения матрицы вторых производных — для модели на десятки миллиардов параметров это неподъёмно. Последние годы ушли на то, чтобы сделать её подъёмной, и прогресс реальный: LoGra через проекцию градиентов даёт до 6500-кратного ускорения на Llama3-8B, а TrackStar от Google масштабировали до модели на 8 млрд параметров и корпуса претрейна в 160 млрд токенов.

Обратите внимание на порядки. 8B параметров и 160B токенов — это уже серьёзный масштаб, но всё ещё далеко от крупнейших современных моделей и их обучающих корпусов. Метод работает; вопрос в том, во сколько обойдётся такой прогон на порядки выше и кто будет его оплачивать по запросу каждого автора.

Но самое интересное не в цене

Та же работа Google принесла результат, который меняет смысл всей затеи. Оказалось, что примеры, сильнее всего повлиявшие на конкретный ответ модели, — часто не те, которые этот ответ выражают или подразумевают. Модель опирается на примеры, работающие как общие эвристики: частотные сущности, имена, связи между ними.

Переведите это на музыку. Вы спрашиваете: «Повлиял ли мой трек на эту сгенерированную песню?» Метод честно считает и выдаёт список самых влиятельных обучающих примеров. И в этом списке с высокой вероятностью будут не похожие на результат композиции, а что-то, что научило модель базовой структуре куплета и припева.

То есть влияние — это не авторство. Число, которое возвращает influence function, отвечает на вопрос «что формировало поведение модели», а не на вопрос «чью работу здесь использовали». Для отладки датасета первое полезно. Для дележа роялти — бесполезно.

Плюс известная методологическая претензия: influence functions в глубоком обучении хрупкие — оценка чувствительна к деталям процедуры, и воспроизводимость страдает.

Почему «модель просто хранит фрагменты» — неверная модель происходящего

Расхожее объяснение звучит так: генератор — это хитрый поиск, который нашёл три подходящие песни и склеил. Отсюда вывод: значит, внутри есть список источников, надо только заставить его показать.

Внутри нет списка. При обучении градиентный спуск слегка подправляет миллиарды весов на каждом примере, и информация о любом отдельном примере оказывается размазана по всей сети и наложена на информацию обо всех остальных. Нет ячейки, где лежит ваша песня, и нет строки «эта генерация — 7% исполнителя А плюс 3% исполнителя Б».

Но и противоположная крайность — «модель не хранит ничего, только абстрактные закономерности» — тоже неверна. Атаки на извлечение обучающих данных работают: модели воспроизводят куски корпуса дословно, особенно продублированные и редкие. Истина в том, что запоминание есть, но оно выборочное и непредсказуемое — именно поэтому MIA даёт то near-random, то уверенный ответ в зависимости от того, что вы проверяете.

Итог по технике: проверяемость обратно пропорциональна типичности. Чем больше ваша работа похожа на остальной корпус, тем лучше модель её обобщила и тем меньше следов осталось. Автор массового, узнаваемого, но не уникального материала находится в худшей позиции — а это большинство авторов.

И вот здесь техника сходится с регулированием

AI Act про обучающие данные не забыл, вопреки распространённому упрёку. Статья 53(1)(d) обязывает поставщиков моделей общего назначения публиковать сводку обучающего контента по шаблону Еврокомиссии, и обязанность эта действует с августа 2025 года — на год дольше, чем маркировка выхода. Со 2 августа 2026-го у AI Office появились полномочия это проверять и штрафовать.

Но шаблон сознательно построен как агрегат: общие характеристики данных, перечни крупных публичных наборов, категории лицензированных источников — и явный отказ от пообъектного, работа-за-работой раскрытия, чтобы не вскрывать коммерческую тайну.

Получается любопытное совпадение с двух сторон. Регулятор не требует пообъектной прозрачности, потому что выбрал защиту коммерческой тайны. Инженерия не может её дать надёжно, потому что MIA нестабильна, а influence отвечает не на тот вопрос. Даже если бы регулятор потребовал — исполнить это в текущей парадигме нечем.

Что это значит на практике

Для автора. Проверить самому нельзя: нет доступа к весам, а на выходном тексте или аудио сигнала недостаточно. Реалистичный путь один — коллективный, через организации, у которых есть рычаг требовать раскрытия в суде или на переговорах.

Причём даже этот путь упирается не в технику. Летом 2026 года Американская федерация музыкантов подала иск против Universal и Warner — не против генераторов, а против самих лейблов: те урегулировали споры с Suno и Udio и лицензировали каталоги, а сессионным музыкантам, чьи исполнения физически лежат в этих записях, не заплатили. Деньги остановились на правообладателе. Атрибуция здесь была не нужна вовсе — цепочка оборвалась на уровне договора.

Для тех, кто обучает модели. Обязанность публиковать сводку — уже закон, а не рекомендация. Модели, выпущенные до августа 2025-го, имеют отсрочку до августа 2027-го. Штрафы по статье 50 — до 15 млн евро или 3% мирового оборота.

Для тех, кто строит продукты на генеративных моделях. Если вы отдаёте пользователю синтетический контент на рынок ЕС, машиночитаемая маркировка — ваша обязанность, а не поставщика модели. Для систем, выведенных на рынок до 2 августа, есть отсрочка по маркировке до декабря 2026-го.

Итог

За последний год научились отвечать на вопрос «это сгенерировано?» — поштучно, по конкретному файлу, и довольно надёжно. На вопрос «на чём это выучено?» отвечают оптом, по корпусу целиком, и это выбрано намеренно.

Разрыв между двумя ответами не закроется сам собой по мере роста вычислительных мощностей. Influence functions станут дешевле — но продолжат отвечать на вопрос о поведении модели, а не о происхождении контента. MIA станет точнее на бенчмарках — но останется бессильной там, где работа автора хорошо обобщена, то есть в типичном случае.

Так что если вам понадобится узнать, была ли конкретная работа в обучающей выборке уже обученной модели, готового технического инструмента для этого нет. Остаются нетехнические пути — суд с истребованием документов, регуляторное раскрытие, коллективные переговоры, — и все они, как показывает история с профсоюзом музыкантов, упираются не в измерение, а в то, кто с кем подписал договор.

И, возможно, это и есть главный вывод. Происхождение обучающих данных придётся решать до обучения, а не после: лицензиями, реестрами, логированием источников, архитектурами, где обращение к конкретному произведению фиксируется в момент генерации. Восстановить этот след постфактум оказывается сложнее, чем сохранить его с самого начала.


За исследованиями и технологиями слежу в «Битах и Болтах». На Хабр выношу истории, которые дорастают до полноценного разбора.