
2.08.2026 года, в день когда в ЕС реально завелась статья 50 AI Act, Anthropic сделала ход конём: с этого дня каждый текст, который выдаёт свеженькая модель Claude, тащит в себе невидимую метку. (Не пиксель или строчку метаданных в углу, а метку, вплетённую прямо в сам выбор слов) Это подали как жест прозрачности: мол, вот вам транспарентность(как просили).
Не прошло и суток, как в гитхабе набрал обороты проект, обещающий эту метку стереть. За ним — ещё десяток.
А неделю спустя независимое издание констатировало: доказать, что хоть один из них реально работает, не может никто (ни авторы ни сама Anthropic).
Эта статья – о том, почему это не баг и не провал маркетинга, а неизбежное следствие того, как устроена технология. И заодно — почему у истории куда более длинная борода, чем у чат-ботов: первые водяные знаки придумали за семьсот с лишним лет до GPT.

Что произошло
Anthropic подписала Кодекс практики по прозрачности ИИ-контента — добровольный и признанный Еврокомиссией «адекватным» способ соответствовать статье 50 AI Act. Под каток новых правил попали все свежие релизы, включая флагманский Opus 5 и более легковесный Sonnet 5.
Компания взяла на себя четыре обязательства, и на официальной странице поддержки Claude они прописаны по пунктам. Чтобы было понятно, насколько Anthropic всё продумала:
Обязательство | Что это значит на практике |
|---|---|
Новые модели маркируются с первого дня | Модели Claude, запущенные в ЕС 2 августа 2026 года или позже, поддерживают маркировку сразу при релизе |
Маркировка работает везде | Метки применяются к выводу на Claude Platform (API), приложения Claude, Claude Code, Claude Cowork и Claude Tag — и вообще везде, где доступен Claude, по всему миру |
Будет инструмент детекции | Anthropic обещает помочь пользователям и третьим лицам обнаруживать метки, детали — «в будущей документации» |
Старые модели — в процессе | Для моделей до 2 августа действует переходный период |
Механизм двухслойный. Для сгенерированного текста это невидимый водяной знак, вплетённый на уровне модели. Для файлов (.svg, .png, .jpg) — подписанные метаданные по открытому стандарту C2PA, тому самому, что уже юзают в фотожурналистике для проверки, не подделан ли кадр.
Важная деталь, которую многие пропускают: Anthropic не ограничилась Евросоюзом. Хотя закон требует этого только от контента для европейских пользователей, метка теперь применяется везде — в США, Азии. Ход не то чтобы бескорыстный, скажем прямо: поддерживать две параллельные версии модели, с меткой и без, — та ещё боль для инженеров. Проще сделать один продукт для всего мира. Но выглядит это красиво, и об этом уже написали все, от TechCrunch до SiliconANGLE.
Как вообще можно спрятать метку в тексте без пикселей
Первая реакция любого нормального человека на фразу «невидимый водяной знак в тексте»: Погодите, это как вообще?! У изображения есть пиксели, в них можно спрятать сдвиг яркости на одну единицу — глаз не заметит, а алгоритм считает. У текста НЕТ пикселей. Есть только буквы, и они у всех на виду, блин.
Разгадка в том, что модель никогда не “печатает” текст, как машинистка. Она на каждом шаге держит в голове список кандидатов на следующее слово — с вероятностями. Вот в этом зазоре, между несколькими одинаково уместными словами, и существует технология.
Секретный ключ, известный только Anthropic, на каждом шаге делит список кандидатов на две произвольные группы — условно «зелёные» и «красные» — и слегка подталкивает модель выбирать из зелёных чуть чаще, чем предписывает случайность. Не запрещает красные — просто чуть занижает им шанс, так, незаметно. Один такой выбор — шум, ни о чём не говорящий. Но за тысячу слов текста накапливается статистическое смещение, которое у человека, не знающего ключа, просто невозможно случайно повторить с такой регулярностью.
Кто-то сравнил это с игральным кубиком: после двух бросков нельзя сказать ничего, но если из тысячи бросков шестёрка выпадает подозрительно часто — вот тебе и подкрутка.

Технология эта не изобретение Anthropic — открыл её ещё коллектив Kirchenbauer et al. в 2023-м, а до массового производства довёл Google со своим SynthID, который метит текст, изображения, видео и даже аудио в Gemini ещё с 2024 года. У OpenAI, кстати, есть собственная похожая разработка авторства Скотта Ааронсона — просочилась из его блога ещё в бытность работы над безопасностью в OpenAI, но публично так и не задеплоена в ChatGPT.


Anthropic технические детали своей реализации (хэш-функцию, долю «зелёных» токенов, политику ротации ключей) не раскрыла. Выглядит как элемент безопасности («security by design»), но по факту это ровно то же самое, что заставило независимых исследователей строить свои реконструкции по аналогии с SynthID, а не по прямому описанию.

Бумага из Фабриано
Тут будет уместно вспомнить одну штуку, которая делает всю историю куда объёмнее, чем кажется. Идея «спрятать метку так, чтобы её не увидел глаз, но мог считать посвящённый» — не изобретение века нейросетей, отнюдь. В 1282 году бумажные мельницы итальянского городка Фабриано начали вдавливать в мокрую бумажную массу крошечные символы — рог, крест, три горы. В обычном свете их не видно. Только если поднести лист к свету, силуэт проступает.
Разница принципиальная, и в ней, собственно, вся суть современной дискуссии. Мельник в Фабриано ставил подпись добровольно — он ручался за качество своего листа, и покупатель знал, к кому идти с претензией, если бумага окажется бракованной. Водяной знак был обещанием мастера. А метка, которую сегодня вплетает Claude, работает наоборот: это след, оставленный без ведома того, кто пишет. Она ничего не гарантирует про качество и достоверность текста. Она говорит только одно: этот текст (или часть его) прошёл через конкретную систему. Вот так-то.
И раз уж заговорили про шпионские штуки: уместно вспоминают и Геродота, которому обрили голову, вытатуировали послание на коже черепа и отправили в путь, дождавшись, пока волосы отрастут заново. Стражники ничего не нашли, потому что искали письмо, а не гонца. Прямая параллель с современными невидимыми метками — только раньше секрет прятал сам отправитель ради собственной защиты, а сегодня секрет прячут от автора текста третьи лица. Ну не чудо ли?
Паника, мемы, злость
Как только новость разлетелась, соцсети взорвались в лучших традициях жанра.
На Reddit разгорелась настоящая битва мнений. В r/artificial называли новую систему маркировки «заговором, призванным навредить пользователям чат-ботов по всему миру» . Логика автора такая: продвинутый пользователь легко скроет следы использования ИИ, а вот обычный студент, который просто попросил Claude переформулировать абзац, или журналист, попросивший ужать двухсотстраничную стенограмму — попадётся. Цифровая татуировка на лбу.
Отдельная линия критики — этическая, и её тоже стоит проговорить честно. Пользователь, назвавший маркировку неэтичной и отвратительной задал вопрос, который на самом деле неглупый: если я дал промпт, контекст, приоритеты и десятки итераций правок, а Claude был лишь инструментом — на что именно претендует метка, когда её ставят на сгенерированный код? Вопрос авторства в эпоху copilot- подобных инструментов — штука реально мутная, и однозначного ответа тут нет ни у кого, включая саму Anthropic.
Взломал ли опенсорс защиту?
Вот здесь притормозим, потому что заголовки коварны.
«Community responded in 24 hours» — да, буквально в течение суток на GitHub появился watermarks-remover от Гийома Мейера, основателя Memo. Штука реально взлетела: больше 4500 звёзд.
Но вот что важно: автор признался сам — на текущий момент инструмент чистит только юникодный мусор и метаданные файлов, а не сам статистический водяной знак. Стирание настоящей метки, по его словам, «может появиться позже», но пока не готово. В README к проекту он идёт дальше и объясняет, почему полноценный «магический ластик» — вообще идея сомнительная: чтобы стереть статистическую метку, нужно переписать значительную часть текста через другую модель, а это заменяет словарный выбор дорогой топовой модели на выбор более дешёвой — и итоговое качество ограничено потолком той самой более слабой модели. Зачем платить за премиум-модель, если потом всё равно прогонять её вывод через что-то похуже? НУ СЕРЬЁЗНО?
Появились и коммерческие сайты-однодневки — claudewatermark.com, claudewatermark.rip, gptcleanup.com, claudewatermarkremover.app — обещающие «чистый, недетектируемый текст». Крупный сервис StealthGPT, который в принципе специализируется на обходе детекторов, добавил себе страницу про удаление меток Claude. Другой сервис, Human Writes, честно продающий обход Turnitin и GPTZero для студенческих работ, тоже подключил Claude в список поддерживаемых, при этом в подвале сайта скромно приписав, что использовать его нужно «в соответствии с политикой академической честности». Да, примерно как продавать отмычки с гарантией «только для законного вскрытия собственной двери». Ага, конечно.
Ключевая мысль: НИ ОДНО из заявлений об эффективности удаления метки нельзя сейчас проверить, потому что Anthropic не опубликовала детектор. Проверять снятие метки попросту НЕ С ЧЕМ — эталона нет ни у кого, кроме самой компании.
Паскуале Пиллитери, вместо того чтобы верить обещаниям в README, склонировал главные проекты и прочитал сам код. Итог неутешительный: один из популярных текстовых «чистильщиков» пропустил самый распространённый способ скрытой закладки насквозь — скрытая полезная нагрузка декодировалась обратно целиком уже после того, как инструмент якобы почистил текст.
Пока что рынок «удалятелей меток» — это в основном чистка Unicode-мусора иметаданных файлов (тоже реально работает, но метаданные и без всякого хака слетают при любой пересохранении или скриншоте). А до настоящего статистического водяного знака добраться пока не удалось никому доказуемо — просто потому что нечем измерить успех. C’est la vie.
Так почему же водяные знаки в тексте в принципе так уязвимы
А вот здесь начинается настоящая физика вопроса. Дело не в том, что кто-то плохо спроектировал систему Anthropic. Ведь у текстовых водяных знаков есть фундаментальное ограничение.
Каждое слово получает свою «зелёную» или «красную» окраску на основе небольшого контекста — обычно нескольких предыдущих слов. Это значит, что метка живёт исключительно в непрерывных кусках оригинальной формулировки. Стоит переформулировать фразу — контекст меняется и старая окраска слова больше не действует. Метка не «размазывается» по смыслу, она в буквальном смысле привязана к конкретным словам в конкретном порядке.
Один из авторов declaude, протестировал это на открытых реализациях (схемы KGW и EXP из библиотеки MarkLLM) и получил проверяемую цифру: после полного переписывания смысла своими словами выживает примерно 0,5% исходных «окон» текста, а точность детектора падает с почти стопроцентной до банального подбрасывания монетки. Вот, собственно, наглядная табличка, что происходит с меткой при разных способах удаления:
Метод удаления | Что происходит с меткой |
|---|---|
Лёгкая правка (пара слов) | Метка ослабевает, но легко восстанавливается — детектор снова уверенно распознаёт текст примерно после 800 токенов (около 600 слов) |
Перевод на другой язык и обратно | Метка практически полностью теряется |
Полное переписывание смысла своими словами | Метка стирается почти целиком — 0,5% сохранившихся окон контекста |
Перефразирование через слабую LLM | Метка стирается, но качество текста падает до уровня модели-прачечной |

Но чтобы не скатиться в другую крайность, и тут тоже не всё так однозначно —. Команда Kirchenbauer et al. в своей работе для ICLR 2024 показала обратное: при определённых условиях сигнал держится куда устойчивее, чем интуитивно кажется — оставаясь детектируемым в среднем после примерно 800 токенов даже при сильном перефразировании человеком, а не машиной. То есть лёгкая правка своими руками — совсем не гарантия чистоты. Парадокс в том, что чем устойчивее метка к редактуре (что вроде бы хорошо для надёжности системы), тем выше риск, что она прилипнет к тексту, смысл которого уже сильно изменился — вплоть до клеветнического или ложного. Это подметили ещё Pang и коллеги на NeurIPS 2024: робастная метка может «переехать» на текст с несколькими точечными изменениями и остаться пришитой к контенту, который уже не отражает оригинал.
Ещё есть чисто математическая слабость небольших и «жёстких» текстов. Если у модели на каждом шаге реально есть выбор из нескольких равноценных слов — метку спрятать легко. А вот в коде, в таблицах, в списках дат, в имени, которое пишется ровно одним способом — выбирать особо не из чего. Меньше развилок — меньше места для сигнала. Поэтому короткий твит или строчка кода почти никогда не несёт надёжной метки, а вот длинное эссе — почти всегда (ну или почти).
Один из авторов провёл свлй эксперимент: сгенерировал у Claude Sonnet 5 пару абзацев про своих котов, прогнал через сторонний детектор Pangram — и получил вердикт «100% написано человеком». Захватывающая иллюстрация того, насколько это всё пока далеко от «безупречной технологии слежки», которую рисуют паникующие скриншоты в соцсетях.


Для сравнения — вот как выглядит принцип работы конкурирующей технологии Google, SynthID, с которой чаще всего сравнивают подход Anthropic:
(Официальное видео Google DeepMind про SynthID)
Независимый бенчмарк WaterPark дал ещё более наглядные цифры: SynthID-Text от Google распознавала нетронутый текст в 99,8% случаев. Но стоило прогнать тот же текст через один-единственный проход перефразирования — точность обнаружения по всем протестированным методам рухнула ниже 30%. Отдельное июльское исследование пошло дальше: после лёгкого переписывания, сохранившего смысл, два из тестированных методов не поймали вообще ничего — ровно ноль процентов.
(SynthID-детекция)
Удалением сигнала через «атаки»
Раз уж заговорили про снятие меток — стоит упомянуть работу под названием RLCracker, которая наделала шума ещё в 2025 году. Авторы обучили относительно небольшую модель на сотне примеров, без доступа к самой системе детекции, и заявили об удалении сигнала в 98,5% исследованных текстов — причём атака сработала сразу против десяти разных схем маркировки. Цифра впечатляющая, но интереснее не она сама, а скорость: закон обсуждают и согласовывают годами, а способ обойти техническую защиту иногда появляется через считаные недели после её внедрения. У того, кто хочет обмануть систему, есть встроенное преимущество — можно наблюдать за поведением системы и подстраиваться под неё, пока защита остаётся статичной.
Тут поневоле вспоминается вечный цикл «замок — отмычка — новый замок». Только вместо стальных дверей — миллиарды токенов текста, и вместо фомки — другая нейросеть.
Что всё это значит
Метка не значит «написано ИИ» — она значит «прошло через ИИ». Это КРИТИЧЕСКАЯ разница, и сама Anthropic прописала её в списке ограничений. Если вы попросили Claude вычитать грамматику в собственном тексте, перевести абзац или сделать суммаризацию документа — метка появится, даже если идеи, структура и сама суть текста целиком ваши. Обработка — это не авторство.
Отсутствие метки тоже ничего не доказывает. Модели до 2 августа 2026 года маркировки не имеют. Модели до 2 августа 2026 года маркировки не имеют. Альтернативные фронтиры, такие как Grok 4.6 или Qwen3.8 Max, пока тоже не внедрили подобные глобальные схемы. Сильно отредактированный, переведённый или смешанный с другим текстом контент может потерять метку естественным путём— просто в силу того, как устроена сама технология.
Короткие тексты почти не маркируются надёжно. Твит, заголовок, комментарий — статистике банально не хватает объёма, чтобы отличить настоящий сигнал от случайного шума.
Файлы — совсем другая история, чем текст. Изображения, PDF, презентации получают C2PA-метаданные — это открытый, проверяемый стандарт, но он слетает от банальной пересохранки, конвертации формата или простого скриншота. То, что работает для картинки, не работает для текста, и наоборот.
Вместо заключения
И, возвращаясь к мельникам Фабриано: возможно, самый честный вывод из всей этой истории в том, что мы путаем два разных вопроса. Мы хотим знать, “писала ли это машина’ — но метка отвечает лишь на вопрос, что происходило внутри одной конкретной сессии одного конкретного инструмента. Кто придумал идею, кто выстроил аргумент, кто в итоге готов поставить своё имя под текстом и нести за него ответственность — эти вопросы метка никогда не решала и не решит. Она сигнал, а не подпись. И пока индустрия не разберётся, чего именно она хочет от «прозрачности» — процесса или ответственности, — водяные знаки так и останутся символическим жестом, который приятно провозгласить в пресс-релизе и почти невозможно довести до состояния настоящей защиты. Sapienti sat, как говорится.
Источники и дальнейшее чтение
Скрытый текст
How Claude marks AI-generated content — официальная документация Anthropic
AI ‘watermark removers’ flood the web. Almost none can prove they work — BleepingComputer
How AI text watermarking works — интерактивный разбор на declaude.org
Putting Claude’s watermarking to the test — независимое тестирование
The Watermark and the Stigma — исторический и этический разбор
Claude Got Invisible Watermarks. The Open-Source Community Responded in 24 Hours
Kirchenbauer et al., A Watermark for Large Language Models (ICML 2023)
Kirchenbauer et al., On the Reliability of Watermarks for Large Language Models (ICLR 2024)
Pang et al., No Free Lunch in LLM Watermarking (NeurIPS 2024)

