Отличить текст, написанный человеком, от созданного ИИ, часто невозможно. Но с 2 августа 2026 года Закон ЕС об ИИ требует маркировать такой контент. Anthropic отвечает на это требование, внедряя невидимые водяные знаки в свои модели Claude. Они позволяют определить вероятность участия ИИ в генерации, при этом не влияя на качество, содержание или стоимость выходных данных.
Основная цель водяных знаков — установить вероятность того, что текст был создан моделью Claude. Это изменение соответствует Закону ЕС об ИИ, который обязывает провайдеров, работающих на европейском рынке, маркировать контент, сгенерированный ИИ. Anthropic, как и около 190 других организаций, в июле 2026 года подписала Кодекс практики ЕС по прозрачности контента, созданного ИИ. На данный момент водяные знаки применяются глобально, поскольку пока нет возможности ограничить их использование по регионам.
Метод работы водяного знака основан на том, как языковые модели генерируют текст: слово за словом, выбирая из списка потенциальных кандидатов. Когда существует несколько подходящих слов (например, «пасмурно» или «серо»), модель делает выбор. Вместо случайного выбора, водяной знак использует специальный ключ и несколько предыдущих слов, чтобы повлиять на этот «неважный» выбор. Получающийся в итоге паттерн незаметен для читателя, но может быть обнаружен с помощью этого ключа. Модель при этом не выбирает слова, которые она не использовала бы в обычных обстоятельствах. В основе подхода лежит метод SynthID-Text, опубликованный Google DeepMind в 2024 году.
Внутренние тесты Anthropic, а также независимые исследования Google DeepMind на трафике Gemini, показали, что водяные знаки не влияют на качество, содержание, креативность или читабельность текста Claude. Использование водяных знаков не добавляет лишних токенов, не увеличивает стоимость генерации и оказывает минимальное влияние на скорость работы моделей. Важно, что водяной знак не содержит никакой идентифицирующей информации и не может быть связан с конкретным пользователем или его перепиской.
Однако у водяных знаков есть ограничения:
- Определение источника — они лишь указывают на вероятность участия Claude в создании текста, но не могут подтвердить, что текст написан человеком или другой ИИ.
- Длина текста — эффективность снижается на коротких фрагментах, где модель делает меньше выборов.
- Фактологические тексты — в текстах, где требуется точная формулировка (например, «Principia Mathematica»), водяной знак практически не применяется.
- Редактирование и код — при легком редактировании человеческого текста или генерации кода (где важна точность), водяной знак может быть слишком разреженным. Однако он может присутствовать в комментариях к коду.
Anthropic планирует выпустить API для проверки водяных знаков. Для изображений и других файлов (PNG, JPG, SVG) используется стандарт C2PA: в метаданные файла добавляется криптографически подписанное примечание о том, что файл был создан или обработан Claude. Легкое редактирование текста не удалит водяной знак полностью, но полная переработка, при которой заменяется каждое слово, сделает его необнаружимым. Водяной знак не влияет на авторские права или юридическую ответственность пользователя. Переводы, выполненные Claude, также будут маркироваться.
Внедрение водяных знаков в Claude показывает, что обязательная маркировка AI-контента технически возможна без вреда для генерации. Однако система имеет свои ограничения, а её эффективность зависит от готовности пользователей к изменениям. Anthropic обещает выпустить API для проверки водяных знаков, но открытым остаётся вопрос, насколько легко будет обходить эту защиту.