Anthropic в пятницу опубликовала пост в блоге, отвечая на основные вопросы о том, как будет маркировать текст, сгенерированный её чат-ботом Claude. Компания пояснила механизм водяных знаков, возможность их скрытия редактированием и влияние на код. Решение вызвало дискуссии среди пользователей после того, как на этой неделе Anthropic объявила о внедрении маркировки для соответствия Кодексу прозрачности ЕС по ИИ, который требует от компаний использовать системы, позволяющие идентифицировать контент, созданный ИИ.
В новом посте Anthropic объясняет, что при выборе «малозначимых вариантов» — например, между словами «overcast» и «grey» для описания погоды — Claude может создавать паттерн в ответах, который «незаметен для читателя, но обнаружим для любого, у кого есть ключ для его кодирования». Компания утверждает, что водяные знаки не влияют на качество ответов: «Для читателя маркированный ответ неотличим от немаркированного».
Anthropic использует подход SynthID-Text, разработанный командой Google DeepMind в 2024 году, и планирует выпустить API для обнаружения водяных знаков. Компания также подчёркивает различие между водяными знаками и методами детекции ИИ, такими как у Pangram, которые ищут характерные конструкции в тексте: «Обнаружение таких паттернов принципиально отличается от проверки водяного знака».
Водяные знаки не влияют на качество ответов и незаметны для читателей.

На вопрос, можно ли скрыть водяной знак переписыванием, Anthropic отвечает, что лёгкое редактирование, вероятно, не удалит его полностью, а полная замена каждого слова — да. В последнем случае компания сомневается, можно ли такой текст считать сгенерированным ИИ. Для текста, лишь проверенного или отредактированного Claude, наличие водяного знака зависит от длины текста и степени вмешательства: при лёгком редактировании «почти все слова» написаны человеком, и водяному знаку не за что зацепиться.
Код будет содержать меньше водяных знаков, поскольку модель должна создавать рабочий код и не имеет свободы выбора между эквивалентными вариантами. Однако в комментариях или произвольных именах переменных водяной знак может применяться, но его влияние на код будет незначительным. Anthropic также отмечает, что другие крупные разработчики моделей подписали тот же Кодекс практики и внедрят собственные водяные знаки.
Реакция пользователей неоднозначна: на Reddit один пользователь назвал это «заговором против невинных пользователей Claude», другой заявил, что «единственная причина не хотеть этого — желание лгать людям». Business Insider сообщает, что «десятки» пользователей на X заявили об отмене подписок на Claude.



