В начале месяца Anthropic объявила, что будущие версии языковой модели Claude будут генерировать текст с водяными знаками, позволяющими отличить его от человеческого. Компания не раскрывала деталей, но в выходные в блоге появилось объяснение: водяной знак будет встроен в сам процесс генерации текста, а не добавлен в виде скрытых символов или метаданных.
Механизм основан на изменении источника случайности при выборе слов. Обычно модель выбирает следующее слово из вероятностного распределения, используя генератор случайных чисел. Водяной знак заменяет этот генератор на ключ, известный только Anthropic. Ключ определяет, какие из «низкозатратных» синонимов будут выбраны, создавая паттерн, который можно проверить. Например, в предложении «Погода сегодня была холодной и…» модель может выбрать «серой» или «пасмурной» — оба слова уместны, и выбор кажется случайным. Водяной знак делает этот выбор предсказуемым для того, кто знает ключ, но не для читателя.
Anthropic утверждает, что водяные знаки не влияют на качество текста: «Внутреннее тестирование показало отсутствие влияния на содержание, уровень креативности и читаемость». Однако критики, включая журналиста Джона Грубера и академика Джеффа Джарвиса, считают иначе. Джарвис заявил, что Anthropic «обесценивает письмо», объявляя слова взаимозаменяемыми, а выбор — случайным. Грубер в эссе на Daring Fireball указал, что синонимы не всегда эквивалентны: «серый» и «пасмурный» могут нести разные коннотации в зависимости от контекста.
Механизм использует ключ для изменения источника случайности при выборе слов, что позволяет детектировать сгенерированный текст.

Проблема, поднятая критиками, выходит за рамки технической реализации. Anthropic описывает процесс письма как вероятностную игру, где выбор слов не имеет значения. Это противоречит пониманию письма как осмысленного акта, где каждое слово влияет на смысл и тон. Для писателей и журналистов такой подход выглядит как упрощение, игнорирующее нюансы языка.
Водяные знаки в тексте — часть более широкой дискуссии об идентификации ИИ-контента. Ранее Anthropic экспериментировала с метаданными, но отказ от них в пользу изменения выбора слов вызвал вопросы о прозрачности. Компания не раскрыла, когда именно водяные знаки появятся в Claude, но заявила, что они будут незаметны для читателей.
Реакция сообщества неоднозначна: одни видят в этом шаг к прозрачности, другие — попытку контролировать творческий процесс. Пока Anthropic настаивает на том, что качество текста не страдает, критики сомневаются, что алгоритм способен оценить стилистические нюансы. Вопрос о том, насколько этично изменять выбор слов ради маркировки, остается открытым.



