Крупнейшие музыкальные издатели — Sony, EMI и Warner Chappell — подали иск против Anthropic, разработчика языковых моделей Claude. Они утверждают, что компания незаконно использовала «тысячи» музыкальных произведений, включая ноты и тексты песен, для обучения своих ИИ-систем. Иск подан в пятницу, и его детали раскрывают масштаб предполагаемого пиратства, которое, по мнению истцов, началось ещё в 2021 году.
Согласно иску, соучредитель Anthropic Бенджамин Манн лично использовал BitTorrent для загрузки и распространения миллионов пиратских книг из Library Genesis (LibGen) — нелегальной библиотеки, которая была закрыта ФБР в конце 2021 года. Однако её содержимое было скопировано в новую библиотеку Z-Library, а затем и в «Pirate Library Mirror» (PiLiMi). Внутренние сообщения, вскрытые в ходе другого судебного разбирательства с авторами книг, показывают, что Манн поручал сотрудникам торрентить PiLiMi, а один из них ответил: «zlibrary my beloved». Издатели считают это доказательством того, что Anthropic сознательно полагалась на пиратские источники для получения данных.
Издатели утверждают, что в результате Anthropic получила доступ к сотням книг, содержащих ноты и тексты песен, включая сборники произведений The Beatles и Тейлор Свифт. Они также заявляют, что Anthropic может использовать эти материалы для генерации текстов, имитирующих стиль известных исполнителей, например, превращая тексты Эминема в песни в стиле Бейонсе. Это, по мнению истцов, наносит ущерб авторам, которые конкурируют с ИИ-сгенерированными работами в музыкальных чартах.
Истцы утверждают, что Anthropic торрентовала материалы из пиратских библиотек LibGen и PiLiMi, включая книги с нотами и текстами.

Anthropic отрицает, что использовала пиратские книги для обучения коммерческих моделей Claude. Однако издатели указывают на лазейку: даже если модели не обучались напрямую на этих данных, они могли использовать «синтетические данные», созданные некоммерческими моделями, которые, в свою очередь, обучались на LibGen и PiLiMi. Кроме того, недавно рассекреченные документы показывают, что Anthropic продолжала использовать набор данных LibGen для проверки выходных данных на совпадение с исходным текстом, что может считаться формой обучения.
Этот иск — часть более широкой волны судебных разбирательств против разработчиков ИИ за использование защищённых авторским правом материалов. Ранее Anthropic урегулировала спор с авторами книг, выплатив $1,5 млрд, но музыкальные издатели считают эту сумму недостаточной, учитывая оценку компании в $2 трлн. Они требуют судебного запрета на использование пиратских материалов и возмещения ущерба. Исход дела может установить важный прецедент для всей индустрии ИИ, определяя, какие данные можно использовать для обучения моделей без разрешения правообладателей.



