Microsoft представила новые аргументы в судебном разбирательстве с издателями и авторами, утверждая, что её ИИ-ассистент Copilot крайне редко воспроизводит фрагменты защищённых авторским правом текстов. В документах, поданных в пятницу, компания ссылается на анализ 8,2 миллионов логов чатов Copilot, предоставленных эксперту, нанятому истцами. Согласно Microsoft, только 59 545 логов содержали не менее 16 слов, совпадающих с новостными материалами, использованными для обучения модели. Это менее 1% от общего числа проанализированных диалогов.

Эксперт, работающий по иску Центра журналистских расследований (CIR), обнаружил 51 случай «существенного совпадения» с материалами CIR в этом наборе данных. В отдельном иске от авторов книг, эксперт нашёл лишь 24 ответа Copilot, содержащих 30 и более совпадающих слов, при этом только 10 из 212 оценённых книг имели какие-либо совпадения. Microsoft подчёркивает, что даже в этих редких случаях воспроизведение не является полным и не может заменить оригинальный текст.

ПоказательЗначение
Всего логов Copilot8,2 млн
Логи с 16+ общими словами с новостями59 545
Ответы с 30+ словами из книг24
Книги с совпадениями (из 212)10
Случаи «существенного совпадения» с CIR51

The New York Times, один из главных истцов, категорически не согласен с выводами Microsoft. Ведущий юрист издания Йен Кросби заявил: «Документы и показания, полученные в ходе discovery, ведут к единственному выводу: Microsoft и OpenAI украли у The New York Times, чтобы создать коммерческие продукты, заменяющие нашу журналистику, угрожающие нашему бизнесу и подрывающие нашу отрасль». Издание настаивает, что ответчики должны понести ответственность за предполагаемое нарушение авторских прав.

Анализ показал: 59 545 логов содержали минимум 16 слов, общих с новостным контентом, что составляет менее 1%.

STK259_MICROSOFT_COPILOT_2__B
STK259_MICROSOFT_COPILOT_2__B · Источник: The Verge AI

Юридический спор начался с исков, поданных издателями, включая NYT, и авторами книг, которые утверждают, что Microsoft и OpenAI использовали их произведения для обучения больших языковых моделей (LLM) без разрешения, а теперь эти модели конкурируют с оригинальными текстами, иногда воспроизводя их фрагменты. Дела были объединены под одним судьёй для упрощения процесса, несмотря на возражения истцов. Microsoft добивается вынесения суммарного судебного решения, которое завершило бы дело на ранней стадии, утверждая, что использование материалов для обучения ИИ подпадает под доктрину fair use (добросовестного использования). Компания настаивает: даже если Copilot иногда воспроизводит текст, это «едва ли подрывает преобразующий характер обучения LLM».

На этой неделе администрация Трампа также подала заявление о заинтересованности в деле NYT, поддержав OpenAI. Если судья встанет на сторону издателей и авторов, судебное разбирательство продолжится, что может создать прецедент для всей индустрии ИИ. Исход дела определит, насколько свободно компании могут использовать авторские материалы для обучения моделей без лицензионных отчислений. Пока же Microsoft пытается доказать, что её продукты не являются заменой оригинальным произведениям, а лишь инструментом для генерации нового контента.