Microsoft представила новые аргументы в судебном разбирательстве с издателями и авторами, утверждая, что её ИИ-ассистент Copilot крайне редко воспроизводит фрагменты защищённых авторским правом текстов. В документах, поданных в пятницу, компания ссылается на анализ 8,2 миллионов логов чатов Copilot, предоставленных эксперту, нанятому истцами. Согласно Microsoft, только 59 545 логов содержали не менее 16 слов, совпадающих с новостными материалами, использованными для обучения модели. Это менее 1% от общего числа проанализированных диалогов.
Эксперт, работающий по иску Центра журналистских расследований (CIR), обнаружил 51 случай «существенного совпадения» с материалами CIR в этом наборе данных. В отдельном иске от авторов книг, эксперт нашёл лишь 24 ответа Copilot, содержащих 30 и более совпадающих слов, при этом только 10 из 212 оценённых книг имели какие-либо совпадения. Microsoft подчёркивает, что даже в этих редких случаях воспроизведение не является полным и не может заменить оригинальный текст.
| Показатель | Значение |
|---|---|
| Всего логов Copilot | 8,2 млн |
| Логи с 16+ общими словами с новостями | 59 545 |
| Ответы с 30+ словами из книг | 24 |
| Книги с совпадениями (из 212) | 10 |
| Случаи «существенного совпадения» с CIR | 51 |
The New York Times, один из главных истцов, категорически не согласен с выводами Microsoft. Ведущий юрист издания Йен Кросби заявил: «Документы и показания, полученные в ходе discovery, ведут к единственному выводу: Microsoft и OpenAI украли у The New York Times, чтобы создать коммерческие продукты, заменяющие нашу журналистику, угрожающие нашему бизнесу и подрывающие нашу отрасль». Издание настаивает, что ответчики должны понести ответственность за предполагаемое нарушение авторских прав.
Анализ показал: 59 545 логов содержали минимум 16 слов, общих с новостным контентом, что составляет менее 1%.

Юридический спор начался с исков, поданных издателями, включая NYT, и авторами книг, которые утверждают, что Microsoft и OpenAI использовали их произведения для обучения больших языковых моделей (LLM) без разрешения, а теперь эти модели конкурируют с оригинальными текстами, иногда воспроизводя их фрагменты. Дела были объединены под одним судьёй для упрощения процесса, несмотря на возражения истцов. Microsoft добивается вынесения суммарного судебного решения, которое завершило бы дело на ранней стадии, утверждая, что использование материалов для обучения ИИ подпадает под доктрину fair use (добросовестного использования). Компания настаивает: даже если Copilot иногда воспроизводит текст, это «едва ли подрывает преобразующий характер обучения LLM».
На этой неделе администрация Трампа также подала заявление о заинтересованности в деле NYT, поддержав OpenAI. Если судья встанет на сторону издателей и авторов, судебное разбирательство продолжится, что может создать прецедент для всей индустрии ИИ. Исход дела определит, насколько свободно компании могут использовать авторские материалы для обучения моделей без лицензионных отчислений. Пока же Microsoft пытается доказать, что её продукты не являются заменой оригинальным произведениям, а лишь инструментом для генерации нового контента.



