трёхлетнего судебного процесса, инициированного The New York Times против OpenAI и Microsoft, были обнародованы неотредактированные фрагменты иска. В них приводятся внутренние высказывания руководителей обеих компаний, которые расходятся с публичной позицией о добросовестном использовании (fair use). В частности, директор по прикладной науке Microsoft Брент Хехт в январе 2023 года назвал практику обучения ИИ «ошеломляющей кражей беспрецедентных масштабов» и «крупнейшей кражей труда в истории человечества».

Согласно материалам иска, OpenAI и Microsoft получали контент издателей через массовый скрапинг, обход пейволов и удаление уведомлений об авторских правах. Средние датасеты OpenAI содержат более 91 692 копий произведений, опубликованных NYT, Daily News и Center for Investigative Reporting. Датасет, производный от Common Crawl, включал более 2 млн документов только с nytimes.com. Кроме того, инициатив Project Taxi и Project Mango компании обменивались тренировочными данными; датасет Project Mango содержит как минимум 160 903 уникальных произведения от новостных издателей.

ПоказательЗначение
Копий произведений NYT, Daily News и CIR в средних датасетах OpenAI91 692+
Документов с nytimes.com в датасете Common Crawl2 000 000+
Уникальных произведений в датасете Project Mango160 903
Падение переходов на NYT из Copilot по сравнению с Bingдо 93%

Особое внимание в иске уделяется влиянию ИИ-продуктов на рынок оригинального контента. Внутренние данные Microsoft показывают, что «движок ответов» Copilot снизил переходы на домен The New York Times на 93% по сравнению с традиционным поиском Bing. В презентации Хехта это названо «циклом гибели» (doom loop), который «навредит производительности наших моделей и всей сети одновременно». Глава Microsoft Сатья Наделла на допросе в этом году заявил, что «всё, что находится за пейволлом, должно лицензироваться любым, кто хочет использовать это для заземления или обучения», и что он потребовал бы от OpenAI переобучить модели, если бы знал о скрапинге закрытого контента.

В средних датасетах OpenAI обнаружено более 91 692 копий произведений NYT, Daily News и Center for Investigative Reporting.

Image Credits:Justin Sullivan / Getty Images
Image Credits:Justin Sullivan / Getty Images · Источник: TechCrunch AI

Руководство OpenAI также признавало угрозу для издателей. Глава ChatGPT Ник Тёрли писал во внутренней переписке, что продукты вроде чат-бота представляют «экзистенциальную угрозу» для издателей, поскольку «в значительной степени замещают» их и «будут замещать всё больше по мере улучшения». Президент OpenAI Грег Брокман описывал модели как «отлично справляющиеся с новостями». Наделла под присягой согласился, что общение с чат-ботами «заместило переход на сайт-источник». В документе Microsoft указано, что существует «реальный риск» значительного нарушения занятости людей, создавших данные для обучения фундаментальных моделей.

Юридически вопрос об использовании авторских материалов для обучения ИИ остаётся открытым. Суды в основном встают на сторону ИИ-компаний, признавая обучение добросовестным использованием. Однако новые признания могут подорвать эту защиту, особенно в части требования fair use о том, что использование не должно замещать оригинал или вредить его рынку. Ранее в этом месяце администрация Трампа подала заключение в защиту нелицензионного использования OpenAI. Рассекреченный иск усиливает давление на обе компании и может повлиять на исход дела.