В подкасте 404 Media от 2 сентября 2026 года журналист Эмануэль представил продолжение своего расследования о том, как Amazon сканирует и уничтожает книги для обучения собственных ИИ-моделей. В этот раз ему удалось поговорить с человеком, который работал на складе Amazon, где происходит этот процесс. По словам собеседника, книги массово вскрываются, сканируются страница за страницей, а затем уничтожаются. Это не единичный случай, а системная практика, которая, судя по всему, напрямую связана с амбициями Amazon в области генеративного ИИ.

Amazon — один из крупнейших в мире продавцов книг, и у неё есть доступ к огромному количеству печатных изданий. Сканируя и оцифровывая книги, компания получает качественные текстовые данные для обучения больших языковых моделей (LLM). Подобные модели, такие как GPT-4 от OpenAI или Claude от Anthropic, обучаются на огромных массивах текста, и книги — один из самых ценных источников. Однако в отличие от открытых интернет-данных, книги защищены авторским правом, и их использование без разрешения правообладателей вызывает серьёзные юридические и этические вопросы.

Практика Amazon не уникальна: многие компании, разрабатывающие ИИ, сталкиваются с проблемой нехватки качественных данных и ищут обходные пути. Например, Meta и OpenAI также использовали книги для обучения, что привело к судебным искам со стороны авторов. В случае с Amazon ситуация усугубляется тем, что компания одновременно является и платформой для продажи книг, и разработчиком ИИ, что создаёт конфликт интересов. Авторы, чьи книги уничтожаются, не получают компенсации, а их произведения используются для создания конкурентных технологий.

Бывший работник склада подтвердил масштаб операции и описал процесс.

Collage: 404 Media.
Collage: 404 Media. · Источник: 404 Media

Пока Amazon официально не комментирует расследование 404 Media, но история уже вызвала широкий резонанс в индустрии. Эксперты отмечают, что подобные действия могут подорвать доверие к ИИ-разработкам и усилить давление на регуляторов с целью ужесточения законодательства об авторских правах. Для читателей и авторов это сигнал о том, что даже крупнейшие компании готовы игнорировать права интеллектуальной собственности ради технологического прогресса.

В том же выпуске подкаста обсуждались и другие темы: появление одних и тех же имён в ИИ-сгенерированных научных статьях, а также планы ICE по закупке данных о «фальсификациях на выборах». Эти сюжеты объединяет общая проблема — использование ИИ в чувствительных сферах без должного контроля и прозрачности.