В Лас-Вегасе, на складе Amazon VGT3, который делит здание с типографией LAS8, происходит массовое сканирование книг для обучения искусственного интеллекта. Издание 404 Media опубликовало интервью с анонимным сотрудником, работавшим в этом цехе. Работник рассказал, что книги поступают партиями, у них срезают корешки, а страницы сканируют, после чего бумага смешивается в больших коробках — восстановить книгу уже невозможно.

Сотрудник описал процесс: книги привозят на грузовиках, распаковывают, складывают в пластиковые контейнеры, затем сканеры считывают штрихкоды, чтобы отсеять дубликаты. Ненужные экземпляры выбрасывают в отдельные коробки. По словам работника, организация хаотична: «Процесс менялся каждый день, они не были хорошо управляемы». Среди книг попадались как новые, так и списанные из библиотек, включая партии из Лондона и Японии, а также правительственные документы, представленные парламенту от имени королевы.

Этот репортаж — продолжение расследования 404 Media, которое ранее отследило партию редких книг, купленных анонимной ИИ-компанией, до склада VGT3. Журналисты встроили трекер в одну из книг и проследили её путь через всю страну. В интернете сотрудники Amazon уже описывали подобную работу: разрезание книг и сканирование страниц. Теперь анонимное интервью подтверждает, что операция идёт в промышленных масштабах.

В партиях были книги из библиотек, включая Университет Лондона, и правительственные документы.

The entrance to Amazon's VGT3 facility.
The entrance to Amazon's VGT3 facility. · Источник: 404 Media

Практика сканирования книг для ИИ не нова: компании вроде Meta и Apple уже сталкивались с исками за использование защищённых материалов в обучающих данных. Однако масштаб Amazon, который уничтожает физические книги, вызывает вопросы о соблюдении авторских прав и этике. Книги, включая библиотечные и правительственные документы, могут содержать охраняемый контент, а их уничтожение делает невозможным проверку источников. Amazon не комментирует, какие модели обучаются на этих данных и почему выбран такой метод.

Для читателя, впервые слышащего о теме, важно понимать: обучение больших языковых моделей требует огромных объёмов текста, и компании ищут любые источники. Сканирование книг — один из способов получить качественные данные, но он сопряжён с юридическими рисками. Например, группа авторов уже подавала иск против OpenAI и Meta за использование их книг без разрешения. Amazon, судя по всему, решила обойти проблему, уничтожая физические копии, что может быть попыткой скрыть следы. Однако такая тактика вряд ли защитит от претензий правообладателей.

Пока неизвестно, какие именно модели обучаются на этих данных и кто заказчик. Но сам факт, что Amazon, крупнейший книжный ритейлер, уничтожает книги ради ИИ, поднимает более широкий вопрос: готовы ли компании жертвовать культурным наследием ради технологического прогресса. Ответ, вероятно, будет найден в судах, но пока операция в Лас-Вегасе продолжается.