Мой блог
Расследование с AirTag раскрыло сканирование книг для обучения ИИ на складе Amazon

Журналистское расследование с использованием обычного маячка Apple AirTag за 29 долларов помогло проследить путь редкого издания до распределительного центра Amazon в Лас-Вегасе. Как выяснилось, масштабное сканирование книг для обучения ИИ ведется на этом секретном объекте, где сотрудники уничтожают физические экземпляры после оцифровки страниц. Данный факт напрямую опровергает предыдущие публичные заявления компании, отрицавшей уничтожение печатных изданий в процессе работы с текстами.
Репортер Эмануэль Майберг спрятал трекер внутри одного из примерно тысячи томов, приобретенных через торговую площадку Biblio, которая гарантирует покупателям анонимность. Букинист согласился принять участие в эксперименте после того, как заметил подозрительно крупные заказы, где выбранные наименования никак не были связаны между собой. Продавец сразу заподозрил, что литература скупается вовсе не для перепродажи, а именно для извлечения данных.
Как трекер привел к секретному центру сканирования в Лас-Вегасе
В течение нескольких недель геоданные с устройства фиксировали перемещение посылки через четыре американских штата. Сначала груз отправили самолетом в Милуоки, откуда он направился в распределительный центр около Кеноши в Висконсине, где пробыл две недели. Затем грузовой автомобиль перевез его на запад с ночной остановкой в Гранд-Джанкшене, штат Колорадо. Финальной точкой маршрута стал северный сектор крупного комплекса Amazon под названием LAS8, расположенного на северо-востоке Лас-Вегаса.
По информации сотрудников на специализированном онлайн-форуме, сам комплекс LAS8 специализируется главным образом на печати книг по требованию, однако в его северной части располагается обособленное подразделение VGT3. На входе в этот отдел красуется изображение тираннозавра рекса, держащего раскрытую книгу. Один из работников прямо охарактеризовал специфику работы предприятия: «Всё, что мы делаем, — это сканируем книги». Другие сотрудники подтвердили постоянный приток огромных книжных партий. Чтобы ускорить процесс оцифровки, персонал срезает у изданий корешки, а после завершения сканирования страниц выбрасывает бумажные экземпляры в мусор.
Перед началом процесса в VGT3 сотрудники сканируют штрихкод ISBN каждого тома. Это позволяет автоматически формировать единый реестр уже обработанных наименований. Подобный учет помогает персоналу оперативно выявлять еще не оцифрованные экземпляры и концентрировать усилия именно на них.
Реакция Amazon и причины повышенного спроса на литературу до 2022 года
В своем единственном публичном комментарии представители корпорации предпочли обойти стороной тему искусственного интеллекта. Пресс-секретарь заявил, что компания «приобретает книги по коммерческим каналам» для разработки и совершенствования собственных продуктов и услуг, однако оставил без ответа вопрос о дальнейшей судьбе физических экземпляров после их сканирования.
Конкурентные разработчики алгоритмов заняли более определенную позицию. В частности, компания Anthropic открыто заявляла, что ее методы сбора данных исключают покупку и уничтожение редких или антикварных изданий, аналогичную позицию публично озвучивала и xAI. Со стороны Amazon подобных гарантий предоставлено не было.
Продавец, спрятавший маячок в посылке, охарактеризовал проданную литературу скорее как нишевый и медленно реализуемый товар, нежели как коллекционную редкость. «У вещей бывает разная ценность», — отметил букинист, имея в виду историческую и сентиментальную значимость экземпляров, которую полностью игнорируют любые автоматизированные алгоритмы.
Интерес IT-гигантов к литературе, изданной до 2022 года, обусловлен феноменом так называемого коллапса моделей. Он возникает тогда, когда нейросети слишком долго обучаются на текстах, созданных другими искусственными интеллектами, что со временем приводит к потере точности и обеднению языкового разнообразия. Проведенное в июле 2024 года исследование ученых из Оксфорда, Кембриджа и Имперского колледжа Лондона зафиксировало эту тревожную тенденцию. Дополнительный анализ аналитиков Ahrefs показал, что к апрелю 2025 года почти 74,2 процента из почти 900 тысяч новых интернет-страниц уже содержали контент, сгенерированный нейросетями.
Ситуацией пытались воспользоваться коммерческие посредники. Компания ISBNdb, занимающаяся сбором метаданных изданий, некоторое время продвигала печатные книги до 2022 года как чистый материал, свободный от искусственного контента и риска отравления обучающих баз данных. Соответствующая маркетинговая страница была удалена в июле 2026 года, после чего руководство фирмы пояснило, что это был лишь эксперимент для оценки реального рыночного спроса.
Компания Anthropic реализовывала собственную внутреннюю инициативу под названием Project Panama. Ею руководил Том Турви, ранее возглавлявший направление партнерских программ в Google Books. Процесс был устроен схожим образом: у печатных изданий срезали корешки, сканировали страницы, а сами оригиналы уничтожали. В июле 2026 года Anthropic завершила урегулирование спора об авторских правах, выплатив около 3 000 долларов за каждое произведение в рамках коллективного иска, охватившего 482 460 наименований. Эта сумма стала крупнейшей известной компенсацией по делам подобного рода в США. Тот же судебный процесс затронул свыше семи миллионов книг, которые Anthropic получила из пиратских источников, включая Library Genesis и Pirate Library Mirror.
В июне 2025 года окружной судья США Уильям Алсуп вынес решение о том, что перевод легально приобретенной физической книги в цифровой файл для обучения алгоритмов квалифицируется как преобразующее добросовестное использование в рамках закона об авторском праве. Данное постановление было принято судом первой инстанции, не обжаловалось в вышестоящих инстанциях и не имеет обязательной юридической силы за пределами данной юрисдикции. В то же время в майском отчете Бюро авторского права США за 2025 год отмечалось, что коммерческое обучение ИИ далеко не всегда автоматически подпадает под категорию добросовестного использования.
Действующее законодательство не обязывает покупателей книг раскрывать свою личность или цели приобретения. Доктрина первой продажи позволяет законным владельцам распоряжаться купленными физическими экземплярами по собственному усмотрению. В совокупности с решением судьи Алсупа это означает, что подобные структуры могут продолжать деятельность, формально не нарушая американское авторское право. Авторы, чьи подержанные книги скупают и оцифровывают, не получают никаких уведомлений и компенсаций.
Международные правовые ограничения
За пределами Соединенных Штатов правовые стандарты регулирования существенно отличаются. Эксперт по интеллектуальной собственности из Оксфордского университета отметил, что британское законодательство требует обязательного согласия правообладателей как на формирование наборов данных для обучения, так и на запуск самого тренировочного процесса. В Великобритании отсутствует прямая аналогия доктрины добросовестного использования. Представители немецкой ассоциации издателей и книготорговцев заявили, что массовое сканирование литературы для нужд искусственного интеллекта нарушает законы Германии об авторском праве независимо от того, легальным ли путем были получены бумажные носители.
С аналогичными судебными исками сталкиваются и другие разработчики технологий искусственного интеллекта. В июле 2026 года издательства Hachette Book Group, Cengage Learning, Elsevier и писатель Скотт Туров подали иск против Google в федеральный суд Нью-Йорка. Претензии касались обучающих данных для языковой модели Gemini: истцы утверждали, что корпорация удаляла или изменяла информацию об авторских правах в использованных материалах. Отдельное внимание привлекла дочерняя компания Amazon — Twitch, которая 12 августа 2026 года ввела настройку отказа от использования контента для обучения генеративных моделей после того, как пользователи выяснили, что по умолчанию все аккаунты были подписаны на это автоматически.
Сама корпорация Amazon официально не подтвердила, что оцифрованные тома направляются на нужды ИИ, ограничившись лишь общими комментариями о закупках через «коммерческие каналы» без разъяснений о дальнейшей судьбе физических изданий. Масштабы деятельности объекта VGT3, включая общее количество обработанных наименований и конкретные нейросети, задействованные в проекте, остаются нераскрытыми. Расследование с использованием маячка позволило проследить путь лишь одной партии до специализированного предприятия, однако компания так и не предоставила публичных объяснений по поводу уничтожения литературы и не прояснила противоречия со своими прежними заявлениями.
Источник: ghacks.net

