Захований AirTag привів журналістів на склад Amazon, де знищують рідкісні книги для навчання ШІ

Amazon скуповує старі друковані книги, зрізає корінці й сканує сторінки для навчання штучного інтелекту. Паперові примірники після оцифрування знищують. Конвеєр виявили за допомогою AirTag, схованого в одній із приблизно 1000 рідкісних книг — мітка привела журналістів на склад компанії в Лас-Вегасі. Amazon підтвердила закупівлю книг, але не назвала моделі чи сервіси, для яких призначені отримані тексти.

Як повідомляє noworries.news, розслідування провів Емануель Майберг, журналіст і співзасновник 404 Media. У липні продавець рідкісних і вживаних книг отримав через платформу Biblio замовлення приблизно на 1000 видань. Biblio приховує особи покупців, а добірка виглядала підозріло: невідомий замовник зібрав мало пов’язані між собою книги, зокрема малотиражні й важкодоступні роботи. Редакція передала продавцю AirTag, який заховали всередині одного тому.

Мітка вилетіла з Каліфорнії до Мілуокі, провела два тижні на розподільчому складі біля Кеноші у Вісконсині, а потім поїхала на захід. Після нічної зупинки в Гранд-Джанкшені в Колорадо вантаж прибув на склад Amazon LAS8 у північній частині Лас-Вегаса — підрозділ VGT3, де за словами працівників приймають великі партії книг, зчитують штрихкоди, зрізають палітурки й сканують сторінки. Видалення корінця дозволяє швидко пропускати окремі аркуші через промислові сканери, але відновити книгу після обробки вже неможливо.

Amazon підтвердила, що купує книги через звичайні комерційні канали для розробки й покращення продуктів та сервісів, але не повідомила кількість придбаних примірників, дату запуску програми, призначення відсканованих текстів чи правила відбору рідкісних книг. Передачу матеріалів моделям родини Nova компанія теж не підтвердила.

Старі друковані видання дають розробникам якісні людські тексти, яких може не бути в інтернеті, і не містять матеріалів, згенерованих сучасними мовними моделями — а це важливо, бо повторне навчання на машинних текстах поступово погіршує якість алгоритмів. Запас якісного загальнодоступного людського тексту оцінюють приблизно у 300 трлн токенів, і за нинішніх темпів найбільші мовні моделі можуть повністю вичерпати цей обсяг з 2026 по 2032 рік — тож рідкісні книги стають цінним джерелом нових даних.

Реклама

Ви досі не підписані на телеграм-канал Літгазети? Натисніть, щоб підписатися! Посилання на канал

Схожу схему раніше використовувала Anthropic: у 2024 році компанія запустила Project Panama і витратила десятки мільйонів доларів на купівлю мільйонів вживаних книг, які підрядники обробляли гідравлічними машинами для зрізання палітурок. У червні 2025 року американський суд визнав добросовісним використанням навчання моделей Anthropic на законно куплених книгах, а в липні 2026-го затвердили угоду компанії з авторами на $1,5 млрд компенсацій за понад 482 000 творів.

Незвичні замовлення помічають продавці далеко за межами США — магазини Великої Британії, Ірландії, Австралії та континентальної Європи отримують заявки на сотні випадково підібраних видань. Розслідування поки не встановило точну кількість знищених книг, їхні назви чи наявність серед них унікальних примірників.