Amazon koopt op grote schaal gedrukte boeken op, snijdt de rug eraf om ze te scannen voor AI-trainingsdata en houdt daarna alleen het digitale bestand over. Dat blijkt uit onderzoek van 404 Media, dat een tracker in een zeldzaam boek stopte en dat door het land volgde tot bij een Amazon-faciliteit.
Voor wie waardevolle content bezit verschuift daarmee de vraag. Twee jaar lang ging het gesprek over de online kopie: een regel in robots.txt, een blokkade voor AI-crawlers, een clausule in je gebruiksvoorwaarden. Geen van die knoppen doet nog iets zodra hetzelfde materiaal als gedrukt exemplaar op de tweedehandsmarkt ligt en gewoon wordt afgerekend. Een opt-out werkt alleen daar waar jij de server beheert.
Wat de tracker liet zien
De zending eindigde bij VGT3, een Amazon-loods in Las Vegas die als teamsymbool een dinosaurus met een boek in zijn klauwen voert. Medewerkers snijden daar de band van de rug los zodat het scannen sneller gaat, en het gescande materiaal gaat volgens The Decoder naar Amazons eigen Nova-modellen. Het boek zelf overleeft die bewerking niet.
Amazon bevestigt de aankopen, maar niet de rest. Het bedrijf zegt boeken via commerciële kanalen te kopen om de producten en diensten van klanten te verbeteren. Over wat er daarna met die boeken gebeurt, staat in die verklaring niets.

Waarom juist oude gedrukte boeken
Gedrukt werk van voor 2022 is om twee redenen aantrekkelijk. Het staat vaak nergens online, dus scrapen levert het niet op. En het kan onmogelijk door een AI zijn geschreven, wat modellen behoedt voor de kwaliteitsterugval die ontstaat als ze op hun eigen uitvoer worden getraind. Boekhandelaren zien AI-bedrijven daarom per ISBN inkopen, alsof het doel is elk ooit gepubliceerd boek te digitaliseren.
Amazon is niet de enige. Destructief scannen is inmiddels ook gedocumenteerd bij Meta, Google, Microsoft, OpenAI en Anthropic, dat onder de naam Project Panama boeken opkocht en versneed.
Een spreadsheet met 3.001 ISBN-nummers
Die inkoopgolf bereikte Nederland al eerder deze zomer. Antiquaar Pieter de Vries uit Haarlem kreeg een verzoek van een bedrijf dat zich 2077AI noemt, met een lijst van 3.001 titels, vooral academische uitgaven uit 2020 en 2021 van Emerald, Elsevier, Wiley, Routledge en Oxford University Press. Hij hield het voor spam of phishing. Meerdere Nederlandse collega's kregen dezelfde mail, en de verzendinstructies wezen naar China.
De schaal daarvan is geen toeval. ISBNdb, dat de metadata achter boekbarcodes beheert, adverteert volgens 404 Media met bulkinkoop voor AI-labs in orders van duizend tot een miljoen boeken. Wie een vakuitgave, een studieboek of een rapport in druk heeft staan, kan dus al op zo'n inkooplijst staan zonder dat er ooit een verzoek langskwam.
Waarom dit juridisch werkt
De route is in de Verenigde Staten getest. In de zaak tegen Anthropic oordeelde een rechter dat het scannen van rechtmatig gekochte boeken onder fair use viel, mede omdat de originelen werden vernietigd en niet als tweede exemplaar verder circuleerden. Anthropic betaalde uiteindelijk 1,5 miljard dollar, ongeveer 3.000 dollar per boek voor zo'n 500.000 werken, maar dat ging over de zeven miljoen gepirateerde boeken in zijn interne bibliotheek, niet over de gekochte exemplaren. Kopen en versnijden bleek het legale pad, downloaden het dure.
Europese rechthebbenden proberen het langs de rechter. Uitgevers als Hachette, Cengage en Elsevier klagen Google aan omdat Gemini op miljoenen boeken zou zijn getraind zonder toestemming. Alleen raakt zo'n zaak de digitale kopie. Tegen een inkooporder op de tweedehandsmarkt biedt hij weinig.
Waar dit heen wijst
De AirTag maakte zichtbaar wat al maanden liep: de inkoop van trainingsdata is deels verhuisd van het web naar de fysieke markt, waar geen enkele technische instelling geldt. Bescherming van content wordt daarmee minder een serverkwestie en meer een contractuele. Precies daarop zetten Nederlandse uitgevers in met Bookpact.ai, waar een uitgever per titel bepaalt of, hoe lang en tegen welke vergoeding een AI-bedrijf een boek mag gebruiken.
De andere kant beweegt intussen ook. Bij Twitch, net als deze scanoperatie onderdeel van Amazon, stond het trainen van AI op streams, clips en chats van makers meteen aan voor bestaande accounts. Online is de standaard opt-out, offline is er niet eens een schakelaar. Wie iets bezit dat de moeite waard is om te scannen, kan dat alleen nog sturen door vooraf vast te leggen wat er wel en niet mee mag.
Veelgestelde vragen
Je archief onder eigen dak
Als jouw kennis waardevol genoeg is om door anderen gescand te worden, is ze waardevol genoeg om er zelf iets mee te bouwen. Ik denk mee over wat je met je eigen documenten en data wilt bereiken, ontwerp het en zet het draaiend, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
