Stapels tweedehands boeken met verschillende titels op een marktkraam aan Portobello Road in Londen
Nieuws17 augustus · 20:095 min leestijd

Amazon koopt boeken op, scant ze en vernietigt ze voor AI-training

Een tracker in een zeldzaam boek leidde 404 Media naar een Amazon-loods in Las Vegas waar boeken worden opengesneden en gescand voor AI-training. Wat dat betekent voor iedereen die op een opt-out vertrouwt.

Amazon koopt op grote schaal gedrukte boeken op, snijdt de rug eraf om ze te scannen voor AI-trainingsdata en houdt daarna alleen het digitale bestand over. Dat blijkt uit onderzoek van 404 Media, dat een tracker in een zeldzaam boek stopte en dat door het land volgde tot bij een Amazon-faciliteit.

Voor wie waardevolle content bezit verschuift daarmee de vraag. Twee jaar lang ging het gesprek over de online kopie: een regel in robots.txt, een blokkade voor AI-crawlers, een clausule in je gebruiksvoorwaarden. Geen van die knoppen doet nog iets zodra hetzelfde materiaal als gedrukt exemplaar op de tweedehandsmarkt ligt en gewoon wordt afgerekend. Een opt-out werkt alleen daar waar jij de server beheert.

Wat de tracker liet zien

De zending eindigde bij VGT3, een Amazon-loods in Las Vegas die als teamsymbool een dinosaurus met een boek in zijn klauwen voert. Medewerkers snijden daar de band van de rug los zodat het scannen sneller gaat, en het gescande materiaal gaat volgens The Decoder naar Amazons eigen Nova-modellen. Het boek zelf overleeft die bewerking niet.

Amazon bevestigt de aankopen, maar niet de rest. Het bedrijf zegt boeken via commerciële kanalen te kopen om de producten en diensten van klanten te verbeteren. Over wat er daarna met die boeken gebeurt, staat in die verklaring niets.

Een opengeslagen boek op de glasplaat van een scanner in de Nationale Bibliotheek van Tsjechië. Bron: Skot / Wikimedia Commons (CC BY-SA 4.0)
Een opengeslagen boek op de glasplaat van een scanner in de Nationale Bibliotheek van Tsjechië. Bron: Skot / Wikimedia Commons (CC BY-SA 4.0)

Waarom juist oude gedrukte boeken

Gedrukt werk van voor 2022 is om twee redenen aantrekkelijk. Het staat vaak nergens online, dus scrapen levert het niet op. En het kan onmogelijk door een AI zijn geschreven, wat modellen behoedt voor de kwaliteitsterugval die ontstaat als ze op hun eigen uitvoer worden getraind. Boekhandelaren zien AI-bedrijven daarom per ISBN inkopen, alsof het doel is elk ooit gepubliceerd boek te digitaliseren.

Amazon is niet de enige. Destructief scannen is inmiddels ook gedocumenteerd bij Meta, Google, Microsoft, OpenAI en Anthropic, dat onder de naam Project Panama boeken opkocht en versneed.

Een spreadsheet met 3.001 ISBN-nummers

Die inkoopgolf bereikte Nederland al eerder deze zomer. Antiquaar Pieter de Vries uit Haarlem kreeg een verzoek van een bedrijf dat zich 2077AI noemt, met een lijst van 3.001 titels, vooral academische uitgaven uit 2020 en 2021 van Emerald, Elsevier, Wiley, Routledge en Oxford University Press. Hij hield het voor spam of phishing. Meerdere Nederlandse collega's kregen dezelfde mail, en de verzendinstructies wezen naar China.

De schaal daarvan is geen toeval. ISBNdb, dat de metadata achter boekbarcodes beheert, adverteert volgens 404 Media met bulkinkoop voor AI-labs in orders van duizend tot een miljoen boeken. Wie een vakuitgave, een studieboek of een rapport in druk heeft staan, kan dus al op zo'n inkooplijst staan zonder dat er ooit een verzoek langskwam.

Waarom dit juridisch werkt

De route is in de Verenigde Staten getest. In de zaak tegen Anthropic oordeelde een rechter dat het scannen van rechtmatig gekochte boeken onder fair use viel, mede omdat de originelen werden vernietigd en niet als tweede exemplaar verder circuleerden. Anthropic betaalde uiteindelijk 1,5 miljard dollar, ongeveer 3.000 dollar per boek voor zo'n 500.000 werken, maar dat ging over de zeven miljoen gepirateerde boeken in zijn interne bibliotheek, niet over de gekochte exemplaren. Kopen en versnijden bleek het legale pad, downloaden het dure.

Europese rechthebbenden proberen het langs de rechter. Uitgevers als Hachette, Cengage en Elsevier klagen Google aan omdat Gemini op miljoenen boeken zou zijn getraind zonder toestemming. Alleen raakt zo'n zaak de digitale kopie. Tegen een inkooporder op de tweedehandsmarkt biedt hij weinig.

Waar dit heen wijst

De AirTag maakte zichtbaar wat al maanden liep: de inkoop van trainingsdata is deels verhuisd van het web naar de fysieke markt, waar geen enkele technische instelling geldt. Bescherming van content wordt daarmee minder een serverkwestie en meer een contractuele. Precies daarop zetten Nederlandse uitgevers in met Bookpact.ai, waar een uitgever per titel bepaalt of, hoe lang en tegen welke vergoeding een AI-bedrijf een boek mag gebruiken.

De andere kant beweegt intussen ook. Bij Twitch, net als deze scanoperatie onderdeel van Amazon, stond het trainen van AI op streams, clips en chats van makers meteen aan voor bestaande accounts. Online is de standaard opt-out, offline is er niet eens een schakelaar. Wie iets bezit dat de moeite waard is om te scannen, kan dat alleen nog sturen door vooraf vast te leggen wat er wel en niet mee mag.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Je archief onder eigen dak

Als jouw kennis waardevol genoeg is om door anderen gescand te worden, is ze waardevol genoeg om er zelf iets mee te bouwen. Ik denk mee over wat je met je eigen documenten en data wilt bereiken, ontwerp het en zet het draaiend, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Uitgevers klagen Google aan om Gemini-training op boeken
Nieuws
4 min

14 jul 18:21

Uitgevers klagen Google aan om Gemini-training op boeken

Hachette, Cengage, Elsevier en auteur Scott Turow klagen Google aan wegens auteursrechtinbreuk: Gemini zou getraind zijn op miljoenen boeken zonder toestemming. Voor bedrijven die Gemini of Google Workspace gebruiken groeit daarmee het juridische leveranciersrisico.

Amazon kopieert intern Anthropic's Claude-modellen om hogere tokenprijzen voor te zijn
Nieuws
5 min

29 jun 22:34

Amazon kopieert intern Anthropic's Claude-modellen om hogere tokenprijzen voor te zijn

Amazon-engineers maken volgens The Information goedkopere interne kopieen van Anthropic's Claude-modellen, vlak voor een overstap naar tokenprijzen. Voor bedrijven die Claude via AWS Bedrock draaien is dat een signaal over kosten en leveranciersrisico.

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs
Nieuws
5 min

11 aug 20:24

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs

Onderzoekers van de Universiteit Tübingen en Snyk ontcijferden de verborgen denkstappen van Claude, GPT en Gemini via de API's zelf. In publieke agent-logs vonden ze 62 API-sleutels en 33 wachtwoorden.

Anthropic watermerkt alle tekst van Claude, wereldwijd
Nieuws
5 min

11 aug 02:10

Anthropic watermerkt alle tekst van Claude, wereldwijd

Anthropic weeft een onzichtbaar watermerk in alle tekst die Claude genereert, wereldwijd en op modelniveau, vanaf modellen van na 2 augustus 2026. Dat verandert de herkomst van je output, niet je eigen meldplicht als ondernemer.

DeepMind verliest zijn zelfstandigheid binnen Google
Nieuws
4 min

9 aug 12:22

DeepMind verliest zijn zelfstandigheid binnen Google

Huidige en voormalige medewerkers zeggen tegen The Guardian dat DeepMind zijn zelfstandigheid heeft verloren. De Gemini-ontwikkeling verhuist naar de Verenigde Staten, terwijl het grote geld bij Google in de cloud zit en niet in het model.

OpenAI, Anthropic en Google ontbreken in Nvidia's AI-beveiligingsalliantie
Nieuws
3 min

28 jul 02:13

OpenAI, Anthropic en Google ontbreken in Nvidia's AI-beveiligingsalliantie

Nvidia's Open Secure AI Alliance telt 37 oprichters, maar OpenAI, Anthropic en Google staan er geen van drieën op. Andere AI-labs wel. Wat die afwezigheid betekent als je beveiliging op hun modellen leunt.