Man met bril controleert documenten aan een bureau
Inzicht17 juni · 21:007 min leestijd

AI-hallucinaties zijn geen bug, maar een bedrijfsrisico

Verzonnen bronnen, onjuiste antwoorden, een ingetrokken rapport: AI hallucineert niet per ongeluk, het hoort bij de techniek. Wie output zakelijk inzet zonder verificatiestap, gokt met de eigen reputatie.

Toen KPMG in juni stilletjes zijn vlaggenschiprapport over agentic AI van de website haalde, was de ironie pijnlijk. Een rapport dat bedrijven moest overtuigen van de zegeningen van AI, bleek zelf grotendeels door AI verzonnen. Onderzoekers van GPTZero vonden dat slechts vijf van de vijfenveertig citaties klopten; de rest liep van verminkt en misleidend tot volledig gefabriceerd, inclusief case studies over klanten die nooit hadden plaatsgevonden.

De makkelijke reactie is: knullig, maar een uitzondering. Dat is precies de denkfout die ik wil bestrijden. Toen een van de grootste adviesbureaus ter wereld zijn rapport over agentic AI introk nadat de citaten verzonnen bleken, was dat geen toeval maar een voorbode. Mijn stelling is simpel: AI-hallucinaties zijn geen randverschijnsel of kinderziekte die met de volgende modelupdate verdwijnt. Ze zijn een structureel kenmerk van de techniek. En elke organisatie die AI-output zakelijk gebruikt zonder een ingebouwde verificatiestap, speelt Russisch roulette met haar reputatie.

Hallucineren is geen bug, het is hoe het systeem werkt

We noemen het "hallucinatie" alsof het een storing is, een foutje dat eruit gepatcht wordt. Dat frame is misleidend. Een taalmodel weet niet wat waar is; het voorspelt welk woord statistisch het meest waarschijnlijk volgt. Een vloeiende, overtuigende zin en een feitelijk correcte zin zijn voor zo'n systeem hetzelfde soort uitvoer. Het verschil dat voor jou alles bepaalt, bestaat voor het model niet.

Sterker nog: de manier waarop we deze modellen trainen beloont het gokken. Uit onderzoek van OpenAI blijkt dat hallucinaties blijven bestaan omdat de gangbare evaluaties "ik weet het niet" even hard afstraffen als een fout antwoord, waardoor zelfverzekerd raden de optimale strategie wordt. Een model dat eerlijk twijfel toont, scoort slechter op de benchmarks dan een model dat met overtuiging iets verzint. We hebben de systemen dus letterlijk geoptimaliseerd om liever stellig te liegen dan toe te geven dat ze het niet weten.

En dit is geen probleem van de goedkope chatbots. Onderzoekers van Stanford testten de dure, gespecialiseerde juridische AI-tools, met eigen bronnen en alles, en vonden dat zelfs die in ongeveer een op de zes vragen hallucineren, terwijl algemene chatbots op juridische vragen tussen de achtenvijftig en tweeentachtig procent van de tijd de plank missloegen. Bij precies het soort werk waar een verkeerd cijfer geld of een rechtszaak kost.

Waar de rekening landt

Verificatieschuld is het verschil tussen wat een AI-systeem beweert en wat iemand daadwerkelijk heeft gecontroleerd. Elke ongecontroleerde AI-output die je in een document, een mail of een beslissing laat belanden, bouwt die schuld op, onzichtbaar, tot een hallucinatie op het verkeerde moment de rekening presenteert. Die rekening landt op drie plekken:

  • Reputatie: het KPMG-rapport stond niet vol kleine typefouten maar vol verzonnen autoriteit. Voor een merk dat zijn hele waarde ontleent aan betrouwbaarheid, is dat de duurste fout die er is. Klanten vergeven traagheid; ze vergeven geen verzinsels die met jouw logo eronder de wereld in gaan.
  • Juridisch: de tijd dat je je achter "de AI deed het" kon verschuilen, is voorbij. Een Duitse rechter oordeelde dat Google aansprakelijk is voor de onjuiste beweringen in zijn AI-overzichten, omdat die overzichten Googles eigen woorden zijn, en verwierp expliciet het argument dat gebruikers het zelf maar moeten controleren. De output van jouw systeem is jouw verantwoordelijkheid.
  • Operationeel: het gevaarlijkste scenario staat niet in de krant. Het is de medewerker die een prijsberekening, een marktcijfer of een juridische clausule uit een chatbot overneemt, het plausibel vindt klinken, en er een beslissing op baseert. Geen schandaal, wel een verkeerd pad ingeslagen op basis van iets dat nooit bestond.

"Maar de modellen worden toch steeds beter?"

Dat is het sterkste tegenargument, en het klopt half. De modellen worden beter; de hallucinatiegraad daalt. Maar daar zit precies de adder. Naarmate de output overtuigender wordt, daalt je waakzaamheid sneller dan de foutgraad. Een model dat in negenennegentig van de honderd gevallen briljant is, traint jou om de honderdste keer ook te vertrouwen. De zeldzaamheid van de fout maakt hem juist gevaarlijker, want niemand kijkt nog kritisch mee.

En dan het echte tegenargument: mensen maken toch ook fouten? Zeker. Maar een mens dat iets niet zeker weet, aarzelt, hedged, zegt "dat zoek ik even na". Een taalmodel produceert een verzinsel met exact dezelfde vloeiende stelligheid als een feit. Het ontbreekt aan het signaal van twijfel waar we als lezers onbewust op vertrouwen. Daarbij kun je de schuld niet uitbesteden: toen de chatbot van Air Canada een rouwkorting verzon die niet bestond, oordeelde de rechter dat de luchtvaartmaatschappij gewoon aansprakelijk was, en verwierp het idee dat de chatbot een aparte entiteit zou zijn. De verantwoordelijkheid blijft bij jou, ook als de fout van de machine komt.

De verkeerde vraag, en de juiste

De vraag die ik bedrijven het vaakst hoor stellen, "kan ik deze AI vertrouwen?", is de verkeerde vraag. Het antwoord is namelijk altijd hetzelfde: nee, niet blind, nooit. De juiste vraag is: heb ik verificatie ingebouwd op de plekken waar een fout pijn doet?

Dat verschuift het probleem van het model naar het ontwerp van het werkproces eromheen. Een AI die antwoorden geeft zonder controleerbare bron is een gok; een AI die elk antwoord onderbouwt met de daadwerkelijke brondocumenten, zodat een mens het in seconden kan natrekken, is een hulpmiddel. Dat is geen modeltrucje maar een ontwerpkeuze, en precies waar een chatbot op je eigen data via RAG met traceerbare bronnen het verschil maakt met een kale chatbot. Hetzelfde geldt voor de basis eronder: een model hallucineert het hardst waar het de minste betrouwbare context heeft, en daarom begint betrouwbare AI bij je data op orde brengen, het saaie werk dat de meeste AI-projecten overslaan.

En de inzet stijgt snel. Zolang AI alleen suggesties doet die een mens nog leest, is een hallucinatie een fout die je kunt onderscheppen. Maar de hele beweging gaat richting autonomie, naar systemen die niet adviseren maar handelen. Wie de realistische blik op wat AI-agents nu al wel en niet aankunnen serieus neemt, ziet het probleem: een ongecontroleerde suggestie wordt dan een ongecontroleerde actie, een verzonnen bedrag dat niet in een rapport belandt maar in een echte transactie, of een afspraak die wordt nagekomen. Hoe meer beslissingsmacht je een model geeft, hoe duurder de momenten worden waarop het met volle overtuiging fantaseert. Autonomie zonder verificatie is geen efficiency, het is risico met een snelheidsknop.

Dit is ook waarom de kloof tussen een indrukwekkende demo en een systeem dat in productie standhoudt zo groot is. Een demo hoeft maar een keer indruk te maken; een AI-systeem dat de saaie vijfennegentig procent van de echte gevallen moet overleven moet ook fout kunnen gaan zonder schade aan te richten. Verificatie is geen rem op de innovatie. Het is wat AI van een leuk speeltje tot een instrument maakt waar je een bedrijf op durft te bouwen.

De organisaties die de komende jaren met AI winnen, zijn niet degene met het slimste model. Het zijn degene die het nuchterst zijn over wat het model niet kan, en die de controle inbouwen op de plek waar een verzinsel het duurst is. De rest leert het op de harde manier, met hun naam onder een rapport dat nooit had mogen verschijnen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI inzetten zonder gokwerk

Ik denk met je mee, ontwerp en bouw AI-oplossingen end-to-end waarin verificatie en traceerbare bronnen geen bijzaak zijn maar onderdeel van het ontwerp, zodat je op de output durft te bouwen.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Rechtbank Amsterdam verhoogt proceskosten met 2.315 euro om niet-bestaand citaat
Nieuws
4

22 aug 10:12

Rechtbank Amsterdam verhoogt proceskosten met 2.315 euro om niet-bestaand citaat

De rechtbank Amsterdam telde een halve punt bij de proceskosten op, 2.315,50 euro, omdat een partij een verzonnen citaat uit DSM/Fox opvoerde. Of AI de bron was, vond de rechter niet beslissend.

China wijst Amodei’s oproep voor AI-rem af
Nieuws
3 minBijgewerkt om 02:39

14 sep 14:58

China wijst Amodei’s oproep voor AI-rem af

China wijst Amodei’s oproep om frontier-AI te vertragen af en noemt confrontatie schadelijk voor AI-governance. Voor Nederlandse organisaties maakt dat modelkeuze ook een vraag over exportcontrole, chiptoegang en leveranciersrisico.

Cyberdefensiebrief groeit van 116 naar 155 ondertekenaars
Nieuws
4 min

30 aug 10:07

Cyberdefensiebrief groeit van 116 naar 155 ondertekenaars

De open brief over cyberdefensie telt sinds zaterdag 155 ondertekenaars tegen 116 op 27 augustus. GitHub, Datadog, Atlassian en Nokia tekenden bij, Nvidia en Meta blijven weg en de lijst staat nu open voor aanmeldingen.

OpenAI sluit op 12 november de modeltoegang voor Cursor af
Nieuws
5 min

29 aug 06:10

OpenAI sluit op 12 november de modeltoegang voor Cursor af

OpenAI stopt op 12 november met het leveren van zijn modellen aan Cursor, omdat het eigenaar SpaceX niet vertrouwt. Wat een Nederlands ontwikkelteam verliest en welke routes er tot die datum openliggen.

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet
Nieuws
4 min

26 aug 22:35

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet

Moonshot vraagt volgens Reuters tot 30 procent van de omzet die Microsoft, Amazon en Google met Kimi K3 zouden maken. De gesprekken bepalen of je het Chinese topmodel straks gewoon als clouddienst inkoopt.

Advieskantoren werven forward deployed engineers nu AI naar productie moet
Nieuws
6 min

25 aug 10:27

Advieskantoren werven forward deployed engineers nu AI naar productie moet

Deloitte, Accenture, Capgemini en McKinsey zoeken forward deployed engineers die AI in de dagelijkse bedrijfsvoering inpassen. Het profiel is schaars, en dat verandert de rekensom voor wie een AI-traject uitbesteedt.