WhatsApp begint met een beperkte bètatest van Scam Alert, een optioneel AI-model dat inkomende berichten van niet-contacten op fraude beoordeelt en volgens Meta volledig op het toestel zelf draait.
Voor bedrijven die klantcontact via WhatsApp doen, zit de inzet niet in de waarschuwing maar in wie hem te zien krijgt. Het model beoordeelt alleen berichten van afzenders die niet in de contactenlijst van de ontvanger staan, en dat is precies de positie waarin jouw eerste bericht aan een nieuwe klant terechtkomt. De ontvanger ziet de melding in de chat, de afzender niet. Dat speelt op een kanaal waar de rekensom toch al verschuift, nu Meta AI-klantcontact via WhatsApp Business per token afrekent tegen 2 dollar per miljoen tokens.
Een classificatie op gespreksniveau
Scam Alert is optioneel en moet door de gebruiker zelf worden aangezet. Gebeurt dat, dan downloadt WhatsApp een machinelearningmodel naar het toestel, waar het beoordeelt of binnenkomende berichten van onbekenden overeenkomen met bekende fraudepatronen. Het model is getraind op gesprekken die gebruikers zelf als fraude rapporteerden en doet volgens Meta een probabilistische classificatie op basis van gespreksstructuur en taalkundige signalen.
Die laatste formulering is het interessantste deel. Klassieke veiligheidsfilters beoordelen losse berichten, en juist daar lopen ze op fraude stuk: in de vertrouwensfase is geen enkel bericht op zichzelf schadelijk. In een studie voor USENIX Security 2026 herkende Meta’s eigen Llama Guard 3 nul van de 250 romance-baiting-gesprekken, terwijl datzelfde filter 97,6 procent van de gesprekken over belastingfraude wel ving. Scam Alert kijkt naar het verloop in plaats van naar het losse bericht, en dat is exact het gat dat die meting blootlegde.
Krijgt iemand een waarschuwing, dan kan hij blokkeren, rapporteren of gewoon doorpraten. Zit het model ernaast, dan markeert hij de chat als vertrouwd en wordt die nooit meer gemarkeerd. Wie dat doet, mag optioneel de laatste vijf ontvangen berichten met WhatsApp delen om de nauwkeurigheid te verbeteren.
Wat er wel van het toestel af gaat
Meta stelt dat geen berichtinhoud het toestel verlaat voor classificatie en dat er niets automatisch wordt gerapporteerd. Inhoud bereikt de servers alleen als de gebruiker zelf op rapporteren drukt.
Wat er wel weggaat is telemetrie, en die is bewust smal gehouden: twee soorten geaggregeerde tellingen. Hoe vaak het model een waarschuwing toonde, en welke actie de gebruiker daarna koos. Die tellingen lopen via een relay die het IP-adres stript naar confidential virtual machines, een vorm van Trusted Execution Environment, en komen eruit als differentieel-private aggregaten. Voordat het toestel iets verstuurt, controleert het of de code in die omgeving overeenkomt met wat op een externe ledger staat en of de privacyparameters de eigen ondergrens halen. Klopt er iets niet, dan verstuurt de client niets.

Hoe hard de belofte te controleren is
De scherpste vraag bij een scanner op je toestel is niet of hij vandaag alleen fraude zoekt, maar of één specifieke gebruiker morgen een ander model kan krijgen. Daar heeft WhatsApp een constructie voor gebouwd. Elke modelversie, inclusief experimentele varianten, wordt met een SHA-256-hash op een externe append-only transparantieledger gezet voordat hij aan iemand wordt geleverd. Het bijbehorende manifest wordt ondertekend door Cloudflare met Ed25519-sleutels, en Meta heeft die ondertekeningssleutel niet in handen. Het toestel controleert de handtekening tegen vast ingebouwde Cloudflare-sleutels, kijkt de ledger na en weigert het model te laden zodra één stap faalt. In de app kan een gebruiker onder Account, Request Info, Scam Alert Activity per analyse terugzien wat de uitkomst was en welke modelversie draaide.
Waar de belofte dunner wordt, is bij de modelgewichten. Meta schrijft dat het die publiceert voor onafhankelijke controle, maar concreet gaan ze naar geselecteerde AI-onderzoekers binnen het bug-bountyprogramma; op de ledger staan de hashes, niet de gewichten zelf. De app eromheen blijft closed source, dus dat het gedownloade model het enige is dat je berichten leest, blijft van buitenaf een aanname. Meta kondigt aan de image van de confidential virtual machine en de privacyrelevante broncode alsnog te publiceren, zodat onderzoekers kunnen nagaan wat er echt in die omgeving draait.
Over zakelijke accounts, templateberichten, landen of talen zegt de aankondiging niets. Dat is voor een bedrijf dat WhatsApp Business inzet de openstaande vraag: of legitieme eerste benadering van een klant het model kan laten afgaan, en of je dat ooit zou merken.
Client-side scanning, nu vrijwillig
Los van wie het bouwt, is de architectuur zelf het nieuws. Berichten worden gelezen door een model op het toestel, vóór het slot van de encryptie dichtgaat. Dat is precies de opzet waar het Europese chatcontroledebat om draait, waarin een scanner op honderden miljoenen toestellen geldt als generieke doorzoekcapaciteit waarvan de zoekopdracht later politiek te herzien valt. Het verschil zit in wie hem aanzet en waarvoor: hier is het opt-in, gaat er niets automatisch naar een server en is de zoekopdracht fraude, geen strafbaar materiaal.
Het precedent blijft staan. Toen Apple in 2021 iPhones wilde laten meescannen op materiaal van kindermisbruik, liep dat op zoveel weerstand stuk dat het plan sneuvelde. WhatsApp bezet nu dezelfde plek in het systeem, maar met een verifieerbaarheidslaag eromheen en een gebruiker die de knop bedient. Houdt die opzet stand, dan heeft de Europese wetgever straks een werkend voorbeeld van scannen op het toestel om naar te wijzen. Valt hij door de mand, dan is dat het hardste tegenargument dat dit debat tot nu toe heeft gekregen.
Veelgestelde vragen
Klantcontact dat je zelf beheert
Als een model op het toestel van je klant meebepaalt of jouw bericht vertrouwd wordt, wil je de rest van die keten wel stevig in eigen hand hebben. Ik denk met je mee over dat proces, ontwerp het, bouw het en automatiseer het van eerste idee tot livegang, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
