Hangslot op een laptop met lichtsporen eromheen
Nieuws15 augustus · 14:085 min leestijd

Google toont vier AI-modellen die op versleutelde data draaien

Google zet zijn compiler HEIR in de Private Computing Toolkit en publiceert vier AI-modellen die volledig op versleutelde data rekenen. Wat werkt daar vandaag van, en wat kost het aan rekentijd?

Google zet zijn compiler HEIR in de Private Computing Toolkit en publiceert vier AI-modellen die volledig op versleutelde data rekenen, schrijft het bedrijf in een blogpost van 14 augustus.

Voor een Nederlandse organisatie die klantdossiers, betalingen of patiëntgegevens liever niet door een cloudmodel haalt, raakt dat precies het knelpunt. Bij homomorfe encryptie ziet de rekenende partij nooit de inhoud, alleen cijferbrij, en toch komt er een bruikbare uitkomst uit. De vraag is wat daarvan vandaag werkt. Het antwoord staat in de demo's: vier modellen, gedraaid op één processorkern, met wachttijden van tientallen seconden tot ruim acht minuten per voorspelling.

Wat er nieuw is, en wat niet

De compiler zelf is geen verse open-sourcing. Google kondigde HEIR al op 10 augustus 2023 aan, samen met de Jaxite-bibliotheek en een compiler die getrainde TensorFlow-modellen naar een versleutelde versie omzet. De broncode staat sinds april 2023 publiek op GitHub onder de Apache 2.0-licentie.

Nieuw is de status: homomorfe encryptie staat nu als vast onderdeel in de Private Computing Toolkit, naast differential privacy, private set membership, private information retrieval en secure enclaves. Nieuw is ook het bewijsmateriaal. De vier voorbeeldtoepassingen zijn deze week naar een publieke repository geëxporteerd, met de gecompileerde modellen en de commando's om ze zelf te draaien.

Schema van homomorfe encryptie. Versleutelde data gaan van het lokale apparaat naar een niet vertrouwde cloud, die erop rekent en een versleuteld resultaat terugstuurt. Bron: Google
Schema van homomorfe encryptie. Versleutelde data gaan van het lokale apparaat naar een niet vertrouwde cloud, die erop rekent en een versleuteld resultaat terugstuurt. Bron: Google

Vier demo's, allemaal op CKKS

Alle voorbeelden zijn gecompileerd met CKKS, het versleutelingsschema voor benaderend rekenen met kommagetallen, en draaien op de backends Lattigo (Go) en OpenFHE (C++):

  • Aanbevelingen: een Deep Learning Recommendation Model, samen met Belfort Labs, LG en New York University. Een dienst kan hiermee content aanraden zonder de kenmerken van de gebruiker te zien.
  • Creditcardfraude: een klein neuraal netwerk van drie lineaire lagen met sigmoid-activaties, op 82 kenmerken uit een publieke Kaggle-fraudedataset, samen met Niobium en hardshell.ai.
  • Netwerkanomalieën: het academische Kitsune-systeem, een ensemble van autoencoders, samen met Niobium. Een aanbieder spot afwijkend verkeer zonder de inhoud van de pakketten te zien.
  • Hotword-detectie: TC-ResNet8, getraind op de Speech Commands-dataset, samen met Belfort Labs. Een spraakassistent herkent het activatiewoord zonder de opname te ontsleutelen.

In dezelfde repository staat ook een MNIST-demo met een netwerk van drie lagen op het klassieke cijferherkenningsprobleem.

Wat het kost aan rekentijd

Hier is Google zuinig. De post meldt dat de cijfers gelden voor één processorkern, maar noemt geen enkel getal. De wel gepubliceerde meting komt uit het onderzoek achter de aanbevelingsdemo: onderzoekers van New York University rapporteren 24 seconden voor één versleutelde voorspelling op de UCI-dataset en 228 tot 489 seconden op de Criteo-dataset, gemeten op één processorkern. Onversleuteld kost datzelfde model milliseconden.

Dat verschil is de hele afweging. Homomorfe encryptie haalt de keuze tussen functionaliteit en privacy weg en verplaatst hem naar een kostenpost, en die kostenpost daalt. Google wijst op zijn hardwarepartners Belfort, Niobium, Cornami en Optalysys en zegt de winst daarvan binnenkort te laten zien. De onderzoekers verwachten dat versnelling met GPU's en speciale chips de wachttijd naar seconden of minder brengt. Zolang die metingen ontbreken, is dit rekenwerk voor de achtergrond, niet voor een scherm waar iemand op wacht.

Wat het juridisch wel en niet oplost

De Autoriteit Persoonsgegevens begint haar checklist voor generatieve AI met de vraag of je de tool kunt gebruiken zonder persoonsgegevens te verwerken. Homomorfe encryptie is precies de techniek die dat antwoord kan veranderen voor de partij die het rekenwerk doet, want die krijgt nooit een sleutel.

Een vrijbrief is het niet. Encryptie is onder de AVG een beveiligingsmaatregel, geen uitzondering, en jij houdt de sleutel en daarmee de verantwoordelijkheid voor de gegevens die je versleutelt. Het risico verschuift dus niet weg van de rommelige datahuishouding waar het bij AI meestal zit. Wel oordeelde het Hof van Justitie in september 2025 dat gepseudonimiseerde gegevens niet in alle gevallen en voor iedere partij persoonsgegevens zijn, omdat de kwalificatie afhangt van de positie van de partij die ze verwerkt. Dat arrest ging over pseudonimisering, niet over encryptie. Het denkkader is wel hetzelfde: wie geen redelijk middel tot herleiding heeft, staat anders in de keten dan wie de sleutel bezit.

Waar de grens ligt

Google schrijft dat de ambitie een oplossing met één druk op de knop is, voor mensen zonder cryptografie-achtergrond. Zo werkt het vandaag niet. Het omzetten van een PyTorch-model naar HEIR is nog niet geautomatiseerd: je exporteert het model via torch-mlir, schrijft een script dat de bereiken van elke activatiefunctie schat, en annoteert de operaties met een polynoomgraad die nauwkeurigheid tegen snelheid afweegt. De documentatie meldt zelf dat een binary voor de hele keten er nog niet is en dat je het voorlopig doet met de losse compilerbinaries heir-opt en heir-translate. Er is ook geen versie 1.0: de releases zijn datumstempels met nachtelijke builds.

Drie jaar geleden was HEIR een aankondiging met een compiler eromheen. Nu staan er vier draaiende modellen uit domeinen waar de data het gevoeligst is: betaalkaarten, netwerkverkeer, spraak en gedragsprofielen. De versnellerchips die het verschil moeten maken zijn nog niet gemeten, dus de eerlijke plek voor deze techniek is voorlopig het batchwerk waar een minuut wachten niemand stoort. Fraudescores, risicoclassificaties en anomaliedetectie op logbestanden. Dat zijn precies de processen waar een model nu data ziet die het eigenlijk niet hoeft te zien.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Gevoelige data, toch automatiseren

Zit je vast omdat je gevoeligste gegevens niet zomaar door een extern model mogen? Ik denk met je mee over wat wel kan, ontwerp de aanpak en bouw en automatiseer het vervolgens, self-hosted waar dat verstandig is.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Elke marketingtag op je site is een verwerker die je nooit hebt aangenomen
Inzicht
7 min

15 aug 09:00

Elke marketingtag op je site is een verwerker die je nooit hebt aangenomen

Je verwerkingsregister komt uit je crediteurenadministratie, terwijl de meeste gegevensstromen op je site via tags lopen die niemand ooit heeft geteld of opgezegd. Wie de tag plaatste, is niet wie ervoor aansprakelijk is.

Google DeepMind geeft weermodel WeatherNext 2 vrij onder CC BY 4.0
Nieuws
6

7 aug 16:25

Google DeepMind geeft weermodel WeatherNext 2 vrij onder CC BY 4.0

Google DeepMind publiceert de code en gewichten van WeatherNext 2 op GitHub onder Apache 2.0 en CC BY 4.0. Waar de gewichten van GraphCast commercieel gebruik uitsloten, mag dat nu wel.

Cloudflare geeft AI-werkplek Cloudflare OS open source vrij
Nieuws
5 min

5 aug 22:25

Cloudflare geeft AI-werkplek Cloudflare OS open source vrij

Cloudflare geeft Cloudflare OS vrij onder Apache 2.0: de AI-werkplek waarop het bedrijf zelf draait, waarin elke medewerker in de browser apps bouwt en agents alleen bij bronnen komen die je expliciet vrijgeeft.

Google Analytics vervangen: Matomo, Plausible of zelf hosten
Gids
Uitgebreide gids12 min

2 aug 13:04

Google Analytics vervangen: Matomo, Plausible of zelf hosten

Je cookiebanner is geen bewijs dat je goed zit. Deze gids vergelijkt Matomo On-Premise, Matomo Cloud en Plausible op toestemming, kosten en dataeigendom, met een migratiepad vanaf GA4 en wat je aan historie kwijtraakt.

Na het datalek bij Accenture: audit niet je IT-leverancier, audit zijn toegang
Inzicht
7 min

27 jul 17:00

Na het datalek bij Accenture: audit niet je IT-leverancier, audit zijn toegang

Bij Accenture kwamen broncode en cloudsleutels te koop te staan. De les zit niet in het certificaat van je IT-leverancier, maar in de accounts en sleutels die zijn mensen in jouw systemen hebben.

Block geeft agentwerkplek Berd vrij onder Apache 2.0
Nieuws
5 min

19 aug 02:25

Block geeft agentwerkplek Berd vrij onder Apache 2.0

Block brengt Berd uit als open source: een desktopwerkplek die met goose, Claude Code en Codex werkt, elk model toelaat en de gespreksgeschiedenis op je eigen machine bewaart. Gratis, maar zonder centrale beheerlaag.