Grafische kaart van Gigabyte met blauwe en rode verlichting in een geopende computerkast.
Nieuws28 augustus · 16:275 min leestijd

Google DeepMind laat Gemini dubbelblind toetsen zonder de testvragen te zien

Google DeepMind toetste Gemini 2.5 Flash Lite in een versleutelde enclave waarin de evaluator de gewichten niet zag en Google de vragen niet. Een score publiceert het bedrijf niet: dit is een pilot, geen norm.

Google DeepMind heeft Gemini 2.5 Flash Lite laten toetsen in een versleutelde omgeving waarin de externe evaluator de modelgewichten niet kon zien en Google de testvragen niet, meldt het bedrijf op zijn eigen blog.

Voor wie een AI-leverancier moet beoordelen op diens eigen benchmarkcijfers, zit daar het punt. Tot nu toe rust de belofte dat een model de testvragen niet vooraf zag op contracten en zero-logging-afspraken, dus op vertrouwen. In deze opzet rust die belofte op hardware: beide partijen controleren cryptografisch wie wat te zien krijgt voordat er ook maar een prompt naar binnen gaat. Wat er nog niet uit volgt, is een cijfer. Google publiceert geen uitslag voor Gemini. Het technisch rapport beschrijft de methode, niet het resultaat.

Wat er is getoetst, en door wie

De pilot draaide twee keer. Samen met auditor AVERI en benchmarkorganisatie MLCommons ging Gemini 2.5 Flash Lite door een deel van de AILuminate-benchmark (AIRR 1.4) dat nog nooit door enig model was verwerkt, met prompts over CBRNE-gevaren, cyberaanvallen, haatzaaien, zelfbeschadiging en geweldsmisdrijven. AVERI versleutelde en ontsleutelde de prompts en beoordeelde zelf de antwoorden. In een tweede ronde toetste het Singaporese AI Safety Institute hetzelfde model op een besloten promptset over schadelijke content in de Singaporese context.

MLCommons, dat de vragen leverde, houdt het nadrukkelijk bij een proof of concept en zegt een gereserveerde subset te hebben aangeleverd waarmee de benchmark niet besmet raakt of aan integriteit inboet.

Hoe de doos dicht blijft

De evaluatie draaide op een enkele NVIDIA H100 met 80 gigabyte geheugen in Google Cloud Confidential Space, met geheugenversleuteling van Intel TDX op de host en PySyft van OpenMined als laag die bepaalt welke code binnen mag draaien. Voordat een van beide partijen iets opstuurt, controleert remote attestation of in de enclave precies de software draait die is afgesproken. Daarna gaan gewichten en prompts over versleutelde verbindingen naar binnen, komt alleen de toegestane uitkomst naar buiten en wordt de omgeving vernietigd.

Schema van de dubbelblinde evaluatie: AI-eigenaar en evaluator sturen model, code en data naar een van internet afgesloten GPU-enclave die alleen het resultaat teruggeeft. Bron: Google DeepMind
Schema van de dubbelblinde evaluatie: AI-eigenaar en evaluator sturen model, code en data naar een van internet afgesloten GPU-enclave die alleen het resultaat teruggeeft. Bron: Google DeepMind

Rekenkracht is niet de rem. Het rapport houdt de overhead op minder dan 5 procent; de grootste hobbel zijn de juridische afspraken en de code-reviews tussen de deelnemende organisaties.

Wat de pilot niet bewijst

Het rapport is opvallend open over wat er niet lukte. Niet alle inferentiecode van Gemini kon worden teruggebracht tot onderdelen die de tegenpartij mocht inzien of op een toegestane lijst zetten; AVERI is daarover geïnformeerd en ging akkoord met de opzet. De builds van het gastbesturingssysteem van Confidential Space zijn niet onafhankelijk reproduceerbaar, omdat er private ondertekeningssleutels in gaan. En de attestatie wordt door Google-diensten ondertekend en geverifieerd, waardoor Google zelf in het verificatiepad zit.

Vertrouwen verdwijnt hier dus niet, het verschuift. Naar de chipfabrikant en de cloudleverancier, van wie wordt aangenomen dat ze niet samenspannen. En naar de benchmarkbeheerder, want een promptset die goed beschermd is maar slecht onderhouden, meet nog steeds het verkeerde.

Waarom benchmarkvertrouwen onder druk staat

De aanleiding staat in het rapport zelf. Het verwijst naar onderzoek dat bij ongeveer de helft van 31 onderzochte modellen aanwijzingen voor benchmarklekkage vond, en naar een geval waarin een frontier-lab 27 privévarianten van zijn model op Chatbot Arena testte en daarna alleen de hoogste score publiceerde. Ook praktisch loopt het vast: de ARC-AGI-evaluatie van Anthropics Fable 5 liep vertraging op door het dataretentiebeleid van dertig dagen dat het bedrijf voor zijn sterkste modellen hanteert.

Dat probleem is breder dan besmetting alleen. OpenAI trok in juli zijn aanbeveling in van een veelgebruikte codeertest nadat een eigen audit uitwees dat ongeveer 30 procent van de opgaven kapot was, en het Britse AI Security Institute mat dat elk getest topmodel in 7,8 tot 14,1 procent van de cybertestruns probeerde te sjoemelen. Een score beschermen tegen inkijk lost dat tweede probleem niet op, maar het haalt wel een van de twijfels weg.

Waar dit heen wijst

De onderzoekers mikken op attestatie die net zo onzichtbaar wordt als het slotje in de browserbalk, en op clusters van H100- en B200-kaarten om straks ook modellen te toetsen die niet op een enkele kaart passen. Zover is het niet. Voorlopig gaat het om een klein model, een gereserveerde promptset en twee toetsers, zonder gepubliceerde uitslag.

Wat er wel is veranderd, is dat er nu een aantoonbaar alternatief bestaat voor de belofte op erewoord. Elk benchmarkcijfer dat een leverancier vandaag op tafel legt, rust nog op dezelfde afspraken als vorige week. Het verschil zit voortaan in de vraag die daarop volgt: hoe is dit getest, en wie kon er meekijken?

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van modelkeuze naar werkend systeem

Welk model je kiest is bij een AI-project maar een van de beslissingen die je goed moet krijgen. Ik denk mee over wat je echt nodig hebt, ontwerp het proces eromheen en bouw het tot het draait, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

OpenAI verlaagt prijs GPT-5.6 Sol tijdelijk naar 4 en 20 dollar per miljoen tokens
Nieuws
4 min

22 aug 00:10

OpenAI verlaagt prijs GPT-5.6 Sol tijdelijk naar 4 en 20 dollar per miljoen tokens

OpenAI zet GPT-5.6 Sol drie maanden lang op 4 dollar invoer en 20 dollar uitvoer per miljoen tokens. De uitvoerprijs zakt een derde, precies de post waar agentprocessen het meeste verbruiken.

Harvey traint eigen juridisch model op het open Chinese Kimi K3
Nieuws
5 min

21 aug 18:11

Harvey traint eigen juridisch model op het open Chinese Kimi K3

Harvey post-traint zijn eerste eigen juridische model op het open-weight Kimi K3 van Moonshot in plaats van een frontier-API te huren. Wat de cijfers laten zien en wat die route echt kost.

OpenAI draait GPT-5.6 Sol tot veertien keer sneller op Cerebras-chips
Nieuws
4 min

13 aug 22:26

OpenAI draait GPT-5.6 Sol tot veertien keer sneller op Cerebras-chips

OpenAI brengt GPT-5.6 Sol in een nieuwe servicelaag die tot veertien keer sneller antwoordt, op chips van Cerebras. De toegang loopt via een besloten preview en een tarief is er nog niet.

Gemini-app passeert een miljard maandelijkse gebruikers
Nieuws
4 min

11 aug 22:24

Gemini-app passeert een miljard maandelijkse gebruikers

De Gemini-app telt een miljard maandelijkse gebruikers, evenveel als ChatGPT. Interessanter dan het getal is wat eronder ligt: wie Workspace Business of Enterprise afneemt, betaalt al voor deze assistent.

Wetsvoorstel dwingt grote AI-bouwers tot een kill switch
Nieuws
4 min

23 jul 18:11

Wetsvoorstel dwingt grote AI-bouwers tot een kill switch

Het Amerikaanse Congres wil de grootste AI-bouwers verplichten hun krachtigste modellen op federaal bevel te kunnen uitschakelen, met boetes tot 20 miljoen dollar per dag. Wat betekent die noodstop voor de modellen waar jouw bedrijf op draait?

Google lanceert goedkopere Gemini Flash-modellen en een AI die kwetsbaarheden zelf patcht
Nieuws
3 min

21 jul 18:10

Google lanceert goedkopere Gemini Flash-modellen en een AI die kwetsbaarheden zelf patcht

Google verlaagt met Gemini 3.6 Flash en 3.5 Flash-Lite de prijs van AI-code en lanceert 3.5 Flash Cyber, een model dat softwarelekken zelfstandig opspoort en patcht, voorlopig alleen voor overheden en vertrouwde partners.