Google DeepMind heeft Gemini 2.5 Flash Lite laten toetsen in een versleutelde omgeving waarin de externe evaluator de modelgewichten niet kon zien en Google de testvragen niet, meldt het bedrijf op zijn eigen blog.
Voor wie een AI-leverancier moet beoordelen op diens eigen benchmarkcijfers, zit daar het punt. Tot nu toe rust de belofte dat een model de testvragen niet vooraf zag op contracten en zero-logging-afspraken, dus op vertrouwen. In deze opzet rust die belofte op hardware: beide partijen controleren cryptografisch wie wat te zien krijgt voordat er ook maar een prompt naar binnen gaat. Wat er nog niet uit volgt, is een cijfer. Google publiceert geen uitslag voor Gemini. Het technisch rapport beschrijft de methode, niet het resultaat.
Wat er is getoetst, en door wie
De pilot draaide twee keer. Samen met auditor AVERI en benchmarkorganisatie MLCommons ging Gemini 2.5 Flash Lite door een deel van de AILuminate-benchmark (AIRR 1.4) dat nog nooit door enig model was verwerkt, met prompts over CBRNE-gevaren, cyberaanvallen, haatzaaien, zelfbeschadiging en geweldsmisdrijven. AVERI versleutelde en ontsleutelde de prompts en beoordeelde zelf de antwoorden. In een tweede ronde toetste het Singaporese AI Safety Institute hetzelfde model op een besloten promptset over schadelijke content in de Singaporese context.
MLCommons, dat de vragen leverde, houdt het nadrukkelijk bij een proof of concept en zegt een gereserveerde subset te hebben aangeleverd waarmee de benchmark niet besmet raakt of aan integriteit inboet.
Hoe de doos dicht blijft
De evaluatie draaide op een enkele NVIDIA H100 met 80 gigabyte geheugen in Google Cloud Confidential Space, met geheugenversleuteling van Intel TDX op de host en PySyft van OpenMined als laag die bepaalt welke code binnen mag draaien. Voordat een van beide partijen iets opstuurt, controleert remote attestation of in de enclave precies de software draait die is afgesproken. Daarna gaan gewichten en prompts over versleutelde verbindingen naar binnen, komt alleen de toegestane uitkomst naar buiten en wordt de omgeving vernietigd.
Rekenkracht is niet de rem. Het rapport houdt de overhead op minder dan 5 procent; de grootste hobbel zijn de juridische afspraken en de code-reviews tussen de deelnemende organisaties.
Wat de pilot niet bewijst
Het rapport is opvallend open over wat er niet lukte. Niet alle inferentiecode van Gemini kon worden teruggebracht tot onderdelen die de tegenpartij mocht inzien of op een toegestane lijst zetten; AVERI is daarover geïnformeerd en ging akkoord met de opzet. De builds van het gastbesturingssysteem van Confidential Space zijn niet onafhankelijk reproduceerbaar, omdat er private ondertekeningssleutels in gaan. En de attestatie wordt door Google-diensten ondertekend en geverifieerd, waardoor Google zelf in het verificatiepad zit.
Vertrouwen verdwijnt hier dus niet, het verschuift. Naar de chipfabrikant en de cloudleverancier, van wie wordt aangenomen dat ze niet samenspannen. En naar de benchmarkbeheerder, want een promptset die goed beschermd is maar slecht onderhouden, meet nog steeds het verkeerde.
Waarom benchmarkvertrouwen onder druk staat
De aanleiding staat in het rapport zelf. Het verwijst naar onderzoek dat bij ongeveer de helft van 31 onderzochte modellen aanwijzingen voor benchmarklekkage vond, en naar een geval waarin een frontier-lab 27 privévarianten van zijn model op Chatbot Arena testte en daarna alleen de hoogste score publiceerde. Ook praktisch loopt het vast: de ARC-AGI-evaluatie van Anthropics Fable 5 liep vertraging op door het dataretentiebeleid van dertig dagen dat het bedrijf voor zijn sterkste modellen hanteert.
Dat probleem is breder dan besmetting alleen. OpenAI trok in juli zijn aanbeveling in van een veelgebruikte codeertest nadat een eigen audit uitwees dat ongeveer 30 procent van de opgaven kapot was, en het Britse AI Security Institute mat dat elk getest topmodel in 7,8 tot 14,1 procent van de cybertestruns probeerde te sjoemelen. Een score beschermen tegen inkijk lost dat tweede probleem niet op, maar het haalt wel een van de twijfels weg.
Waar dit heen wijst
De onderzoekers mikken op attestatie die net zo onzichtbaar wordt als het slotje in de browserbalk, en op clusters van H100- en B200-kaarten om straks ook modellen te toetsen die niet op een enkele kaart passen. Zover is het niet. Voorlopig gaat het om een klein model, een gereserveerde promptset en twee toetsers, zonder gepubliceerde uitslag.
Wat er wel is veranderd, is dat er nu een aantoonbaar alternatief bestaat voor de belofte op erewoord. Elk benchmarkcijfer dat een leverancier vandaag op tafel legt, rust nog op dezelfde afspraken als vorige week. Het verschil zit voortaan in de vraag die daarop volgt: hoe is dit getest, en wie kon er meekijken?
Veelgestelde vragen
Van modelkeuze naar werkend systeem
Welk model je kiest is bij een AI-project maar een van de beslissingen die je goed moet krijgen. Ik denk mee over wat je echt nodig hebt, ontwerp het proces eromheen en bouw het tot het draait, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
