AI-evaluatoren eisen in een publieke brief onafhankelijke toegang tot frontier-modellen van Anthropic, OpenAI en andere labs, met vrijheid om methoden en bevindingen zelf te bepalen, meldt Quartz.
Voor een Nederlandse organisatie die een frontier-model in een product, klantenservice of interne agent stopt, verandert daarmee de leverancierscheck. Een audit is pas bruikbaar als vaststaat wie de vragen stelt, hoeveel toegang en tijd er is en of de evaluator een onwelgevallige uitkomst kan publiceren. Daarmee worden evaluatievoorwaarden een inkoop- en continuïteitsvraagstuk, naast prijs, prestaties en beschikbaarheid.
Onafhankelijk betekent meer dan extern
De brief maakt het woord onafhankelijk concreet. De ondertekenaars vragen frontier-labs om evaluatoren die zelf hun onderzoek kunnen afbakenen en hun conclusies kunnen publiceren. Hun minimumvoorwaarden zijn:
- Geen afhankelijk belang: de evaluator mag geen eigendom, bestuur of ander zwaar commercieel belang met het onderzochte lab delen. Betaling mag niet afhangen van de uitkomst.
- Eigen methode en tekst: evaluatoren moeten hun methoden kunnen kiezen en volledige redactionele controle houden. Het lab mag bevindingen niet wegredigeren omdat ze ongunstig zijn.
- Echte toegang: de onderzoekers moeten toegang krijgen tot dezelfde relevante systemen, data, hulpmiddelen en werkruimtes als vergelijkbare interne risico-teams, met directe gesprekken met medewerkers.
- Bescherming tegen vergelding: de brief vraagt bescherming tegen ontslag, juridische tegenactie en het verliezen van financiering nadat een evaluator een kritische conclusie trekt.
De brief vraagt ook om meerdere evaluatieorganisaties met verschillende deskundigheden. Zo moet niet één ingehuurde partij bepalen welke risico's meetellen. Bevindingen zouden snel met besturen en andere toezichthoudende organen moeten kunnen worden gedeeld. Openbare publicatie mag alleen tijdelijk worden beperkt voor concrete belangen zoals privacy, klantdata, beveiliging of intellectueel eigendom.
Wie de brief ondertekent
Quartz schrijft dat meer dan honderd AI-onderzoekers en evaluatoren de oproep steunen. Op de openbare lijst staan onder meer Yoshua Bengio, Yejin Choi, Dawn Song, Percy Liang, Arvind Narayanan, Elizabeth Barnes van METR, Miles Brundage van AVERI, Rebecca Finlay van Partnership on AI en Conrad Stosz van Transluce. Ook onderzoekers van Stanford, Johns Hopkins, MIT, Princeton en UC Berkeley staan vermeld.

De oproep volgt op het voorstel van Anthropic-topman Dario Amodei om evaluatoren doorlopend toegang op werknemerniveau te geven tot frontier-labs. In dat voorstel mogen externe reviewers onder meer interne hulpmiddelen gebruiken en belangrijke bevindingen publiceren zonder redactionele controle door Anthropic. OpenAI-topman Sam Altman sprak steun uit voor dezelfde richting, meldt Quartz.
Van veiligheidsorgaan naar controleerbare voorwaarden
De stap sluit aan bij het overleg over een vrijwillige veiligheidsstandaard die release en modeltoegang kan beïnvloeden, maar maakt de controlelaag concreter. Het gaat nu over twee vragen: welke tests een mogelijk industrieorgaan zou voorschrijven en wie de test mag uitvoeren, welke gegevens die partij ziet en wat er met de uitkomst gebeurt.
Het AI Evaluator Forum verwijst daarbij naar de AEF-1-standaard voor minimale toegang, onafhankelijkheid en transparantie. Die standaard bestaat al en beschrijft onder meer voldoende tijd en middelen, beperking van belangenconflicten, eigen analysekaders, publicatierechten en bescherming van gevoelige informatie.
Voor Nederlandse inkopers draait het dus om een veiligheidsrapport én de voorwaarden eronder. Een onafhankelijke partij moet de claims kunnen toetsen zonder toestemming van de leverancier voor de methode, de toegang of de conclusie.
Dat vertaalt zich naar een controleerbaar dossier bij iedere modelwissel: welke versie is getest, welke omgeving zag de evaluator, welke beperkingen golden en welke bevindingen zijn geredigeerd. Zonder die gegevens zijn rapporten moeilijk vergelijkbaar tussen leveranciers en blijft de klant afhankelijk van de eigen selectie van het lab.
Zolang dat niet vastligt, is onafhankelijk getest geen vaste producteigenschap, maar een belofte die per contract en per release opnieuw moet worden gecontroleerd.
Veelgestelde vragen
Toetsbare AI voor je organisatie
Ik help je AI-systemen ontwerpen en bouwen met duidelijke grenzen, logging en controlepunten. Ik denk mee over de architectuur, ontwerp de oplossing en lever haar end-to-end op, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
