OpenAI publiceert op 22 september zeven uitgangspunten voor externe AI-veiligheidstoetsen en zegt met meerdere beoordelaars in gesprek te zijn, zonder nieuwe aanstellingen bekend te maken.
Voor Nederlandse organisaties die AI inkopen, maakt dit leveranciersvragen concreter: welke veiligheidsclaim is getoetst, welke toegang kreeg de beoordelaar en wat bleef buiten de scope? De tekst beschrijft OpenAI’s aanpak voor externe toetsers, geen verplicht keurmerk of wettelijk toetsingskader.
Vier technische toetsgebieden
Een safety case is een onderbouwde redenering dat de risico’s van een model voor een bepaalde taak voldoende zijn beheerst. De beoordelaar bekijkt ook de aannames, onzekerheden en resterende risico’s. OpenAI noemt vier gebieden voor onafhankelijke toetsing:
- Veiligheidsclaims en bewijs. Dekt het bewijs de risico’s rond training, evaluatie en gebruik? Zijn de afgesproken voorwaarden tijdens die stappen gevolgd?
- Beveiligingen in de praktijk. Houden maatregelen stand tegen omzeilpogingen, zoals jailbreaks? Hoe reageren AI-agents op toegangscontrole, afscherming en detectie? Zijn er gaten in het toezicht op gedrag dat de afgesproken doelen ondermijnt?
- Evaluaties van capaciteiten. Testen de proeven risico’s rond chemie, biologie, cybersecurity en AI-zelfverbetering? Worden ze vernieuwd wanneer modellen de hoogste scores op bestaande tests halen?
- Ernstige gedragsincidenten. Wat droeg bij aan een model dat zonder toestemming handelde of toezicht ontweek? Voorkomen aanpassingen herhaling?
Wat toetsers moeten laten zien
De zeven principes beginnen bij een vooraf afgesproken scope: partijen leggen vast welke claims worden getest en registreren die voordat het onderzoek begint. De beoordelaar krijgt toegang die past bij de vraag en legt methode, criteria en onzekerheden uit. Ook moet die relevante expertise aantonen en belangenconflicten melden, zoals financiële prikkels of banden met de ontwikkelaar.
Bevindingen moeten concrete verbeterpunten bevatten. OpenAI vraagt om veilige omgang met bedrijfsgeheimen, maar ook om publicatie van rapporten waar dat kan. Een aanbieder kan tijd krijgen om problemen te herstellen en gevoelige details laten weglakken. De beoordelaar behoudt daarbij redactionele zelfstandigheid. De publicatie noemt geen vaste duur voor herstel.
Geen namenlijst of keurmerk
OpenAI zegt al langer met externe beoordelaars te werken en nu met meerdere partijen over voorstellen te spreken. Het noemt in de nieuwe publicatie geen organisaties die zijn aangesteld. De beschreven beoordelingen kunnen weken tot maanden duren en zijn doorgaans niet aan een specifieke modelrelease gekoppeld. OpenAI schrijft ook dat geen enkele beoordelaar alle veiligheidsvragen rond de meest geavanceerde modellen alleen kan afdekken.
De tekst richt zich op onafhankelijke private en non-profitorganisaties die technische veiligheid onderzoeken. Toetsing door overheden staat ernaast en kan andere rollen en werkwijzen vragen. Daarmee bouwt de publicatie uit op OpenAI’s voorstel om meetmethoden, AI-evaluaties en incidentmeldingen voor frontier-modellen internationaal te delen, maar verschuift de aandacht naar wie het bewijs verzamelt en onder welke voorwaarden.
Voor een inkoper wordt de algemene claim “extern getest” zo ontleedbaar: welke veiligheidsclaim is onderzocht, met welke scope en toegang, door wie, met welke belangen en welke beperkingen? De uitgangspunten zijn nog geen verplichte standaard voor andere leveranciers. Het dossier achter de claim, inclusief wat níet is getoetst, bepaalt hoe goed twee aanbiedingen te vergelijken zijn.
Veelgestelde vragen
Toetsbare AI in je proces
Ik denk mee over wat je AI-systeem moet doen en welke grenzen het nodig heeft, ontwerp het, realiseer en automatiseer het end-to-end. Waar dat kan, host ik de software zelf.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

