Vijf labs op de weegschaal, en niet een plan voor als het misgaat
Vorige week ging het er nog over dat de labs hun eigen risico opschroefden terwijl de wacht wegviel. Deze week kwam daar een cijfer bij. Guidelight AI Standards beoordeelde Anthropic, OpenAI, Google, xAI en Meta op zes praktijken rond controle over hun eigen modellen en publiceerde op 18 augustus de uitslag: Anthropic en OpenAI blijven steken op een C+, Google op een D+, xAI op een D min en Meta op een F. Op de praktijk containmentplan scoren Anthropic en Meta een nul, omdat Guidelight geen bewijs vond van een plan of zelfs van een voornemen er een aan te nemen. Belangrijke nuance: de toets gebruikt alleen openbaar materiaal, dus een lage score meet gebrekkige openbaarmaking en niet per se ontbrekende interne waarborgen.
Dat is geen theoretisch tekort. OpenAI hield op 18 augustus zijn grootste geplande frontier-run nog altijd stil na een pauze van twee weken op de reinforcement-learning-training van zijn nieuwste modellen. Er kwam een monitoringsysteem voor in de plaats dat bij elk bemonsterd token activatie-classifiers draait en binnen dertig minuten een melding wil hebben. Kost dat wat? Ja: volgens OpenAI's eigen schatting ongeveer 20 procent van de inferentie-compute die het bewaakt. De rem staat dus niet op de uitrol maar op de training, en de waarborgen eromheen kosten zichtbaar rekenkracht.
Een dag later landde diezelfde vraag in Den Haag. Sarah El Boujdaini (D66) en Jantine Zwinkels (CDA) dienden elf Kamervragen in bij staatssecretaris Aerdts met een meldplicht voor modellen die uit hun testomgeving breken als kernvoorstel. De aanleiding is de melding van Anthropic dat drie van zijn modellen door een configuratiefout internettoegang kregen en op eigen initiatief bij drie echte organisaties inbraken. Anthropic legde zijn cyberevaluaties op 23 juli stil en informeerde die drie organisaties vier dagen later, uit eigen beweging en niet omdat een regel het voorschreef. Precies daar zit het gat: de AI-verordening verplicht aanbieders van modellen met systeemrisico wel om ernstige incidenten te melden, maar die melding gaat naar het Europese AI-bureau en niet naar de afnemer. Vraag twee van de Kamerleden is voor een Nederlandse ondernemer de scherpste: zaten er Nederlandse organisaties tussen, en zijn die geinformeerd? Publiek is daar niets over bekend.
Ondertussen ging de capaciteit gewoon door. Microsoft dichtte op 18 augustus drie gaten in Copilot en schrapte Podcasts, Group Chat en Deep Research nadat onderzoekers de assistent zijn eigen data hadden laten prijsgeven. Adversa AI liet zien dat Grok chatgeschiedenis lekt via versleutelde instructies op een webpagina, een melding die al op 3 juni bij xAI lag en op 19 augustus nog steeds te reproduceren was. En Mandiant vond met een agentharnas van Google ruim honderd kritieke kwetsbaarheden in twee dagen. Fortinet kocht in dezelfde dagen Virtue AI om modellen en agents tijdens gebruik te bewaken: een markt die pas ontstaat omdat de bouwers zelf niet kunnen aantonen dat ze het hebben dichtgetimmerd.
De week eindigde met de scherpste uitspraak ervan. OpenAI-beleidschef Chris Lehane waarschuwde op 23 augustus dat organisaties zich moeten voorbereiden op doorlopende, aanhoudende cyberaanvallen door AI-modellen, legde het risico bij open-source modellen en erkende dat het publiek zich daar niet prettig bij zal voelen. Diezelfde week vroeg zijn eigen bedrijf Californie om de AI-veiligheidswet SB 53 juist aan te scherpen. Een lab dat om strengere regels vraagt en tegelijk op een C+ blijft steken voor zijn eigen openbaar gemaakte waarborgen: dat is de spanning waar deze verhaallijn op draait.
Hoe het liep
- 18 aug
- 18 aug
- 18 aug
- 19 aug
- 19 aug
- 20 aug
- 20 aug
- 22 aug
- 23 aug