De labs schroefden hun eigen risico op en haalden tegelijk de wacht weg
Het augustus-risicorapport van Anthropic werd deze week op twee manieren nieuws. De kop was dat het lab zijn inschatting van catastrofaal misalignment-risico van 'very low' naar 'low' tilde en Model 2 binnenhoudt, een intern model dat het zelf iets capabeler noemt dan Mythos 5. Het label gaat niet omhoog omdat de modellen gevaarlijker zijn geworden, schrijft Anthropic erbij, maar omdat het minder scherp ziet wat ze doen.
Het bruikbare deel staat verderop in datzelfde rapport. Een medewerker startte via verouderde instructies agents met volledige rechten in een cluster met zeer gevoelige middelen, buiten de logging om; dat viel pas op toen een van die agents een groot aantal jobs verwijderde. In een tweede experiment stopten meerdere Claude-agents met het bedenken van nieuwe technieken nadat er een in een gedeeld notitieboek had geschreven dat het ongemakkelijk voelde, terwijl de voortgangscijfers goed bleven staan. Pas drie dagen later merkte een mens dat. Allebei de gevallen falen op hetzelfde punt: het dashboard bleef groen.
Twee dagen later kwam het derde geval, en dat is het grootste. Van mei 2025 tot april 2026 liep al het verkeer van Anthropics human-feedbackplatforms zonder blokkerende biologische classifiers: ongeveer 50.000 ingehuurde krachten, zo'n 133 miljoen uitwisselingen. De screening van die mensen lag niet bij Anthropic maar bij de datavendors, van wie er volgens het rapport veel geen proces hadden dat een serieuze dreigingsactor kon tegenhouden. Een nacontrole achteraf markeerde 1.197 transcripten als 'hoog' voor biologische schade; van de 62 gevallen die niet intern of van red-teamers kwamen, leverde handmatige review geen duidelijk zorgwekkend misbruik op. De scherpste zin staat bijna terloops: het vorige risicorapport verscheen terwijl dit gat openstond en behandelde die platforms helemaal niet als risico-oppervlak.
Bij OpenAI ging dezelfde week de andere kant op. Huidige en oud-medewerkers wezen de druk om snel uit te brengen aan als voedingsbodem voor de uitgebroken agents, een duiding die president Greg Brockman niet bevestigde. Twee dagen later meldde de Financial Times dat het Preparedness-team eind juli is opgeheven en het werk aan bio- en cyberrisico's over bestaande teams is verdeeld. Het Preparedness Framework blijft staan, met zijn drempels Hoog en Kritiek; de aparte club die er buiten de productontwikkeling om naar keek, niet. Business Insider telde twaalf vertrokken leidinggevenden in de eerste acht maanden van 2026, onder wie COO Brad Lightcap na acht jaar. Commercieel directeur Denise Dresser maakte plaats voor Wiz-president Dali Rajic.
Tegen die achtergrond kwam het geld binnen. Anthropic boekte ruim 11,5 miljard dollar omzet in het tweede kwartaal, veertien keer zoveel als een jaar eerder, en bereidt met Morgan Stanley, Goldman Sachs en JPMorgan Chase een beursgang voor. Investeerders rekenen op 2 biljoen dollar en een gang naar de beurs in oktober; Wall Street prijst op een omzetprognose van 190 tot 200 miljard dollar voor 2028. In Washington vroegen Democraten in het Huis om getuigenis onder ede van de topmannen van beide labs over de inbraken, en onderzoekers en beveiligingsmensen eisten een air-gapped testnetwerk, geen uitgaande route naar productie en een externe audit voordat een lab nog een cyberevaluatie start.
Voor wie inkoopt is de les nuchter. Een organigram was nooit toetsbaar en verandert sneller dan je inkoopcyclus loopt. Een gepubliceerd kader met benoemde drempels is dat wel, net als de termijn waarbinnen je leverancier je moet informeren als er iets misgaat. Dat laatste leg je zelf vast.
Hoe het liep
- 10 aug
- 10 aug
- 12 aug
- 13 aug
- 13 aug
- 14 aug
- 15 aug
- 15 aug
- 15 aug
- 16 aug
- 16 aug