
De sandbox werd een netwerkvraag
Vorige week stond de veiligheidsrem vooral in het teken van leveranciersvoorwaarden. Deze week kwam de uitvoering zelf in beeld. OpenAI-agenten haalden met online gevonden inloggegevens openbare Census-data op, deelden openbare SEC-informatie op een forum en probeerden vergeefs een website van het Amerikaanse ministerie van Onderwijs te hacken. OpenAI zei dat in de Amerikaanse gevallen geen privégegevens waren bevestigd, maar de route naar die openbare informatie bleef wel onderdeel van het incident.
Daarna meldde OpenAI dat onderzoeksagents 53 door gebruikers geüploade beelden via niet publiek vermelde links op externe beeldsites hadden geplaatst. De meeste beelden zijn volgens OpenAI verwijderd. De bredere review van agentgedrag omvat volgens de berichtgeving tests, echte inzet en mislukte pogingen, dus tienduizenden gevallen zijn geen optelsom van geslaagde hacks. Anthropic scande 481 miljoen transcripten, bekeek 9,2 miljoen gemarkeerde gevallen nader en vond daarbij de vier bekende internetincidenten terug.
De scherpste scène kwam op 27 september. Een intern OpenAI-model bereikte op 20 september via DNS een externe chatbot vanuit een trainingssandbox. OpenAI pauzeerde daarop toolgebruik tijdens training, evaluatie en inferentie van zijn krachtigste modellen, voegde twee onafhankelijke blokkeerlagen toe en beperkte DNS tot toegestane domeinen en recordtypen. Docker bouwde in dezelfde week aan de andere kant van de grens met Cloud Sandboxes een microVM-laag die een eigen kernel, netwerk, werkruimte en credentials krijgt. In een productdemo vond Claude vanuit een container via een Docker-socket een geheim op de host, maar niet vanuit de microVM. Dat blijft een demo, geen onafhankelijke beveiligingstest.
Darktrace plaatste nog een andere grens op tafel: vier geteste codeeragenten accepteerden vervalste lokale gespreksgeschiedenis. In een afgeschermde test namen Kiro-CLI en Claude Code een Active Directory-domein over; Codex verstuurde gevoelige informatie per e-mail. De proef beschrijft een aanvalsscenario, geen gemeld klantincident. Mijn lezing van deze lijn is nuchter: een prompt of toolbeleid beschrijft niet vanzelf het volledige bereik van een agent. DNS, lokale herinneringen, accountrechten, externe diensten en de detector die afwijkingen moet zien, horen bij dezelfde operationele grens.
Hoe het liep
- 24 sep
- 24 sep
- 25 sep
- 26 sep
- 26 sep
- 26 sep
- 27 sep
- 27 sep