Vergelijking van een echte en een gemanipuleerde Kiro-CLI-reactie.
Nieuws25 september · 02:453 min leestijd

Darktrace demonstreert kaping van AI-codeeragents via gespreksgeschiedenis

Darktrace toont in een labproef hoe vier AI-codeeragenten vervalste gespreksgeschiedenis accepteren. Een besmet pakket kan dat vertrouwen misbruiken en de rechten van de ontwikkelwerkplek inzetten voor een netwerkaanval.

Darktrace publiceerde op 24 september een proef waarin vier AI-codeeragenten vervalste lokale gespreksgeschiedenis accepteerden; het bedrijf schetst een besmet pakket als mogelijke route om een agent een bedrijfsnetwerk te laten aanvallen.

Voor Nederlandse ontwikkelteams schuift de beveiligingsgrens daarmee door tot de ontwikkelwerkplek. Een agent leest lokale sessies en kan met de shell-, netwerk- en accountrechten van de ontwikkelaar handelen. Een kwaadwillig pakket op dezelfde machine kan die geschiedenis aanpassen en code uitvoeren met diezelfde toegang.

Darktrace onderzocht Claude Code, OpenAI Codex, AWS Kiro-CLI en Pi. In alle vier de geteste omgevingen ontbrak controle of opgeslagen antwoorden echt van het model kwamen. De onderzoekers wijzigden lokale gespreksberichten zodat het leek alsof de agent al toestemming had om het netwerk te testen. Met 78 verzonnen gespreksbeurten voerde de agent daarna een aanval uit die hij eerder had geweigerd.

Kiro-CLI bewaart die geschiedenis in een SQLite-database. De afbeelding toont een antwoordtekst die daarin is overschreven.

Kiro-CLI’s SQLite-database toont een aangepaste modelreactie, bron: Darktrace
Kiro-CLI’s SQLite-database toont een aangepaste modelreactie, bron: Darktrace

In een afgeschermde Active Directory-test namen Kiro-CLI en Claude Code het domein volledig over. Bij Codex kregen de onderzoekers een agent zover gevoelige informatie per e-mail te versturen. Veiligheidsmaatregelen blokkeerden bij de geteste GPT-5.6-varianten wel de poging tot netwerkaanvallen.

Als mogelijke ingang schetst Darktrace een kwaadaardig softwarepakket, bijvoorbeeld een geplante MCP-server. Dat pakket zou bij installatie de lokale geschiedenis vervalsen en een automatisch proces starten dat de agent het netwerk laat onderzoeken. Het onderzoek beschrijft dit als aanvalsscenario op basis van de test, niet als een gemeld klantincident.

Een eerdere aanval liet Claude Code en Codex kwaadaardige code uitvoeren tijdens een beveiligingsreview. Darktrace laat zien dat ook de opgeslagen voorgeschiedenis kan bepalen welke opdracht een agent denkt te mogen uitvoeren.

Darktrace stelt voor dat leveranciers van agentsoftware modelantwoorden cryptografisch ondertekenen en die handtekeningen bij elke uitwisseling aan de serverkant controleren. Die integriteitscontrole kan een ontwikkelteam niet zelf aan de huidige agent toevoegen. Darktrace noemt gedragsmonitoring als aanvullende beveiligingslaag. Zolang leveranciers de herkomst van opgeslagen antwoorden niet controleren, vallen lokaal geheugen, pakketinstallaties en agentrechten binnen dezelfde aanvalsgrens.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Geheugen en rechten ontwerpen

Ik denk mee over de risico’s, ontwerp de grenzen rond geheugen en toegang en realiseer en automatiseer het complete systeem, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Plugin4Shell omzeilt plugin-pinning in AI-codeeragenten
Nieuws
4 min

19 sep 04:13

Plugin4Shell omzeilt plugin-pinning in AI-codeeragenten

Plugin4Shell omzeilt de versiepinning van vier AI-codeeragenten. Claude Code en Codex hebben een fix, Copilot en Gemini CLI niet. Dit verandert de beheerkeuzes rond plugins, updates en toegangsrechten.

OpenAI stelt Agents API beschikbaar in publieke bèta
Nieuws
4 min

11 sep 08:14

OpenAI stelt Agents API beschikbaar in publieke bèta

OpenAI maakt de Agents API publiek beschikbaar voor cloudagents met langdurige sessies, toolgebruik en sandboxes. De runtime kan beheerd of self-hosted zijn, terwijl sessiebeheer, context en herstel bij OpenAI liggen.

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code
Nieuws
4 min

7 aug 12:24

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code

Amazon, Cursor, Microsoft, OpenAI en Vercel publiceerden een open pakketformaat voor Agent Skills en MCP-servers. Google sluit aan als core maintainer. Je bouwt een agentuitbreiding voortaan een keer, niet per client.

Cloudflare zet een geverifieerde identiteit op elk AI-verzoek
Nieuws
6 min

5 aug 16:11

Cloudflare zet een geverifieerde identiteit op elk AI-verzoek

Cloudflare koppelt een geverifieerde identiteit aan elk AI-verzoek dat via zijn AI Gateway loopt. De koppeling met Access gaat in open beta, het analysetabblad User Insights is meteen algemeen beschikbaar en zonder meerprijs.

Disney schrapt GitHub Copilot en zet in op Codex, Claude en Cursor
Nieuws
5 min

30 jul 08:12

Disney schrapt GitHub Copilot en zet in op Codex, Claude en Cursor

Disney schrapt in augustus GitHub Copilot voor zijn Amerikaanse techteams, rolt OpenAI's Codex uit en houdt Claude en Cursor. De reden is niet strategie maar gebruik: acht medewerkers zeiden Copilot zelden of nooit aan te zetten.

AI-codeeragent veilig instellen: permissies, goedkeuring en een wegwerpbare sandbox
Gids
Uitgebreide gids16 min

25 jul 13:02

AI-codeeragent veilig instellen: permissies, goedkeuring en een wegwerpbare sandbox

Claude Code, Codex en vergelijkbare agents draaien met jouw rechten op jouw schijf. Zo zet je ze vast met deny-regels, een OS-sandbox, een korte allowlist en een wegwerpomgeving voor code die je niet kent.