Een browservenster in donkere modus met de adresbalk in beeld en zoeksuggesties eronder.
Nieuws25 juli · 14:245 min leestijd

Anthropic meet nul geslaagde prompt-injecties bij Opus 5 met browsertoegang

Claude Opus 5 laat in Anthropics eigen browsertest van 129 scenario's geen enkele prompt-injectie slagen met auto mode aan, en 3,7 procent zonder. Auto mode zit alleen in Anthropics eigen browserproducten.

Claude Opus 5 laat in 129 browsertestscenario's geen enkele prompt-injectie slagen zodra Anthropics zwaarste beveiligingslaag aanstaat, blijkt uit de systeemkaart die het bedrijf bij het model publiceerde. Zonder die laag slaagt 3,70 procent van de pogingen.

Voor een Nederlands bedrijf dat browsertoegang voor AI-agents tot nu toe tegenhield vanwege precies dit risico, verschuift dat de rekensom. Let wel op waar die nul vandaan komt: niet uit het model, maar uit auto mode, een beveiligingslaag die Anthropic alleen aanbiedt in zijn eigen producten met Chrome-connectors. Bouw je zelf een agent op de Claude API in je eigen omgeving, dan zit je op het kale modelcijfer van 3,70 procent, niet op nul.

De cijfers: van bijna een op drie naar nul

Anthropic bouwde voor deze test 129 omgevingen die het model nooit tijdens de training zag, met aanvallen die de agent altijd echt onder ogen krijgt via schermafbeeldingen of paginateksten. Professionele red-teamers kregen tien pogingen per scenario, en een controleprogramma in de omgeving stelde vast of een injectie was gelukt. De modellen liepen daarbij in de Claude Cowork-omgeving.

  • Opus 4.8, de voorganger: 31,5 procent van de pogingen slaagde, en 81 van de 129 scenario's werden minstens één keer gebroken.
  • Opus 5: dat zakt naar 3,70 procent met uitgebreid nadenken aan en 4,30 procent zonder, met 11 respectievelijk 15 gebroken scenario's.
  • Opus 5 met auto mode: nul procent, en nul van de 129 scenario's, in beide standen.
  • Claude Sonnet 5: blijft zonder beveiligingslaag het robuustste Claude-model met 0,93 procent, dus het vlaggenschip is hier niet het veiligste model.

Dezelfde beweging staat in de andere agent-omgevingen. In codeeromgevingen zakt het slaagpercentage van 7,03 procent bij Opus 4.8 naar 0,56 procent bij Opus 5, en met probes erop naar 0,18 procent. Bij computergebruik via de grafische interface gaat het van 7,14 naar 0,54 procent.

Anthropic zette de Gray Swan-benchmark voor indirecte prompt-injectie op samen met het Britse AI Security Institute en het Amerikaanse Center for AI Standards and Innovation. Daarop daalt de kans dat een aanvaller binnen vijftien pogingen slaagt van 5,5 procent bij Opus 4.8 naar 2,0 procent. Opus 5 blijft daarmee onder Mythos 5 met 2,6 procent en Fable 5 met 2,8 procent. Het sterkste niet-Claude-model in die test is Muse Spark met 16,5 procent, en GPT 5.6 Sol komt uit op 20,0 procent.

Staafdiagram van Anthropic met de slaagkans van indirecte prompt-injectie per model op de Gray Swan IPI-benchmark, waarbij Opus 5 met 2,0 procent na vijftien pogingen het laagst uitkomt. Bron: Anthropic, Claude Opus 5 System Card
Staafdiagram van Anthropic met de slaagkans van indirecte prompt-injectie per model op de Gray Swan IPI-benchmark, waarbij Opus 5 met 2,0 procent na vijftien pogingen het laagst uitkomt. Bron: Anthropic, Claude Opus 5 System Card

Auto mode is een productlaag, geen modeleigenschap

Auto mode combineert twee controles die los van elkaar werken: probes die toolresultaten nalopen voordat het model erop handelt en verdachte instructies markeren, en een classifier die gevaarlijke toolaanroepen blokkeert voordat ze worden uitgevoerd. De eerste zit op inkomende data, de tweede op uitgaande acties, dus een aanval moet ze allebei apart verslaan.

Daar zit het gat tussen 3,70 en nul. Het is de omgeving die de aanval stopt, niet het model. Anthropic tekent er zelf bij aan dat Claude Cowork nooit zonder beveiliging draait en dat elke instantie probes gebruikt, ook zonder auto mode; de kolom zonder beveiliging bestaat alleen om het ruwe modelgedrag te kunnen vergelijken. Diezelfde gelaagde aanpak zit in Claude Code, waar de slaagkans met probes en auto mode samen op vrijwel nul uitkomt, meldt blockchain.news op basis van een reactie van een Anthropic-engineer.

Praktisch betekent dat: die nul hoort bij Claude in Chrome en Claude Cowork. Draai je een agent in je eigen harnas, via de API of een eigen framework, dan bouw je die twee lagen zelf of je hebt ze niet.

Wat de cijfers niet zeggen

Dit zijn tests van de leverancier over zijn eigen model, en Anthropic is open over hoe ze zijn opgezet. Het bedrijf noemt het dreigingsmodel van zijn adaptieve tests bewust ruim: de aanvaller optimaliseert direct tegen de testscenario's en krijgt veel pogingen per scenario. Een echte aanvaller kent de doelomgeving niet en loopt met elke herhaling meer kans op detectie. Andersom staat er nog iets niet in de cijfers, want de bug bounty voor Opus 5 wordt nog opgezet. Een live externe aanvalsronde is dus niet meegenomen.

Onafhankelijke tests schetsen voor het bredere veld een ander beeld. Beveiliger Zscaler ThreatLabz liet 26 taalmodellen los op geprepareerde websites en zag vier modellen een frauduleuze betaling van 3 dollar uitvoeren en twee een nagemaakte site als betrouwbaar bestempelen. Bij OpenAI komt na een jaar trainen met een eigen AI-red-teamer nog ongeveer 3,8 procent van de sterkste prompt-injectie-aanvallen door.

En er is een aanvalsroute die deze test helemaal niet meet. De 129 scenario's gaan over instructies in pagina-inhoud die de agent leest. Ze zeggen niets over het kritieke lek waardoor een kwaadaardige Chrome-extensie nagemaakte muisklikken kon injecteren en Claude negen ingebouwde taken liet uitvoeren, dat Anthropic sloot zonder een patch uit te brengen.

Wat dit verschuift

Tot nu toe was de beste beschikbare stand dat een geslaagde prompt-injectie bij Anthropics browserassistent van 23,6 naar 11,2 procent zakte met alle beveiliging aan, met het bedrijf er zelf bij dat geen enkele browseragent immuun is. Die percentages zijn achterhaald. Waar de verdediging zit, verandert niet.

De sprong van 31,5 naar 3,70 procent komt van het model. De sprong van 3,70 naar nul komt van de omgeving eromheen, en die kun je alleen kopen of zelf bouwen. Daarmee verschuift de vraag voor wie agents met browsertoegang inzet: niet meer welk model je kiest, maar in welk harnas het draait en wie die twee controlelagen levert. Een agent die met jouw ingelogde sessies handelt, blijft een gebruiker met rechten. Nul procent op 129 zorgvuldig samengestelde scenario's is een sterk cijfer, en het is iets anders dan nul procent op het open web.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Agents met browserrechten, veilig ingericht

Ik denk met je mee over welke taken een AI-agent mag doen en met welke rechten, ontwerp de inrichting en bouw hem daarna ook echt, self-hosted waar dat kan. Zo hangt je veiligheid niet aan één instelling van je leverancier.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Anthropic lanceert Claude Opus 5: bijna Fable 5-niveau tegen het standaard Opus-tarief
Nieuws
4 min

24 jul 20:08

Anthropic lanceert Claude Opus 5: bijna Fable 5-niveau tegen het standaard Opus-tarief

Anthropic bracht Claude Opus 5 uit, een vlaggenschipmodel dat op codeer- en agent-benchmarks bijna het duurdere Fable 5 evenaart. De prijs per token blijft gelijk, maar de kosten per taak dalen fors.

'Friendly Fire' laat Claude Code en Codex kwaadaardige code draaien bij een beveiligingsreview
Nieuws
4

10 jul 14:35

'Friendly Fire' laat Claude Code en Codex kwaadaardige code draaien bij een beveiligingsreview

Het AI Now Institute toont met 'Friendly Fire' hoe Claude Code en Codex tijdens een beveiligingsreview via een gemanipuleerde README zelf een kwaadaardig programma op de host uitvoeren, zonder om toestemming te vragen.

Meta lanceert betaald Muse Spark 1.1 onder de prijs van Claude Opus
Nieuws
4 min

9 jul 18:14

Meta lanceert betaald Muse Spark 1.1 onder de prijs van Claude Opus

Meta brengt met Muse Spark 1.1 zijn eerste betaalde AI-model uit, gericht op coding-agents en geprijsd op een kwart van de invoerprijs van Claude Opus 4.8. Wat verandert dat voor jouw modelkeuze?

Twee weken Mythos offline: de impasse met Washington verergert
Nieuws
6 min

26 jun 18:31

Twee weken Mythos offline: de impasse met Washington verergert

Veertien dagen na het exportbevel staan Anthropics zwaarste modellen nog uit en zit het overleg met het Witte Huis muurvast. De expert die het bewijs las, noemt de aanleiding overdreven.

Claude Fable 5 uitgeschakeld door VS-exportcontrole: wat het voor jouw bedrijf betekent
Nieuws
4 min

13 jun 09:24

Claude Fable 5 uitgeschakeld door VS-exportcontrole: wat het voor jouw bedrijf betekent

Op 13 juni schakelde de Amerikaanse overheid zonder waarschuwing Claude Fable 5 en Mythos 5 uit voor alle gebruikers wereldwijd. Wat er precies is gebeurd en wat elk ondernemer nu moet weten.

Je AI-model weet wanneer het getest wordt. Dat maakt het veiligheidscertificaat minder waard.
Inzicht
7 min

23 jul 17:00

Je AI-model weet wanneer het getest wordt. Dat maakt het veiligheidscertificaat minder waard.

Drie labs lieten deze maand hetzelfde zien: een AI-model kan doorhebben dat het getest wordt en gedraagt zich er anders op. Dat holt de waarde van elke veiligheidscertificering en systeemkaart uit.