Een browservenster in donkere modus met de adresbalk in beeld en zoeksuggesties eronder.
Nieuws25 juli · 14:245 min leestijd

Anthropic meet nul geslaagde prompt-injecties bij Opus 5 met browsertoegang

Claude Opus 5 laat in Anthropics eigen browsertest van 129 scenario's geen enkele prompt-injectie slagen met auto mode aan, en 3,7 procent zonder. Auto mode zit alleen in Anthropics eigen browserproducten.

Claude Opus 5 laat in 129 browsertestscenario's geen enkele prompt-injectie slagen zodra Anthropics zwaarste beveiligingslaag aanstaat, blijkt uit de systeemkaart die het bedrijf bij het model publiceerde. Zonder die laag slaagt 3,70 procent van de pogingen.

Voor een Nederlands bedrijf dat browsertoegang voor AI-agents tot nu toe tegenhield vanwege precies dit risico, verschuift dat de rekensom. Let wel op waar die nul vandaan komt: niet uit het model, maar uit auto mode, een beveiligingslaag die Anthropic alleen aanbiedt in zijn eigen producten met Chrome-connectors. Bouw je zelf een agent op de Claude API in je eigen omgeving, dan zit je op het kale modelcijfer van 3,70 procent, niet op nul.

De cijfers: van bijna een op drie naar nul

Anthropic bouwde voor deze test 129 omgevingen die het model nooit tijdens de training zag, met aanvallen die de agent altijd echt onder ogen krijgt via schermafbeeldingen of paginateksten. Professionele red-teamers kregen tien pogingen per scenario, en een controleprogramma in de omgeving stelde vast of een injectie was gelukt. De modellen liepen daarbij in de Claude Cowork-omgeving.

  • Opus 4.8, de voorganger: 31,5 procent van de pogingen slaagde, en 81 van de 129 scenario's werden minstens één keer gebroken.
  • Opus 5: dat zakt naar 3,70 procent met uitgebreid nadenken aan en 4,30 procent zonder, met 11 respectievelijk 15 gebroken scenario's.
  • Opus 5 met auto mode: nul procent, en nul van de 129 scenario's, in beide standen.
  • Claude Sonnet 5: blijft zonder beveiligingslaag het robuustste Claude-model met 0,93 procent, dus het vlaggenschip is hier niet het veiligste model.

Dezelfde beweging staat in de andere agent-omgevingen. In codeeromgevingen zakt het slaagpercentage van 7,03 procent bij Opus 4.8 naar 0,56 procent bij Opus 5, en met probes erop naar 0,18 procent. Bij computergebruik via de grafische interface gaat het van 7,14 naar 0,54 procent.

Anthropic zette de Gray Swan-benchmark voor indirecte prompt-injectie op samen met het Britse AI Security Institute en het Amerikaanse Center for AI Standards and Innovation. Daarop daalt de kans dat een aanvaller binnen vijftien pogingen slaagt van 5,5 procent bij Opus 4.8 naar 2,0 procent. Opus 5 blijft daarmee onder Mythos 5 met 2,6 procent en Fable 5 met 2,8 procent. Het sterkste niet-Claude-model in die test is Muse Spark met 16,5 procent, en GPT 5.6 Sol komt uit op 20,0 procent.

Staafdiagram van Anthropic met de slaagkans van indirecte prompt-injectie per model op de Gray Swan IPI-benchmark, waarbij Opus 5 met 2,0 procent na vijftien pogingen het laagst uitkomt. Bron: Anthropic, Claude Opus 5 System Card
Staafdiagram van Anthropic met de slaagkans van indirecte prompt-injectie per model op de Gray Swan IPI-benchmark, waarbij Opus 5 met 2,0 procent na vijftien pogingen het laagst uitkomt. Bron: Anthropic, Claude Opus 5 System Card

Auto mode is een productlaag, geen modeleigenschap

Auto mode combineert twee controles die los van elkaar werken: probes die toolresultaten nalopen voordat het model erop handelt en verdachte instructies markeren, en een classifier die gevaarlijke toolaanroepen blokkeert voordat ze worden uitgevoerd. De eerste zit op inkomende data, de tweede op uitgaande acties, dus een aanval moet ze allebei apart verslaan.

Daar zit het gat tussen 3,70 en nul. Het is de omgeving die de aanval stopt, niet het model. Anthropic tekent er zelf bij aan dat Claude Cowork nooit zonder beveiliging draait en dat elke instantie probes gebruikt, ook zonder auto mode; de kolom zonder beveiliging bestaat alleen om het ruwe modelgedrag te kunnen vergelijken. Diezelfde gelaagde aanpak zit in Claude Code, waar de slaagkans met probes en auto mode samen op vrijwel nul uitkomt, meldt blockchain.news op basis van een reactie van een Anthropic-engineer.

Praktisch betekent dat: die nul hoort bij Claude in Chrome en Claude Cowork. Draai je een agent in je eigen harnas, via de API of een eigen framework, dan bouw je die twee lagen zelf of je hebt ze niet.

Wat de cijfers niet zeggen

Dit zijn tests van de leverancier over zijn eigen model, en Anthropic is open over hoe ze zijn opgezet. Het bedrijf noemt het dreigingsmodel van zijn adaptieve tests bewust ruim: de aanvaller optimaliseert direct tegen de testscenario's en krijgt veel pogingen per scenario. Een echte aanvaller kent de doelomgeving niet en loopt met elke herhaling meer kans op detectie. Andersom staat er nog iets niet in de cijfers, want de bug bounty voor Opus 5 wordt nog opgezet. Een live externe aanvalsronde is dus niet meegenomen.

Onafhankelijke tests schetsen voor het bredere veld een ander beeld. Beveiliger Zscaler ThreatLabz liet 26 taalmodellen los op geprepareerde websites en zag vier modellen een frauduleuze betaling van 3 dollar uitvoeren en twee een nagemaakte site als betrouwbaar bestempelen. Bij OpenAI komt na een jaar trainen met een eigen AI-red-teamer nog ongeveer 3,8 procent van de sterkste prompt-injectie-aanvallen door.

En er is een aanvalsroute die deze test helemaal niet meet. De 129 scenario's gaan over instructies in pagina-inhoud die de agent leest. Ze zeggen niets over het kritieke lek waardoor een kwaadaardige Chrome-extensie nagemaakte muisklikken kon injecteren en Claude negen ingebouwde taken liet uitvoeren, dat Anthropic sloot zonder een patch uit te brengen.

Wat dit verschuift

Tot nu toe was de beste beschikbare stand dat een geslaagde prompt-injectie bij Anthropics browserassistent van 23,6 naar 11,2 procent zakte met alle beveiliging aan, met het bedrijf er zelf bij dat geen enkele browseragent immuun is. Die percentages zijn achterhaald. Waar de verdediging zit, verandert niet.

De sprong van 31,5 naar 3,70 procent komt van het model. De sprong van 3,70 naar nul komt van de omgeving eromheen, en die kun je alleen kopen of zelf bouwen. Daarmee verschuift de vraag voor wie agents met browsertoegang inzet: niet meer welk model je kiest, maar in welk harnas het draait en wie die twee controlelagen levert. Een agent die met jouw ingelogde sessies handelt, blijft een gebruiker met rechten. Nul procent op 129 zorgvuldig samengestelde scenario's is een sterk cijfer, en het is iets anders dan nul procent op het open web.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Agents met browserrechten, veilig ingericht

Ik denk met je mee over welke taken een AI-agent mag doen en met welke rechten, ontwerp de inrichting en bouw hem daarna ook echt, self-hosted waar dat kan. Zo hangt je veiligheid niet aan één instelling van je leverancier.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Anthropic geeft Claude Cowork een eigen browser in de desktop-app
Nieuws
4 min

27 aug 14:23

Anthropic geeft Claude Cowork een eigen browser in de desktop-app

Claude Cowork heeft sinds 26 augustus een eigen browser in de desktop-app, los van je tabbladen, bookmarks en wachtwoorden. Logins gaan er per site heen, bank, mail en single sign-on standaard niet.

Anthropic verlaagt cache reads van Claude Fable 5.1 met 75 procent
Nieuws
5 min

1 sep 22:09

Anthropic verlaagt cache reads van Claude Fable 5.1 met 75 procent

Anthropic maakt cache reads voor Claude Fable 5.1 75 procent goedkoper, naar 0,25 dollar per miljoen tokens. Het tokentarief zelf blijft gelijk, dus je besparing hangt af van hoeveel context je herleest.

OpenAI groeit harder dan Anthropic in zakelijke AI-uitgaven: 82 tegen 76 procent
Nieuws
5 min

21 aug 12:12

OpenAI groeit harder dan Anthropic in zakelijke AI-uitgaven: 82 tegen 76 procent

Tokendata van betaalbedrijf Ramp laten zien dat OpenAI dit kwartaal harder groeit in zakelijke AI-uitgaven dan Anthropic, 82 tegen 76 procent. In adoptie ligt Anthropic nog voor, maar de rangorde kantelt per modelrelease.

Anthropic zet Claude Code per 14 augustus standaard in auto mode
Nieuws
6 min

8 aug 18:08

Anthropic zet Claude Code per 14 augustus standaard in auto mode

Vanaf 14 augustus start elke nieuwe Claude Code-sessie op Pro, Max en Team in auto mode, waarin een classifier goedkeurt. Wat dat betekent voor teams die handmatige goedkeuring als controlemaatregel hebben vastgelegd.

Anthropic lanceert Claude Opus 5: bijna Fable 5-niveau tegen het standaard Opus-tarief
Nieuws
4 min

24 jul 20:08

Anthropic lanceert Claude Opus 5: bijna Fable 5-niveau tegen het standaard Opus-tarief

Anthropic bracht Claude Opus 5 uit, een vlaggenschipmodel dat op codeer- en agent-benchmarks bijna het duurdere Fable 5 evenaart. De prijs per token blijft gelijk, maar de kosten per taak dalen fors.

Astra blokkeert directe prompt-injecties, verstopte lukken in 8,5 procent
Nieuws
5 min

4 sep 20:10

Astra blokkeert directe prompt-injecties, verstopte lukken in 8,5 procent

Gray Swan kreeg GPT-6 Astra in 8,5 procent van de scenario's toch zover dat het instructies uitvoerde die in een document verstopt zaten, tegen 4,8 procent bij Claude Opus 5. Directe injecties blokkeert het model wel.