Van bovenaf gefotografeerde handen die op een laptop typen in een donkere omgeving.
Nieuws24 juli · 06:234 min leestijd

Guardrails van OpenAI en Anthropic blokkeren legitieme securityonderzoekers

De veiligheidsremmen van OpenAI en Anthropic weigeren steeds vaker ook legitiem securitywerk, blijkt uit onderzoek van TechCrunch. Pentesters wijken daardoor uit naar open-source modellen die ze lokaal draaien, buiten de remmen van de leverancier om.

De veiligheidsguardrails van OpenAI en Anthropic blokkeren inmiddels ook legitieme pentesters en securityonderzoekers, meldt TechCrunch: hun modellen weigeren code-analyse als "gevaarlijke actie", terwijl precies die analyse nodig is om je eigen systemen te verdedigen.

Voor een Nederlands securityteam dat AI inzet om zijn eigen netwerk te testen, verandert dat de toolkeuze. Vraag je een gesloten model om een kwetsbaarheid te bevestigen door hem uit te buiten, dan kan het antwoord een weigering zijn, ook als het je eigen infrastructuur betreft. De onderzoekers in het stuk lossen dat op door open-source modellen lokaal te draaien, buiten de remmen van de leverancier om.

Dezelfde tool bouwt en breekt

Het kernprobleem is dat offensief en defensief werk niet te scheiden zijn. Om een kwetsbaarheid te bevestigen moet je hem kunnen uitbuiten, en dat is precies wat de guardrails tegenhouden.

Chris Anley, hoofdwetenschapper bij NCC Group, vergelijkt het gereedschap met een hamer: nuttig om iets te bouwen, maar naar zijn aard ook een wapen. Zijn team wijkt daarom soms uit naar open-source modellen zonder remmen om lekken te kunnen valideren. Mark Dowd, een bekende zoeker van zero-days, voelt zich ongemakkelijk bij "willekeurige grote bedrijven die arbitrair beslissen wat veilig is in security en wat niet".

Vetting achter gesloten deuren

Beide labs hebben inmiddels toegangsprogramma's opgetuigd. OpenAI draait "Trusted Access for Cyber", Anthropic een "Cyber Verification Program": wie door de screening komt, krijgt minder strikte remmen. Wie dat niet doet, loopt vast.

Een onderzoeker bij een fabrikant van smartphonecomponenten, wiens werkgever niet in het programma van Anthropic zit, noemt de tools daardoor "nauwelijks bruikbaar": zodra een vraag naar beveiliging ruikt, slaan de remmen aan. Paolo Stagno, CTO van Crowdfense, vindt dat de AI-bedrijven klanten behandelen "als kinderen die oppas nodig hebben", en draait modellen lokaal, ook om geen gevoelige kwetsbaarheidsdata naar de cloud te lekken.

De remmen liggen niet eens vast. In juni 2026 legde de Amerikaanse overheid exportcontroles op Anthropics zwaarste modellen Mythos en Fable, na berichten dat hun guardrails omzeild waren; die controles werden later deels teruggedraaid.

De uitweg wijst naar buiten

Het effect is dat serieuze onderzoekers uitwijken. Chris Thompson, CEO van RemoteThreat en oprichter van Offensive AI Con, waarschuwt dat de inconsistente remmen onderzoekers wegduwen van Amerikaans bestuurde systemen naar buitenlandse, zoals de Chinese GLM-modellen.

Dat zijn precies de open-weight modellen die op offensieve cybertaken nog maar vier tot zeven maanden achterlopen op de gesloten frontier, en waarvan de ingebouwde remmen zich vaak met een paar nieuwe pogingen laten omzeilen. Niet elke onderzoeker ondervindt hinder: wie AI alleen voor reverse engineering en het bouwen van tools gebruikt, zoals onderzoeker Giuseppe Cali, merkt er weinig van.

De bredere beweging is wat telt. Guardrails die aanvallers moeten stoppen, sturen de verdedigers naar modellen zonder rem, vaak van buiten de VS en het Westen. Wie AI in zijn securitywerk inzet, kiest daarmee ook wie er straks meebeslist over wat je ermee mag. Dat maakt de vraag waar je model draait, en van wie het is, een strategische keuze en geen technische bijzaak.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI in eigen beheer

Wil je AI inzetten zonder dat een leverancier bepaalt wat mag en waar je data heen gaat? Ik ontwerp en bouw self-hosted AI end-to-end, van meedenken tot draaiende oplossing op je eigen infrastructuur.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Toen Amerikaanse AI je pentester weigerde, koos je al voor Beijing: guardrails zijn een inkoopbeslissing, geen bug
Inzicht
7 min

24 jul 09:00

Toen Amerikaanse AI je pentester weigerde, koos je al voor Beijing: guardrails zijn een inkoopbeslissing, geen bug

Toen Amerikaanse modellen de code-analyse weigerden, greep Hugging Face naar het Chinese GLM. Dat moment laat zien dat welk AI-model je beveiliging draait geen neutrale technische keuze is, maar een inkoop- en soevereiniteitsbeslissing die je leverancier voor je invult.

OpenAI zou de Amerikaanse overheid een belang van 5% hebben aangeboden
Nieuws
6 min

2 jul 08:11

OpenAI zou de Amerikaanse overheid een belang van 5% hebben aangeboden

OpenAI besprak volgens de Financial Times een belang van 5% voor de Amerikaanse overheid om politieke druk te verlichten. Noch OpenAI noch het Witte Huis bevestigt het. Wat betekent een overheid als aandeelhouder voor jouw AI-leverancier?

VS onderhandelt met OpenAI, Anthropic en Google over vrijwillige releasestandaarden voor AI-modellen
Nieuws
5 min

2 jul 04:10

VS onderhandelt met OpenAI, Anthropic en Google over vrijwillige releasestandaarden voor AI-modellen

De VS is naar verluidt in vergevorderd overleg met OpenAI, Anthropic en Google over vrijwillige standaarden voor het uitbrengen van AI-modellen. Die zouden mede bepalen wanneer en hoe ook Nederlandse bedrijven toegang krijgen.

VS heft exportblokkade op Anthropics Fable 5 en Mythos 5 volledig op
Nieuws
4 min

1 jul 02:05

VS heft exportblokkade op Anthropics Fable 5 en Mythos 5 volledig op

Iets minder dan drie weken na het exportbevel heft de VS de blokkade op Anthropics krachtigste modellen Fable 5 en Mythos 5 volledig op. Het topmodel keert terug, maar de les over afhankelijkheid blijft staan.

China evenaart Anthropic in cybersecurity: Z.ai vindt kwetsbaarheden net zo goed als Mythos
Nieuws
4 min

28 jun 14:37

China evenaart Anthropic in cybersecurity: Z.ai vindt kwetsbaarheden net zo goed als Mythos

Volgens het Wall Street Journal evenaart een nieuw Chinees model van Z.ai de Amerikaanse top in het vinden van beveiligingslekken. Dat zet vraagtekens bij het nut van de exportrem op AI.

VS heft exportblokkade op Mythos 5 deels op: honderd partners krijgen weer toegang
Nieuws
5 min

27 jun 02:24

VS heft exportblokkade op Mythos 5 deels op: honderd partners krijgen weer toegang

De regering-Trump trok het exportbevel op Anthropics Mythos 5 vrijdag gedeeltelijk in. Meer dan honderd vertrouwde partners krijgen toegang, maar Fable 5 blijft op slot en buitenlandse gebruikers staan achteraan.