De veiligheidsguardrails van OpenAI en Anthropic blokkeren inmiddels ook legitieme pentesters en securityonderzoekers, meldt TechCrunch: hun modellen weigeren code-analyse als "gevaarlijke actie", terwijl precies die analyse nodig is om je eigen systemen te verdedigen.
Voor een Nederlands securityteam dat AI inzet om zijn eigen netwerk te testen, verandert dat de toolkeuze. Vraag je een gesloten model om een kwetsbaarheid te bevestigen door hem uit te buiten, dan kan het antwoord een weigering zijn, ook als het je eigen infrastructuur betreft. De onderzoekers in het stuk lossen dat op door open-source modellen lokaal te draaien, buiten de remmen van de leverancier om.
Dezelfde tool bouwt en breekt
Het kernprobleem is dat offensief en defensief werk niet te scheiden zijn. Om een kwetsbaarheid te bevestigen moet je hem kunnen uitbuiten, en dat is precies wat de guardrails tegenhouden.
Chris Anley, hoofdwetenschapper bij NCC Group, vergelijkt het gereedschap met een hamer: nuttig om iets te bouwen, maar naar zijn aard ook een wapen. Zijn team wijkt daarom soms uit naar open-source modellen zonder remmen om lekken te kunnen valideren. Mark Dowd, een bekende zoeker van zero-days, voelt zich ongemakkelijk bij "willekeurige grote bedrijven die arbitrair beslissen wat veilig is in security en wat niet".
Vetting achter gesloten deuren
Beide labs hebben inmiddels toegangsprogramma's opgetuigd. OpenAI draait "Trusted Access for Cyber", Anthropic een "Cyber Verification Program": wie door de screening komt, krijgt minder strikte remmen. Wie dat niet doet, loopt vast.
Een onderzoeker bij een fabrikant van smartphonecomponenten, wiens werkgever niet in het programma van Anthropic zit, noemt de tools daardoor "nauwelijks bruikbaar": zodra een vraag naar beveiliging ruikt, slaan de remmen aan. Paolo Stagno, CTO van Crowdfense, vindt dat de AI-bedrijven klanten behandelen "als kinderen die oppas nodig hebben", en draait modellen lokaal, ook om geen gevoelige kwetsbaarheidsdata naar de cloud te lekken.
De remmen liggen niet eens vast. In juni 2026 legde de Amerikaanse overheid exportcontroles op Anthropics zwaarste modellen Mythos en Fable, na berichten dat hun guardrails omzeild waren; die controles werden later deels teruggedraaid.
De uitweg wijst naar buiten
Het effect is dat serieuze onderzoekers uitwijken. Chris Thompson, CEO van RemoteThreat en oprichter van Offensive AI Con, waarschuwt dat de inconsistente remmen onderzoekers wegduwen van Amerikaans bestuurde systemen naar buitenlandse, zoals de Chinese GLM-modellen.
Dat zijn precies de open-weight modellen die op offensieve cybertaken nog maar vier tot zeven maanden achterlopen op de gesloten frontier, en waarvan de ingebouwde remmen zich vaak met een paar nieuwe pogingen laten omzeilen. Niet elke onderzoeker ondervindt hinder: wie AI alleen voor reverse engineering en het bouwen van tools gebruikt, zoals onderzoeker Giuseppe Cali, merkt er weinig van.
De bredere beweging is wat telt. Guardrails die aanvallers moeten stoppen, sturen de verdedigers naar modellen zonder rem, vaak van buiten de VS en het Westen. Wie AI in zijn securitywerk inzet, kiest daarmee ook wie er straks meebeslist over wat je ermee mag. Dat maakt de vraag waar je model draait, en van wie het is, een strategische keuze en geen technische bijzaak.
Veelgestelde vragen
AI in eigen beheer
Wil je AI inzetten zonder dat een leverancier bepaalt wat mag en waar je data heen gaat? Ik ontwerp en bouw self-hosted AI end-to-end, van meedenken tot draaiende oplossing op je eigen infrastructuur.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
