Drie runs van het open model DeepSeek V4 Pro kosten samen ongeveer 295 dollar en vinden 28 van 32 verse kwetsbaarheden, meer dan een enkele pass van Claude Opus 5, Grok 4.6 of GPT-5.6 Sol, meet het Gentse Aikido Security.
Voor een softwarebedrijf dat zijn eigen code door een AI-agent laat doorlichten, verschuift dat waar het budget heen gaat: niet naar het duurste model in één poging, maar naar een goedkoper model dat je drie keer laat lopen. Die afweging wordt binnenkort dwingender, want artikel 14 van de Cyber Resilience Act treedt op 11 september in werking en verplicht je dan om een actief uitgebuit lek in je eigen product binnen 24 uur te melden. Wie zelf wil vinden wat een aanvaller anders het eerst vindt, koopt dekking per run.
Herhaling verslaat één dure poging
Aikido zette tien modellen elk drie keer op dezelfde set van 32 recent bekendgemaakte CVE's, samen 96 runs en ongeveer 11,7 miljard tokens. Prompts, gereedschap en beoordelingsregels stonden vast, de agent kreeg maximaal 30 beurten en geen internettoegang. De kwetsbaarheden zijn bewust vers gekozen, zodat een model ze niet uit zijn trainingsdata kan opdiepen maar echt in de broncode moet redeneren.
Het verschil tussen één en drie pogingen bleek groter dan het verschil tussen de modellen. DeepSeek V4 Pro vond in zijn eerste run 17 lekken en kwam over drie runs op 28 van de 32, omdat elke run een ander pad door de zoekruimte nam. Qwen3.8 Max ging van 19 naar 26, Kimi K3 van 17 naar 25. Grok 4.6 won het minst, van 24 naar 26, precies omdat het elke keer ongeveer dezelfde lekken aanwees.

Dekking en betrouwbaarheid zijn dus niet hetzelfde. Van de 28 lekken die DeepSeek vond, kwamen er maar 10 in alle drie de runs terug. Grok vond er 21 telkens opnieuw en was daarmee het meest voorspelbare model van de test. Opus 5 kwam uit op 26 van 32 en zette de sterkste losse run neer, met 25 lekken in één pass.
De rekensom in dollars
Hier zit het nieuws voor wie een budget moet verdedigen. Drie runs DeepSeek V4 Pro kosten samen ongeveer 295 dollar, terwijl een enkele pass van Opus 5, Grok 4.6 of Sol op 450 tot 590 dollar uitkomt. Drie runs van het lichtere DeepSeek V4 Flash kosten 108 dollar en halen 24 lekken, gelijk aan de beste losse run van Grok, voor minder dan een kwart van de prijs.

Dat prijsvoordeel staat wel op een wankele bodem. DeepSeek schreef begin deze maand op zijn eigen prijspagina dat het de tarieven voor al zijn API-diensten breed gaat verhogen, met een significante stijging in het vooruitzicht, zonder bedrag of ingangsdatum. De 295 dollar van vandaag is dus geen begroting voor volgend kwartaal.
De prijs van goedkope dekking is ruis
De open modellen kochten hun dekking met veel meer kandidaat-bevindingen, en die moeten er verderop in de keten weer uit. DeepSeek leverde er veruit de meeste, wat de dekking hielp maar ook de triagelast opdreef. Kimi K3 deed het omgekeerde: een mediaan van 12 beurten per onderzoek en 92,3 procent precisie over de gepoolde runs, de hoogste van alle open modellen in de test.
Qwen liet een eigenaardigheid zien die iedereen herkent die ooit een agent op een bekende codebase losliet. In 95 van de 96 traces ging het model na herkenning van het project eerst piekeren over oudere, al gepatchte CVE's uit zijn trainingskennis, voordat het terugkeerde naar de code die het moest lezen. Dat kostte onderzoeksbudget zonder iets op te leveren.
Niet alle open gewichten zijn ook te downloaden
De term open model dekt in deze test twee verschillende dingen. DeepSeek V4 Pro 0813 staat sinds 13 augustus onder MIT-licentie te downloaden en is inmiddels bijna 50.000 keer opgehaald, dus je kunt hem op eigen hardware zetten.
GLM-5.3 niet. Z.ai bracht dat model op 14 augustus uit via zijn API en houdt de gewichten twee weken achter tot de veiligheidsevaluatie klaar is; onder zai-org op Hugging Face staat vandaag nog steeds geen GLM-5.3-repository. Aikido draaide als vroege evaluatiepartner mee in het pre-releasetraject, dus voor de benchmark maakte dat niet uit. Voor een team dat het model zelf wil hosten wel.
Z.ai meldt zelf dat GLM-5.3 op de CyberGym-benchmark 84,5 procent haalt tegen 77,2 procent voor GLM-5.2, boven Mythos 5 en GPT-5.6 Sol. In Aikido's test kwam GLM-5.3 op 25 van 32, evenveel als GPT-5.6 Sol maar 65,5 procent goedkoper, en groeide de consistentie van 14 naar 18 lekken die in alle drie de runs terugkwamen.
De oude rangorde houdt geen stand
Het onderzoek komt van Aikido zelf, een Gents securitybedrijf dat in januari 60 miljoen dollar ophaalde bij een waardering van een miljard en precies zulke agentgestuurde codescans verkoopt. De cijfers zijn niet onafhankelijk herhaald, en alleen de publiek beschikbare versies van de gesloten modellen deden mee; de zwaardere Mythos- en GPT-5.6 Daybreak-klasse bleef buiten de test.
Toch wijst het dezelfde kant op als eerder werk. Toen Cisco in juli Antares uitbracht, twee open-weight modellen die kwetsbaarheden lokaliseren voor 0,60 tot 0,82 dollar per run tegen 141 dollar op GPT-5.5, kwam die vergelijking van Cisco zelf, op een benchmark van Cisco zelf, met een model van Cisco zelf. Wat hier anders ligt, is dat één partij tien modellen van anderen naast elkaar zet op dezelfde verse dataset.
En dan blijkt het antwoord geen model maar een werkwijze. Aikido waarschuwt er zelf voor dat je Opus of Sol niet zonder meer door een open model vervangt: die prestaties komen uit een zorgvuldig gebouwde opzet eromheen, en goedkope dekking schuift kosten door naar de triage erna. De hiërarchie waarin één gesloten topmodel bovenaan staat en de rest eronder, overleeft deze benchmark niet. Wat ervoor in de plaats komt lijkt eerder op een ploeg: welk model stuur je eerst naar binnen, welk model daarna, en wie controleert wiens werk.
Veelgestelde vragen
AI die je code bewaakt
Ik denk met je mee over welk model je waar inzet, ontwerp de opzet eromheen en bouw hem af, van koppeling tot draaiende agent. Self-hosted waar dat kan, zodat je broncode je eigen omgeving niet verlaat.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
