Een code-editor op een scherm met de broncode van een webapplicatie.
Nieuws21 augustus · 12:225 min leestijd

Drie runs met een goedkoop AI-model vinden meer lekken dan één dure run

Aikido verbrandde 11,7 miljard tokens om tien AI-modellen op 32 verse CVE's te testen. Drie runs DeepSeek V4 Pro kosten 295 dollar en vinden er 28, meer dan een enkele pass van Opus 5 of Grok 4.6.

Drie runs van het open model DeepSeek V4 Pro kosten samen ongeveer 295 dollar en vinden 28 van 32 verse kwetsbaarheden, meer dan een enkele pass van Claude Opus 5, Grok 4.6 of GPT-5.6 Sol, meet het Gentse Aikido Security.

Voor een softwarebedrijf dat zijn eigen code door een AI-agent laat doorlichten, verschuift dat waar het budget heen gaat: niet naar het duurste model in één poging, maar naar een goedkoper model dat je drie keer laat lopen. Die afweging wordt binnenkort dwingender, want artikel 14 van de Cyber Resilience Act treedt op 11 september in werking en verplicht je dan om een actief uitgebuit lek in je eigen product binnen 24 uur te melden. Wie zelf wil vinden wat een aanvaller anders het eerst vindt, koopt dekking per run.

Herhaling verslaat één dure poging

Aikido zette tien modellen elk drie keer op dezelfde set van 32 recent bekendgemaakte CVE's, samen 96 runs en ongeveer 11,7 miljard tokens. Prompts, gereedschap en beoordelingsregels stonden vast, de agent kreeg maximaal 30 beurten en geen internettoegang. De kwetsbaarheden zijn bewust vers gekozen, zodat een model ze niet uit zijn trainingsdata kan opdiepen maar echt in de broncode moet redeneren.

Het verschil tussen één en drie pogingen bleek groter dan het verschil tussen de modellen. DeepSeek V4 Pro vond in zijn eerste run 17 lekken en kwam over drie runs op 28 van de 32, omdat elke run een ander pad door de zoekruimte nam. Qwen3.8 Max ging van 19 naar 26, Kimi K3 van 17 naar 25. Grok 4.6 won het minst, van 24 naar 26, precies omdat het elke keer ongeveer dezelfde lekken aanwees.

Staafgrafiek van Aikido met het aantal gevonden CVE's per model in de eerste run en na drie runs. DeepSeek V4 Pro gaat van 17 naar 28 van de 32, Grok 4.6 van 24 naar 26 (bron: Aikido Security).
Staafgrafiek van Aikido met het aantal gevonden CVE's per model in de eerste run en na drie runs. DeepSeek V4 Pro gaat van 17 naar 28 van de 32, Grok 4.6 van 24 naar 26 (bron: Aikido Security).

Dekking en betrouwbaarheid zijn dus niet hetzelfde. Van de 28 lekken die DeepSeek vond, kwamen er maar 10 in alle drie de runs terug. Grok vond er 21 telkens opnieuw en was daarmee het meest voorspelbare model van de test. Opus 5 kwam uit op 26 van 32 en zette de sterkste losse run neer, met 25 lekken in één pass.

De rekensom in dollars

Hier zit het nieuws voor wie een budget moet verdedigen. Drie runs DeepSeek V4 Pro kosten samen ongeveer 295 dollar, terwijl een enkele pass van Opus 5, Grok 4.6 of Sol op 450 tot 590 dollar uitkomt. Drie runs van het lichtere DeepSeek V4 Flash kosten 108 dollar en halen 24 lekken, gelijk aan de beste losse run van Grok, voor minder dan een kwart van de prijs.

Grafiek van Aikido die de campagnekosten afzet tegen het percentage gevonden CVE's. DeepSeek V4 Pro haalt 87,5 procent voor ongeveer 300 dollar, Claude Opus 5 en Grok 4.6 halen 81 procent voor ongeveer 1.500 dollar (bron: Aikido Security).
Grafiek van Aikido die de campagnekosten afzet tegen het percentage gevonden CVE's. DeepSeek V4 Pro haalt 87,5 procent voor ongeveer 300 dollar, Claude Opus 5 en Grok 4.6 halen 81 procent voor ongeveer 1.500 dollar (bron: Aikido Security).

Dat prijsvoordeel staat wel op een wankele bodem. DeepSeek schreef begin deze maand op zijn eigen prijspagina dat het de tarieven voor al zijn API-diensten breed gaat verhogen, met een significante stijging in het vooruitzicht, zonder bedrag of ingangsdatum. De 295 dollar van vandaag is dus geen begroting voor volgend kwartaal.

De prijs van goedkope dekking is ruis

De open modellen kochten hun dekking met veel meer kandidaat-bevindingen, en die moeten er verderop in de keten weer uit. DeepSeek leverde er veruit de meeste, wat de dekking hielp maar ook de triagelast opdreef. Kimi K3 deed het omgekeerde: een mediaan van 12 beurten per onderzoek en 92,3 procent precisie over de gepoolde runs, de hoogste van alle open modellen in de test.

Qwen liet een eigenaardigheid zien die iedereen herkent die ooit een agent op een bekende codebase losliet. In 95 van de 96 traces ging het model na herkenning van het project eerst piekeren over oudere, al gepatchte CVE's uit zijn trainingskennis, voordat het terugkeerde naar de code die het moest lezen. Dat kostte onderzoeksbudget zonder iets op te leveren.

Niet alle open gewichten zijn ook te downloaden

De term open model dekt in deze test twee verschillende dingen. DeepSeek V4 Pro 0813 staat sinds 13 augustus onder MIT-licentie te downloaden en is inmiddels bijna 50.000 keer opgehaald, dus je kunt hem op eigen hardware zetten.

GLM-5.3 niet. Z.ai bracht dat model op 14 augustus uit via zijn API en houdt de gewichten twee weken achter tot de veiligheidsevaluatie klaar is; onder zai-org op Hugging Face staat vandaag nog steeds geen GLM-5.3-repository. Aikido draaide als vroege evaluatiepartner mee in het pre-releasetraject, dus voor de benchmark maakte dat niet uit. Voor een team dat het model zelf wil hosten wel.

Z.ai meldt zelf dat GLM-5.3 op de CyberGym-benchmark 84,5 procent haalt tegen 77,2 procent voor GLM-5.2, boven Mythos 5 en GPT-5.6 Sol. In Aikido's test kwam GLM-5.3 op 25 van 32, evenveel als GPT-5.6 Sol maar 65,5 procent goedkoper, en groeide de consistentie van 14 naar 18 lekken die in alle drie de runs terugkwamen.

De oude rangorde houdt geen stand

Het onderzoek komt van Aikido zelf, een Gents securitybedrijf dat in januari 60 miljoen dollar ophaalde bij een waardering van een miljard en precies zulke agentgestuurde codescans verkoopt. De cijfers zijn niet onafhankelijk herhaald, en alleen de publiek beschikbare versies van de gesloten modellen deden mee; de zwaardere Mythos- en GPT-5.6 Daybreak-klasse bleef buiten de test.

Toch wijst het dezelfde kant op als eerder werk. Toen Cisco in juli Antares uitbracht, twee open-weight modellen die kwetsbaarheden lokaliseren voor 0,60 tot 0,82 dollar per run tegen 141 dollar op GPT-5.5, kwam die vergelijking van Cisco zelf, op een benchmark van Cisco zelf, met een model van Cisco zelf. Wat hier anders ligt, is dat één partij tien modellen van anderen naast elkaar zet op dezelfde verse dataset.

En dan blijkt het antwoord geen model maar een werkwijze. Aikido waarschuwt er zelf voor dat je Opus of Sol niet zonder meer door een open model vervangt: die prestaties komen uit een zorgvuldig gebouwde opzet eromheen, en goedkope dekking schuift kosten door naar de triage erna. De hiërarchie waarin één gesloten topmodel bovenaan staat en de rest eronder, overleeft deze benchmark niet. Wat ervoor in de plaats komt lijkt eerder op een ploeg: welk model stuur je eerst naar binnen, welk model daarna, en wie controleert wiens werk.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI die je code bewaakt

Ik denk met je mee over welk model je waar inzet, ontwerp de opzet eromheen en bouw hem af, van koppeling tot draaiende agent. Self-hosted waar dat kan, zodat je broncode je eigen omgeving niet verlaat.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway
Nieuws
5 min

24 aug 02:11

Open modellen halen 62 procent van het tokenverkeer op Vercels AI Gateway

Op 22 augustus liep 62 procent van alle tokens op Vercels AI Gateway over open modellen, tegen 28,4 procent in juni. De uitgaven volgen die verschuiving niet: daar houdt Anthropic de meerderheid vast.

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld
Inzicht
7 min

15 aug 17:00

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld

Qwen, Kimi, Llama en Gemma zetten voorwaarden op je omzet, je gebruikersaantal en je merknaam. Een gratis model met een drempel is geen open source, maar een inkoopbeslissing die je vooruitschuift naar het moment dat je niet meer weg kunt.

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk
Nieuws
5 min

13 aug 06:10

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk

DeepSeek zet V4-Pro als officiële versie op zijn API, onder dezelfde modelnaam en tegen hetzelfde tarief. Er kwam geen aankondiging bij, de gewichten blijven voorlopig de preview en de aangekondigde prijsverhoging staat nog op dezelfde pagina.

Meituan brengt LongCat-2.0 uit: een open codeermodel van 1,6 biljoen parameters, getraind zonder Nvidia
Nieuws
6 min

30 jun 08:32

Meituan brengt LongCat-2.0 uit: een open codeermodel van 1,6 biljoen parameters, getraind zonder Nvidia

Het Chinese Meituan geeft LongCat-2.0 vrij onder de MIT-licentie: een open codeermodel van 1,6 biljoen parameters, volledig getraind op Chinese chips zonder een enkele Nvidia-kaart. Dat verschuift opnieuw de prijs-kwaliteitverhouding.

Amerikaanse AI-labs verlagen tarieven, tokenindex een kwart lager
Nieuws
5 min

15 aug 06:10

Amerikaanse AI-labs verlagen tarieven, tokenindex een kwart lager

Klanten van OpenAI en Anthropic betalen sinds midden juli bijna een kwart minder per miljoen tokens. Anthropic schrapte bovendien een verhoging die op 1 september zou ingaan, terwijl de topmodellen onveranderd duur blijven.

Z.ai brengt GLM-5.3 uit en houdt de gewichten twee weken achter
Nieuws
5 min

14 aug 12:10

Z.ai brengt GLM-5.3 uit en houdt de gewichten twee weken achter

Z.ai bracht GLM-5.3 uit via zijn API, maar de gewichten volgen pas over twee weken omdat de post-training onverwacht sterke exploitvaardigheden opleverde. Zelf hosten kan dus nog niet, meelopen via een Chinese API wel.