Cisco Foundation AI heeft Antares uitgebracht, twee open-weight AI-modellen die kwetsbaarheden in code lokaliseren en volgens het bedrijf tot 172 keer goedkoper draaien dan GPT-5.5, lokaal op je eigen hardware.
Voor een Nederlands softwarebedrijf of een IT-afdeling die aan compliance werkt, verschuift dat de rekensom rond code-audits. Tot nu toe zat de AI die zelfstandig lekken opspoort vooral in dure, gesloten frontier-modellen die je code naar de cloud sturen. Antares is klein genoeg om op eigen hardware te draaien en staat onder de Apache 2.0-licentie op Hugging Face, dus je broncode verlaat je eigen omgeving niet en een testrun die op GPT-5.5 rond 141 dollar kost, doe je hier voor minder dan een euro.
Wat Antares doet
De modellen krijgen niet meer dan een CWE-nummer en een algemene omschrijving van het type kwetsbaarheid, en gaan dan zelf een codebase door. Ze werken als een agent die shell-commando's uitvoert, kandidaat-bestanden leest, bewijs verzamelt en van richting verandert tot ze een gerangschikte lijst van bronbestanden opleveren die het lek waarschijnlijk bevatten. Het is dus geen vervanger van je securityteam, maar een triagehulp die de zoekruimte in een grote codebase versmalt.
Onder de motorkap bouwt Antares-1B voort op IBM's Granite 4.0-architectuur, met een contextvenster van 128.000 tokens, genoeg om flinke bestanden in één keer te overzien. Naast de 350M- en 1B-modellen die nu op Hugging Face staan, kondigt Cisco een grotere Antares-3B aan.
De kosten zijn de kern
Cisco zet de geschatte kosten per evaluatie op de eigen benchmark naast elkaar: de Antares-modellen draaien voor 0,60 tot 0,82 dollar per run, waar het Chinese GLM-5.2 op 12,50 dollar uitkomt en OpenAI's GPT-5.5 op 141 dollar. Dat maakt Antares 15,2 keer goedkoper dan GLM-5.2 en 172 keer goedkoper dan GPT-5.5, bij een fractie van de omvang.

Voor een team dat een codebase regelmatig wil doorlichten, is dat het verschil tussen een kostenpost die je afschrikt en een die je desnoods wekelijks laat draaien. De modellen draaien op eigen hardware, dus je betaalt niet per token bij een externe API en gevoelige code blijft binnen je eigen netwerk.
Prestaties, eerlijk gelezen
Klein betekent hier niet zwak. Op Cisco's eigen Vulnerability Localization Benchmark, een set van 500 taken over verschillende CWE-categorieën, scoort Antares-3B dicht bij de sterkste GPT-5.5-configuraties, en verslaat Antares-1B zowel GLM-5.2 als Google's Gemini 3 Pro, modellen die vele malen groter zijn.
De benchmark is nieuw en van Cisco zelf, dus onafhankelijke herhaling moet nog volgen. Het patroon is niettemin duidelijk: voor deze ene, smalle taak haalt een model van een miljard parameters de buurt van de frontier, tegen een fractie van de rekenkosten.
Waarom dit ertoe doet
De aankondiging tekent een bredere verschuiving. De AI die zelfstandig kwetsbaarheden vindt, was tot voor kort het terrein van gesloten cloudmodellen. Google's Gemini 3.5 Flash Cyber vond 55 bevestigde lekken in de V8-engine van Chrome, maar blijft voorlopig alleen voor overheden en vertrouwde partners beschikbaar. Antares draait die logica om: dezelfde soort taak, maar in een model dat iedereen mag downloaden, aanpassen en achter de eigen firewall draaien.
Dat sluit aan op wat het Britse AI Security Institute deze maand mat, namelijk dat open-weight modellen op offensieve cybercapaciteit nog maar 4 tot 7 maanden achterlopen op de gesloten top, terwijl de kosten per testrun kelderen. Dezelfde beweging zie je nu aan de verdedigende kant. Het echte nieuws is niet dat een model lekken kan aanwijzen, maar dat het zo klein en zo goedkoop is geworden dat de drempel om het op je eigen code los te laten vrijwel verdwijnt.
Veelgestelde vragen
AI veilig op je eigen infra
Een open model op je code of data loslaten is stap één; de agents, koppelingen en self-hosted infrastructuur eromheen laten werken is het echte werk. Dat traject ontwerp en bouw ik end-to-end mee, van meedenken tot draaiende automatisering, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
