Nvidia tilt Claude Opus 5 met een eigen agentharnas naar een score van 100,00 op de publieke set van ARC-AGI-3, meldt het bedrijf in onderzoek van 21 augustus, waar hetzelfde model zonder dat harnas rond 30 procent blijft.
Dat verschil zit niet in het model dat je inkoopt, maar in de laag eromheen. Wie agents laat bouwen of afneemt, kiest vandaag meestal op modelnaam en betaalt het tarief van het duurste merk. Dit onderzoek zet daar het omgekeerde tegenover: geheugen, gereedschap en toezicht rond hetzelfde model bepalen of een lange taak afkomt, en wat die taak kost. Dat is geen inkoopbeslissing maar een ontwerpkeuze in je eigen opstelling.
Wat het harnas doet
AVO, voluit Agentic Variation Operators, is een onderzoeksproject en geen product dat je kunt bestellen. Twee onderdelen dragen het resultaat. Een blijvend geheugen houdt eerdere pogingen, testuitkomsten en redeneerwerk vast, zodat de agent verdergaat waar hij gebleven was in plaats van het probleem elke ronde opnieuw op te bouwen. Daarnaast draait er een tweede agent mee, een supervisor, die de bredere lijn bewaakt en bijstuurt zodra de hoofdagent vastloopt of een route herhaalt die al niets opleverde.
In de test speelde het systeem 25 spelomgevingen uit de publieke set van ARC-AGI-3 uit, samen 183 levels, zonder uitleg over regels of doel. Het model kreeg geen beeld te zien: elke waarneming kwam binnen als een raster van 64 bij 64 tekens. AVO had er 6.624 acties in de omgeving voor nodig, tegen 7.542 voor VISTA, een ander systeem op hetzelfde model, ongeveer 12 procent meer.

Het harnas komt niet uit de spellenhoek. Nvidia bouwde het eerst voor het optimaliseren van GPU-kernels, waar het zeven dagen aaneen doorwerkte, ruim 500 optimalisatierichtingen verkende en 40 kernelversies vastlegde. De resulterende attentiekernels versloegen cuDNN met tot 3,5 procent en FlashAttention-4 met tot 10,5 procent op DGX B200-systemen. Dezelfde agentlus ging daarna zonder herbouw naar een compleet ander soort taak.
De 100 tegen 30 is geen zuivere vergelijking
Nvidia zet er zelf een streep bij. De ongeveer 30 procent die ARC Prize voor Claude Opus 5 noteert, is gemeten op de redeneerstand High en in een andere opstelling, en het bedrijf noemt zijn eigen run daarom uitdrukkelijk geen gecontroleerde ablatie: het gat valt niet netjes aan het harnas alleen toe te schrijven. De cijfers gaan bovendien over de publieke set van 25 spellen, niet over de semi-private of private competitieset.
Wat wel binnen één meting valt, liet OpenAI eind juli op dezelfde benchmark zien: met retained reasoning en compaction aan ging GPT-5.6 Sol van 13,3 naar 38,3 procent op die publieke set, zonder ander model, terwijl Claude Opus 5 daar op 30,16 procent stond.
De rekening zit in dezelfde laag
Voor de tokenrekening werkt het net zo direct. Dezelfde twee instellingen leverden OpenAI zes keer minder uitvoertokens per spel op. Databricks mat in juli op zijn eigen codebase van miljoenen regels hetzelfde patroon: bij gelijke kwaliteit liep de kosten per taak tussen twee harnassen op tot meer dan twee keer uiteen, doordat het ene harnas per beurt ongeveer drie keer minder context meestuurt. Databricks-topman Ali Ghodsi vat het tegenover TechCrunch samen: hetzelfde model onder het verkeerde harnas verdubbelt je kosten.
Nvidia verkoopt hier geen harnas
Adel El Hallack, vicepresident product bij Nvidia's AI-onderdeel, rekent tot een agent het model, het harnas eromheen, de runtime en de skills en bibliotheken waar het toegang toe krijgt. Het interessantste deel noemt hij de supervisor, die de werkende agent bijstuurt zoals een baas dat doet zodra iemand een doodlopende weg inslaat.
Die framing dient ook een belang. Nvidia brengt geen harnas op de markt maar losse open bouwstenen onder de Nemo-naam, en een open agentstack draait op zijn hardware. Dat maakt het punt niet onwaar, wel gekleurd. Het bedrijf leverde eerder wel de scherpste illustratie ervan: bij de vrijgave van agentmodel Nemotron 3.5 Lightning liepen dezelfde 500 taken van SWE-bench Verified van 60,0 procent onder het OpenCode-harnas naar 11,0 procent onder Codex, bij ongewijzigde systeemprompts en standaardinstellingen.
Die laag is ondertussen wel los te krijgen. DeepSeek zette zijn agentharnas in augustus onder de MIT-licentie op GitHub, zonder gebruiksbeperkingen, en TrueFoundry bracht TrueForge uit als open alternatief voor Claude Managed Agents tegen naar eigen zeggen 50 procent lagere kosten.
Drie partijen wijzen binnen zes weken naar hetzelfde punt: OpenAI met twee API-instellingen, Databricks met een kostenverschil van meer dan twee keer, en nu Nvidia met een score die van 30 naar 100 springt. De ranglijst van modellen zegt daarmee steeds minder over wat een agent in productie klaarspeelt. Wie agents inkoopt of laat bouwen, koopt vooral een harnas: het geheugen, het gereedschap en het toezicht bepalen of werk over een lange taak blijft lopen en op welke factuur dat uitkomt. Precies dat deel staat in de meeste offertes nog niet beschreven.
Veelgestelde vragen
Het harnas onder je agent
Ik bouw agents end to end: van meedenken over welke taak hij echt overneemt tot het geheugen, het toezicht en de koppelingen eromheen, self-hosted waar dat kan. Zo hangt je resultaat niet aan de modelnaam op de factuur.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
