Een hoog gebouw in aanbouw met steigers rondom
Nieuws21 augustus · 22:225 min leestijd

Nvidia haalt 100 procent op ARC-AGI-3 met een eigen agentharnas

Nvidia brengt Claude Opus 5 met onderzoeksharnas AVO op 100,00 op de publieke set van ARC-AGI-3, waar hetzelfde model los rond 30 procent blijft. Het harnas leunt op blijvend geheugen en een supervisor.

Nvidia tilt Claude Opus 5 met een eigen agentharnas naar een score van 100,00 op de publieke set van ARC-AGI-3, meldt het bedrijf in onderzoek van 21 augustus, waar hetzelfde model zonder dat harnas rond 30 procent blijft.

Dat verschil zit niet in het model dat je inkoopt, maar in de laag eromheen. Wie agents laat bouwen of afneemt, kiest vandaag meestal op modelnaam en betaalt het tarief van het duurste merk. Dit onderzoek zet daar het omgekeerde tegenover: geheugen, gereedschap en toezicht rond hetzelfde model bepalen of een lange taak afkomt, en wat die taak kost. Dat is geen inkoopbeslissing maar een ontwerpkeuze in je eigen opstelling.

Wat het harnas doet

AVO, voluit Agentic Variation Operators, is een onderzoeksproject en geen product dat je kunt bestellen. Twee onderdelen dragen het resultaat. Een blijvend geheugen houdt eerdere pogingen, testuitkomsten en redeneerwerk vast, zodat de agent verdergaat waar hij gebleven was in plaats van het probleem elke ronde opnieuw op te bouwen. Daarnaast draait er een tweede agent mee, een supervisor, die de bredere lijn bewaakt en bijstuurt zodra de hoofdagent vastloopt of een route herhaalt die al niets opleverde.

In de test speelde het systeem 25 spelomgevingen uit de publieke set van ARC-AGI-3 uit, samen 183 levels, zonder uitleg over regels of doel. Het model kreeg geen beeld te zien: elke waarneming kwam binnen als een raster van 64 bij 64 tekens. AVO had er 6.624 acties in de omgeving voor nodig, tegen 7.542 voor VISTA, een ander systeem op hetzelfde model, ongeveer 12 procent meer.

Schema van Nvidia's AVO-harnas met de lus van context inspecteren, plannen, uitvoeren en evalueren, plus blijvend geheugen, gereedschap en een supervisor die kan ingrijpen. Bron: Nvidia
Schema van Nvidia's AVO-harnas met de lus van context inspecteren, plannen, uitvoeren en evalueren, plus blijvend geheugen, gereedschap en een supervisor die kan ingrijpen. Bron: Nvidia

Het harnas komt niet uit de spellenhoek. Nvidia bouwde het eerst voor het optimaliseren van GPU-kernels, waar het zeven dagen aaneen doorwerkte, ruim 500 optimalisatierichtingen verkende en 40 kernelversies vastlegde. De resulterende attentiekernels versloegen cuDNN met tot 3,5 procent en FlashAttention-4 met tot 10,5 procent op DGX B200-systemen. Dezelfde agentlus ging daarna zonder herbouw naar een compleet ander soort taak.

De 100 tegen 30 is geen zuivere vergelijking

Nvidia zet er zelf een streep bij. De ongeveer 30 procent die ARC Prize voor Claude Opus 5 noteert, is gemeten op de redeneerstand High en in een andere opstelling, en het bedrijf noemt zijn eigen run daarom uitdrukkelijk geen gecontroleerde ablatie: het gat valt niet netjes aan het harnas alleen toe te schrijven. De cijfers gaan bovendien over de publieke set van 25 spellen, niet over de semi-private of private competitieset.

Wat wel binnen één meting valt, liet OpenAI eind juli op dezelfde benchmark zien: met retained reasoning en compaction aan ging GPT-5.6 Sol van 13,3 naar 38,3 procent op die publieke set, zonder ander model, terwijl Claude Opus 5 daar op 30,16 procent stond.

De rekening zit in dezelfde laag

Voor de tokenrekening werkt het net zo direct. Dezelfde twee instellingen leverden OpenAI zes keer minder uitvoertokens per spel op. Databricks mat in juli op zijn eigen codebase van miljoenen regels hetzelfde patroon: bij gelijke kwaliteit liep de kosten per taak tussen twee harnassen op tot meer dan twee keer uiteen, doordat het ene harnas per beurt ongeveer drie keer minder context meestuurt. Databricks-topman Ali Ghodsi vat het tegenover TechCrunch samen: hetzelfde model onder het verkeerde harnas verdubbelt je kosten.

Nvidia verkoopt hier geen harnas

Adel El Hallack, vicepresident product bij Nvidia's AI-onderdeel, rekent tot een agent het model, het harnas eromheen, de runtime en de skills en bibliotheken waar het toegang toe krijgt. Het interessantste deel noemt hij de supervisor, die de werkende agent bijstuurt zoals een baas dat doet zodra iemand een doodlopende weg inslaat.

Die framing dient ook een belang. Nvidia brengt geen harnas op de markt maar losse open bouwstenen onder de Nemo-naam, en een open agentstack draait op zijn hardware. Dat maakt het punt niet onwaar, wel gekleurd. Het bedrijf leverde eerder wel de scherpste illustratie ervan: bij de vrijgave van agentmodel Nemotron 3.5 Lightning liepen dezelfde 500 taken van SWE-bench Verified van 60,0 procent onder het OpenCode-harnas naar 11,0 procent onder Codex, bij ongewijzigde systeemprompts en standaardinstellingen.

Die laag is ondertussen wel los te krijgen. DeepSeek zette zijn agentharnas in augustus onder de MIT-licentie op GitHub, zonder gebruiksbeperkingen, en TrueFoundry bracht TrueForge uit als open alternatief voor Claude Managed Agents tegen naar eigen zeggen 50 procent lagere kosten.

Drie partijen wijzen binnen zes weken naar hetzelfde punt: OpenAI met twee API-instellingen, Databricks met een kostenverschil van meer dan twee keer, en nu Nvidia met een score die van 30 naar 100 springt. De ranglijst van modellen zegt daarmee steeds minder over wat een agent in productie klaarspeelt. Wie agents inkoopt of laat bouwen, koopt vooral een harnas: het geheugen, het gereedschap en het toezicht bepalen of werk over een lange taak blijft lopen en op welke factuur dat uitkomt. Precies dat deel staat in de meeste offertes nog niet beschreven.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Het harnas onder je agent

Ik bouw agents end to end: van meedenken over welke taak hij echt overneemt tot het geheugen, het toezicht en de koppelingen eromheen, self-hosted waar dat kan. Zo hangt je resultaat niet aan de modelnaam op de factuur.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

OpenAI haalt 38,3 procent op ARC-AGI-3 door twee API-instellingen aan te zetten
Nieuws
4 min

31 jul 06:13

OpenAI haalt 38,3 procent op ARC-AGI-3 door twee API-instellingen aan te zetten

OpenAI haalt 38,3 procent op de publieke ARC-AGI-3-set door retained reasoning en compaction aan te zetten, tegen 13,3 procent met de officiële opstelling. ARC Prize erkent het resultaat en houdt vast aan één testomgeving.

Opus 5 scoort 30,2 procent op ARC-AGI-3, bijna vier keer de vorige topscore
Nieuws
4 min

26 jul 14:12

Opus 5 scoort 30,2 procent op ARC-AGI-3, bijna vier keer de vorige topscore

ARC Prize verifieerde de redeneersprong van Claude Opus 5: 30,2 procent op ARC-AGI-3, bijna vier keer de vorige topscore. Een tweede, onafhankelijke test laat een veel kleinere winst zien.

OpenAI verlaagt prijs GPT-5.6 Sol tijdelijk naar 4 en 20 dollar per miljoen tokens
Nieuws
4 min

22 aug 00:10

OpenAI verlaagt prijs GPT-5.6 Sol tijdelijk naar 4 en 20 dollar per miljoen tokens

OpenAI zet GPT-5.6 Sol drie maanden lang op 4 dollar invoer en 20 dollar uitvoer per miljoen tokens. De uitvoerprijs zakt een derde, precies de post waar agentprocessen het meeste verbruiken.

OpenAI groeit harder dan Anthropic in zakelijke AI-uitgaven: 82 tegen 76 procent
Nieuws
5 min

21 aug 12:12

OpenAI groeit harder dan Anthropic in zakelijke AI-uitgaven: 82 tegen 76 procent

Tokendata van betaalbedrijf Ramp laten zien dat OpenAI dit kwartaal harder groeit in zakelijke AI-uitgaven dan Anthropic, 82 tegen 76 procent. In adoptie ligt Anthropic nog voor, maar de rangorde kantelt per modelrelease.

TrueFoundry brengt TrueForge uit als open alternatief voor Claude Managed Agents
Nieuws
5 min

19 aug 14:08

TrueFoundry brengt TrueForge uit als open alternatief voor Claude Managed Agents

TrueFoundry brengt agentharnas TrueForge uit onder de MIT-licentie, als zelf te draaien alternatief voor Claude Managed Agents. De eigen benchmark laat 30 procent lagere kosten zien op hetzelfde model, niet de beloofde 50.

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk
Nieuws
5 min

13 aug 06:10

DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk

DeepSeek zet V4-Pro als officiële versie op zijn API, onder dezelfde modelnaam en tegen hetzelfde tarief. Er kwam geen aankondiging bij, de gewichten blijven voorlopig de preview en de aangekondigde prijsverhoging staat nog op dezelfde pagina.