Bedieningspaneel van een oud audiotoestel met draaiknoppen en schakelaars om af te stemmen.
Nieuws31 juli · 06:134 min leestijd

OpenAI haalt 38,3 procent op ARC-AGI-3 door twee API-instellingen aan te zetten

OpenAI haalt 38,3 procent op de publieke ARC-AGI-3-set door retained reasoning en compaction aan te zetten, tegen 13,3 procent met de officiële opstelling. ARC Prize erkent het resultaat en houdt vast aan één testomgeving.

OpenAI haalt met GPT-5.6 Sol 38,3 procent op de publieke set van ARC-AGI-3 door twee instellingen in zijn eigen API aan te zetten, tegen 13,3 procent met de officiële testopstelling, schrijft het bedrijf in een onderzoeksnotitie van 29 juli.

Het model bleef hetzelfde. Alleen de omgeving eromheen veranderde, en dat leverde drie keer de score op met zes keer minder uitvoertokens per spel. Daarmee verschuift voor wie AI-agents in productie draait de vraag waar het rendement zit: niet bij het volgende model, maar bij de vraag of jouw opstelling het redeneerwerk van het model bewaart of het na elke stap weggooit. Dat is een instelling in je eigen code, geen inkoopbeslissing.

Wat de twee instellingen doen

De officiële ARC-testopstelling is bewust kaal. Elk systeem krijgt dezelfde waarnemingen, dezelfde systeemprompt en dezelfde limiet op het aantal acties. Twee gevolgen daarvan verklaren volgens OpenAI het grootste deel van de lage score.

Ten eerste gooide die opstelling na elke spelactie het privé-redeneerwerk van het model weg. Sol moest het spel bij iedere zet opnieuw doorgronden, zonder de plannen en invallen die tot de vorige zetten hadden geleid. Ten tweede kapte een schuivend venster de oudste berichten af zodra de context boven 175.000 tekens kwam, waardoor ook de eigen zetgeschiedenis uit beeld verdween.

In de Responses API blijven beide wel staan. Retained reasoning bewaart het redeneerwerk tussen tool-aanroepen door de vorige respons-ID mee te sturen, en compaction vat oude context samen in plaats van hem af te kappen. Met allebei aan dacht Sol korter na per zet en hield het vast wat het over een spel had geleerd. OpenAI raadt ontwikkelaars nu aan de Responses API te gebruiken in plaats van de oudere Chat Completions API en die twee instellingen aan te zetten.

Grafiek van OpenAI met de score van GPT-5.6 Sol op de publieke ARC-AGI-3-set, afgezet tegen het aantal uitvoertokens per spel, voor de officiële testopstelling en voor de opstelling met retained reasoning en compaction. Beeld: OpenAI
Grafiek van OpenAI met de score van GPT-5.6 Sol op de publieke ARC-AGI-3-set, afgezet tegen het aantal uitvoertokens per spel, voor de officiële testopstelling en voor de opstelling met retained reasoning en compaction. Beeld: OpenAI

De zes keer lagere tokenrekening is de kant van het verhaal die het snelst op een factuur landt. Sol is het duurste model in de reeks en hield zijn tarief toen OpenAI op 30 juli de prijs van Luna met 80 procent en die van Terra met 20 procent verlaagde. Het is ook niet het eerste tokencijfer waarmee het bedrijf schermt: bij de brede uitrol noemde topman Sam Altman het model 54 procent zuiniger op agentic coding-taken.

De vergelijking met Opus 5 gaat over twee verschillende metingen

Koppen die van een overwinning op Claude Opus 5 spreken, leggen cijfers naast elkaar die uit verschillende opstellingen komen. ARC Prize test op twee sets, een publieke demoset van 25 spellen en een semi-private set. In de geverifieerde cijfers staat Sol op zijn zwaarste redeneerstand op 13,33 procent op de publieke set en 7,78 procent op de semi-private set. Opus 5 kwam daar op 30,16 procent uit, gemeten op de stand High omdat het testvenster te kort was voor de zwaardere Max-stand.

De 38,3 procent hoort bij de publieke set én bij OpenAI's eigen opstelling. In zijn notitie noemt het bedrijf Opus 5 geen enkele keer; de vergelijking ontstond in de verslaggeving, die het resultaat las als een score die de 30,2 procent van Opus 5 voorbijstreeft. Wat binnen één meting valt, is de sprong op de publieke set zelf: van 13,3 naar 38,3 procent. Op basis van de officiële speellogs schat OpenAI dat een gemiddelde menselijke tester op 48 procent uitkomt.

Dat maakt de eerdere uitslag niet ongeldig. Anthropic zette op 24 juli 30,2 procent neer, bijna vier keer de vorige topscore van 7,8 procent, en speelde vijf omgevingen uit die geen enkel model eerder haalde. Alleen zijn de twee getallen die nu tegenover elkaar worden gezet niet in dezelfde omstandigheden gemeten.

ARC Prize erkent het resultaat en houdt vast aan één opstelling

ARC Prize noemt de bevinding bruikbaar en zegt dat het samen met verschillende labs, waaronder OpenAI, onderzoekt hoe het gespreksstatus die aan de serverkant wordt beheerd kan opnemen in zijn geverifieerde testopstelling zonder de vergelijkbaarheid tussen leveranciers te verliezen. De organisatie beheert die status nu aan de clientkant, via de OpenAI-stijl completions-API die als industriestandaard geldt, precies de oudere interface waar OpenAI vanaf wil.

Medeoprichter François Chollet trok er een grens bij. Opstellingen die speciaal gebouwd zijn om de benchmark op te lossen of kennis over het testformaat bevatten zijn niet toegestaan, algemene API-instellingen die voor alle gebruikers beschikbaar zijn wel. Dat verschillende leveranciers met verschillende instellingen worden getest levert volgens hem een mogelijk gelijkheidsprobleem op, acceptabel zolang de instellingen en de kosten er duidelijk bij gerapporteerd worden.

Een score reist alleen mee met zijn configuratie

Een benchmarkcijfer meet twee dingen tegelijk: het model en het geheugen dat je eromheen bouwt. Bij ARC-AGI-3 blijkt dat tweede deel goed voor een factor drie in de score en een factor zes in de tokenkosten, bij ongewijzigde gewichten. De ranglijsten die volgen gaan daarmee net zo goed over configuratie als over modellen, en de kleine lettertjes bij een score worden belangrijker dan de score zelf.

Voor wie vandaag tussen Sol en Opus 5 kiest voor redeneerwerk, verandert dat de leesrichting. Een cijfer uit een leveranciersnotitie geldt alleen bij de instellingen waarmee het is gehaald, en die instellingen staan in jouw eigen agentcode. Dezelfde taak, twee modellen, je eigen opstelling blijft de meting die je uitkomst voorspelt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Je opstelling bepaalt je resultaat

Een agent die zijn redeneerwerk na elke stap weggooit, kost je prestaties en tokens tegelijk. Ik denk mee over de opzet, ontwerp de flow en bouw en automatiseer hem daarna ook, self hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Opus 5 scoort 30,2 procent op ARC-AGI-3, bijna vier keer de vorige topscore
Nieuws
4 min

26 jul 14:12

Opus 5 scoort 30,2 procent op ARC-AGI-3, bijna vier keer de vorige topscore

ARC Prize verifieerde de redeneersprong van Claude Opus 5: 30,2 procent op ARC-AGI-3, bijna vier keer de vorige topscore. Een tweede, onafhankelijke test laat een veel kleinere winst zien.

Brits AI-instituut vindt universele jailbreaks in OpenAI’s GPT-5.6
Nieuws
5 min

11 jul 08:11

Brits AI-instituut vindt universele jailbreaks in OpenAI’s GPT-5.6

Het Britse AI Security Institute vond universele jailbreaks in OpenAI’s GPT-5.6 die offensieve cybertaken ontsluiten, net nu het model breed uitrolt. Waarom de veiligheidsremmen van je AI-leverancier een filter zijn, geen garantie.

VS heft beperking op GPT-5.6 op, OpenAI lanceert model donderdag breed
Nieuws
4 min

8 jul 08:12

VS heft beperking op GPT-5.6 op, OpenAI lanceert model donderdag breed

Het Amerikaanse ministerie van Handel heft zijn beperking op OpenAI's GPT-5.6 op, waardoor de modellen Sol, Terra en Luna donderdag breed uitkomen. Toegang tot frontier-AI blijkt opnieuw een kwestie van goedkeuring in Washington.

OpenAI lanceert GPT-5.6 met Sol, Terra en Luna, onder toezicht van Washington
Nieuws
7

26 jun 20:41

OpenAI lanceert GPT-5.6 met Sol, Terra en Luna, onder toezicht van Washington

Nog geen dag na de aankondiging is GPT-5.6 er. OpenAI brengt drie scherp geprijsde modellen uit, Sol, Terra en Luna, met een nieuw record voor programmeerwerk en hetzelfde werk voor minder tokens, maar voorlopig alleen voor klanten die de Trump-regering per geval goedkeurt.

OpenAI verlaagt prijs GPT-5.6 Luna met 80 procent, Terra met 20 procent
Nieuws
4 min

30 jul 20:31

OpenAI verlaagt prijs GPT-5.6 Luna met 80 procent, Terra met 20 procent

OpenAI verlaagt de API-prijs van GPT-5.6 Luna met 80 procent en Terra met 20 procent. Daarmee wordt Terra ineens tien keer zo duur als Luna in plaats van 2,5 keer, en verschuift de rekensom voor elke agent-workflow.

Anthropic meet nul geslaagde prompt-injecties bij Opus 5 met browsertoegang
Nieuws
5 min

25 jul 14:24

Anthropic meet nul geslaagde prompt-injecties bij Opus 5 met browsertoegang

Claude Opus 5 laat in Anthropics eigen browsertest van 129 scenario's geen enkele prompt-injectie slagen met auto mode aan, en 3,7 procent zonder. Auto mode zit alleen in Anthropics eigen browserproducten.