OpenAI heeft na de lancering van GPT-6 Astra meerdere benchmarkscores op zijn eigen productpagina aangepast zonder die wijzigingen als correctie te markeren, meldt Fortune op basis van archiefopnames van die pagina.
Wie een modelkeuze of een migratie op zulke cijfers baseert, baseert die op een levend document. Er staat geen wijzigingslog bij, geen datum waarop de pagina voor het laatst is bijgewerkt en geen voetnoot die meldt dat een getal is bijgesteld. Op Terminal-Bench 4.0, de test voor agenttaken in een terminal, stond Astra op 3 september om 21:39 uur Nederlandse tijd nog op 57,7 procent. Zes uur later staat er 57,9 procent. Dat is dezelfde avond waarop Astra live ging tegen 10 en 50 dollar per miljoen in- en uitvoertokens en met bewaking op elke tool-aanroep.
Wat er sinds de lancering op de pagina veranderde
Drie opnames van de Astra-pagina in het Internet Archive, van 3 september 21:39 uur, 4 september 03:19 uur en 5 september 13:36 uur Nederlandse tijd, laten vier verschuivingen in de tabellen zien.
Terminal-Bench 4.0. Astra ging van 57,7 naar 57,9 procent. Daarna schoven ook de kolommen van de concurrentie: Claude Fable 5 van 42,0 naar 44,5 procent en Claude Opus 5 van 52,3 naar 52,6 procent.
HealthBench Professional. Claude Fable 5.1 ging van 56,6 naar 58,1 procent en Claude Opus 5 van 54,5 naar 56,4 procent. Beide staan er nu nog zo.
GeneBench Pro. De score van Astra zelf zakte van 37,8 naar 37,1 procent, terwijl voorganger GPT-5.6 Sol steeg van 28,7 naar 32,3 procent.
ExploitBench over juni tot augustus 2026. Het cijfer van Sol sprong van 5,5 naar 11,5 procent en staat inmiddels weer op 5,5 procent, nu met een nieuwe voetnoot erbij: die 5,5 procent is een artefact van de limiet van 300 beurten in de benchmark, en bij ruimere limieten haalde hetzelfde model 11,5 procent.
Ook twee tekstregels veranderden. De uitrolzin noemde eerst de OpenAI API en AWS, en noemt nu de OpenAI API, Microsoft Azure en AWS Bedrock, waarbij "is beschikbaar in de OpenAI API" werd vervangen door "wordt beschikbaar". En bij de OSWorld-cijfers stond eerst dat de Claude-resultaten door een onafhankelijke derde partij waren gereproduceerd; nu staat er dat de auteurs ze zelf op het officiële scorebord reproduceerden.
Het cijfer dat kort halveerde en weer terugkwam
Fortune legde daarnaast een wijziging vast die nu niet meer op de pagina staat. In de opname van 3 september rond 23:20 uur Nederlandse tijd was de interne hallucinatiescore van Astra gehalveerd van 4,2 naar 2 procent en die van GPT-5.6 Sol verlaagd van 12,2 naar 9,4 procent. Een paar uur later stonden beide getallen weer op hun oorspronkelijke waarde, en daar staan ze nu nog. In dezelfde reeks opnames zag Fortune de grafiek van FrontierMath Tier 4 bewegen: Claude Fable 5.1 van 87,8 naar 78 en vervolgens naar 83 procent, Sol van 83 naar 80,5 en terug naar 83 procent.
OpenAI noemt het geen correctie
De meeste evaluaties kennen volgens OpenAI ruis van een paar procentpunten, afhankelijk van het gebruikte checkpoint, het harnas en de exacte testrun. Voor de lanceringsblog zijn fixes doorgevoerd zodat de cijfers de beste schatting van de beschikbare modelprestaties weergeven, laat het bedrijf weten. Aanpassingen tussen een concept en een definitieve versie zijn normaal, omdat evaluaties altijd voor publicatie worden geverifieerd.
Die lancering verliep sowieso rommelig. De blogpost stond op 3 september rond 20:00 uur Nederlandse tijd online, werd kort daarna ingetrokken en was pas rond 22:50 uur normaal bereikbaar. OpenAI schreef dat eerst toe aan een bug in het contentmanagementsysteem en daarna aan een internetstoring, en zei dat de reden losstond van de benchmarkcijfers. Een bericht van het bedrijf op X en een post van Sam Altman verwezen intussen naar een link die het niet deed.
Wie het cijfer beheert
De verschuivingen zijn klein: twee tienden op Terminal-Bench, zeven tienden op GeneBench Pro. Ze gaan bovendien beide kanten op. De hallucinatiescore die Fortune vastlegde maakte Astra tijdelijk beter, terwijl de aanpassingen die nu nog op de pagina staan juist scores van Claude en van Astra's eigen voorganger verhogen. Wat ze delen is dat ze ongemarkeerd gebeurden, in een tabel die inkopers naast elkaar leggen en waarin een paar tienden een rangorde kunnen kantelen.
Dat past in een reeks. In juli trok OpenAI zijn aanbeveling van SWE-Bench Pro in nadat een eigen audit ongeveer 30 procent van de opgaven kapot noemde. Deze week kwamen Epoch AI en Artificial Analysis tot tegengestelde oordelen over precies dezelfde Astra, en bleek dat OpenAI zelf de reikwijdte en de methodiek bepaalde van het onafhankelijke METR-onderzoek naar zijn agents. Steeds beheert de partij die het model verkoopt ook het cijfer waarop je het beoordeelt.
Daarmee verandert wat een leverancierscijfer eigenlijk is. Geen vastgelegde meting, maar een publicatie die onderhouden wordt en op elk moment kan worden bijgesteld zonder dat iemand daar bericht van krijgt. Een score zonder meetdatum en zonder eigen kopie van de pagina waarop hij stond, is geen bewijs meer maar een momentopname van wat er die dag te lezen was.
Veelgestelde vragen
Cijfers die je zelf vastlegt
Ik bouw systemen die bronnen, cijfers en meetdatums automatisch vastleggen, zodat je onderbouwing blijft kloppen als de bron verandert. Van meedenken over wat je wilt weten tot ontwerp, realisatie en beheer, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

