Close-up van algebraïsche vergelijkingen op papier
Nieuws10 september · 20:404 min leestijd

ErdosBench zet Fable 5.1 nipt boven GPT-6 Astra

ErdosBench zet Fable 5.1 nipt boven GPT-6 Astra, maar de benchmark meet meer dan opgeloste problemen. De uitkomst laat zien waarom organisaties modelkeuze per taak en evaluatie-opstelling moeten beoordelen.

ErdosBench zet Fable 5.1 op 3,25, nipt boven GPT-6 Astra op 3,23, meldt benchmarkmaker Ulam na een volledige run over 226 open wiskundeproblemen.

Voor een Nederlandse organisatie die een model voor onderzoek, software of automatisering kiest, verschuift daarmee de meetlat. ErdosBench beloont een oplossing én goed afgebakende deelresultaten, correcte stellingkeuze en terughoudendheid bij claims. Daardoor kan de beste modelkeuze per taak verschillen.

ErdosBench meet meer dan een opgelost probleem

ErdosBench laat dertien modelruns langs 226 Erdős-geïnspireerde problemen gaan. Een externe beoordelaar geeft resultaten een A, B, C, D, F of M, waarbij A staat voor wiskundig deugdelijk en passend afgebakend werk. Het doel is niet om een formele certificeringslijst van stellingen te maken, maar om te meten welke output een expert echt kan beoordelen en gebruiken.

De huidige pagina bevat 2.938 beoordelingen van model-probleemcombinaties uit die dertien runs. Ook zijn 25 problemen door vier modellen op dezelfde manier beoordeeld als extra controlepunten. Dat maakt 3,23 een gegradeerd kwaliteitsgemiddelde, geen klassiek percentage goed opgeloste opgaven.

GPT-6 Astra krijgt gemiddeld 3,23 op een schaal van nul tot vier. De live ranglijst telt 106 A-grade resultaten, met 63 sterke claims en 43 resultaten die in de categorie partial of no-progress zijn geaudit. The Decoder meldde 106 opgeloste problemen, waarvan 43 volledig en 27 weerleggingen, maar Ulam waarschuwt dat het leaderboard geen formele certificering van stellingen is.

Fable 5.1 xhigh staat inmiddels met 3,25 boven Astra. Het verschil is 0,024 punt. Fable heeft volgens Ulam de schonere staart van gedeeltelijke resultaten, terwijl Astra het sterkste model is in het sluiten van stellingen en de meeste A-grade resultaten haalt. Het getal bovenaan vertelt dus niet het hele verhaal.

Waarom de meetlat bepalend is

De benchmark meet vaardigheden die dichter bij kenniswerk liggen dan een simpel goed of fout antwoord: een tegenvoorbeeld vinden, de juiste stelling toepassen, een bewijslek herkennen en een gedeeltelijke uitkomst niet als afgerond resultaat verkopen. Voor AI-agents zijn dat precies de tussenstappen die bepalen of een mens verder kan met de uitkomst.

Dat maakt 3,23 niet rechtstreeks vergelijkbaar met OpenAI's 97,6 procent op FrontierMath Tier 4. Dat is een andere set problemen en een andere evaluatie. De eerdere Astra-metingen waarin hetzelfde model op ARC-AGI-3 62,7 of 99,9 procent scoorde afhankelijk van het gebruikte harnas lieten al zien dat een score pas betekenis krijgt met de opstelling eromheen.

Voor modelinkoop verschuift de relevante vraag daarmee van "welk model staat bovenaan?" naar "welk gedrag heb ik in mijn eigen workflow nodig?" Een model dat sterk is in het sluiten van stellingen hoeft niet het beste te zijn voor klantcontact, code of documentverwerking. Een kleine, taakgerichte test met echte voorbeelden krijgt daardoor meer besliswaarde dan een algemene totaalscore.

Wiskunde was niet de prioriteit

De opvallendste context komt van Jakub Pachocki, chief scientist van OpenAI. Hij schrijft dat OpenAI extra focus op specifiek wiskundeonderzoek bewust niet prioriteert vanwege de urgentie van recursive self-improvement en geautomatiseerde alignment.

De Astra-score op ErdosBench is daarmee geen bewijs dat OpenAI speciaal voor deze meetlat heeft geoptimaliseerd. Het is een voorbeeld van een capaciteit die naast andere prioriteiten zichtbaar wordt. Brede vooruitgang op één as voorspelt daardoor niet automatisch prestaties op alle werkzaamheden.

ErdosBench maakt die verschuiving concreet. De winnaar is niet simpelweg het model met de meeste grote claims, maar het model waarvan de kwaliteit, beperkingen en bewijsstatus het duidelijkst uit de test komen. Voor zakelijke AI wordt dat onderscheid steeds belangrijker naarmate modellen meer werk zelfstandig uitvoeren.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van benchmark naar werkende AI

Een model dat hoog scoort, moet nog passen in jouw echte workflow. Ik denk mee over de juiste AI-architectuur, ontwerp de evaluatie en bouw en automatiseer het geheel, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

GPT-6 Astra leidt fysieke en zakelijke agenttests
Nieuws
5 minBijgewerkt om 16:19

13 sep 14:19

GPT-6 Astra leidt fysieke en zakelijke agenttests

Nieuwe evaluaties van Andon Labs laten GPT-6 Astra een drone door een kantoor sturen en een jaar lang een gesimuleerd verkoopbedrijf beheren. De beste drone-run haalt de referentie op alle vijf taken; Vending-Bench zet Astra bovenaan.

OpenAI lanceert GPT-6 Astra met bewaking op elke agenttaak
Nieuws
6 min

3 sep 22:09

OpenAI lanceert GPT-6 Astra met bewaking op elke agenttaak

OpenAI brengt GPT-6 Astra uit voor Plus, Pro, Business en Enterprise plus de API en AWS. Het model kost 10 en 50 dollar per miljoen tokens en draait onder bewaking die een API-taak kan stoppen.

Artificial Analysis herziet zijn AI-index en zet 40 procent op geheime tests
Nieuws
5 min

5 sep 22:07

Artificial Analysis herziet zijn AI-index en zet 40 procent op geheime tests

Artificial Analysis herziet zijn Intelligence Index naar v4.2. Veertig procent van de weging rust nu op geheime testsets. GPT-6 Astra en GPT-5.6 Sol stonden gelijk op 61 punten en staan nu vier punten uit elkaar.

OpenAI past benchmarkcijfers van GPT-6 Astra aan zonder correctiemelding
Nieuws
5 min

5 sep 14:21

OpenAI past benchmarkcijfers van GPT-6 Astra aan zonder correctiemelding

OpenAI paste na de lancering van GPT-6 Astra benchmarkscores op zijn eigen pagina aan zonder correctiemelding. Archiefopnames tonen wijzigingen op Terminal-Bench, HealthBench, GeneBench Pro en ExploitBench tussen 3 en 5 september.

Benchmarkbureaus spreken elkaar tegen over GPT-6 Astra
Nieuws
6 min

4 sep 14:37

Benchmarkbureaus spreken elkaar tegen over GPT-6 Astra

Epoch AI zet GPT-6 Astra met 169 punten op de eerste plaats van 267 modellen, terwijl Artificial Analysis het op 61 punten precies gelijk aan Sol meet. Astra kost twee en een half keer zoveel per token.

Artificial Analysis zet GPT-6 en Claude gelijk op 53
Nieuws
3 min

14 sep 10:26

Artificial Analysis zet GPT-6 en Claude gelijk op 53

Artificial Analysis zet GPT-6 Astra en Claude Fable 5.1 in v4.3 gelijk op 53. Nieuwe agent- en codetests veranderen de meetlat en maken modelkeuze meer afhankelijk van je eigen taak.