ErdosBench zet Fable 5.1 op 3,25, nipt boven GPT-6 Astra op 3,23, meldt benchmarkmaker Ulam na een volledige run over 226 open wiskundeproblemen.
Voor een Nederlandse organisatie die een model voor onderzoek, software of automatisering kiest, verschuift daarmee de meetlat. ErdosBench beloont een oplossing én goed afgebakende deelresultaten, correcte stellingkeuze en terughoudendheid bij claims. Daardoor kan de beste modelkeuze per taak verschillen.
ErdosBench meet meer dan een opgelost probleem
ErdosBench laat dertien modelruns langs 226 Erdős-geïnspireerde problemen gaan. Een externe beoordelaar geeft resultaten een A, B, C, D, F of M, waarbij A staat voor wiskundig deugdelijk en passend afgebakend werk. Het doel is niet om een formele certificeringslijst van stellingen te maken, maar om te meten welke output een expert echt kan beoordelen en gebruiken.
De huidige pagina bevat 2.938 beoordelingen van model-probleemcombinaties uit die dertien runs. Ook zijn 25 problemen door vier modellen op dezelfde manier beoordeeld als extra controlepunten. Dat maakt 3,23 een gegradeerd kwaliteitsgemiddelde, geen klassiek percentage goed opgeloste opgaven.
GPT-6 Astra krijgt gemiddeld 3,23 op een schaal van nul tot vier. De live ranglijst telt 106 A-grade resultaten, met 63 sterke claims en 43 resultaten die in de categorie partial of no-progress zijn geaudit. The Decoder meldde 106 opgeloste problemen, waarvan 43 volledig en 27 weerleggingen, maar Ulam waarschuwt dat het leaderboard geen formele certificering van stellingen is.
Fable 5.1 xhigh staat inmiddels met 3,25 boven Astra. Het verschil is 0,024 punt. Fable heeft volgens Ulam de schonere staart van gedeeltelijke resultaten, terwijl Astra het sterkste model is in het sluiten van stellingen en de meeste A-grade resultaten haalt. Het getal bovenaan vertelt dus niet het hele verhaal.
Waarom de meetlat bepalend is
De benchmark meet vaardigheden die dichter bij kenniswerk liggen dan een simpel goed of fout antwoord: een tegenvoorbeeld vinden, de juiste stelling toepassen, een bewijslek herkennen en een gedeeltelijke uitkomst niet als afgerond resultaat verkopen. Voor AI-agents zijn dat precies de tussenstappen die bepalen of een mens verder kan met de uitkomst.
Dat maakt 3,23 niet rechtstreeks vergelijkbaar met OpenAI's 97,6 procent op FrontierMath Tier 4. Dat is een andere set problemen en een andere evaluatie. De eerdere Astra-metingen waarin hetzelfde model op ARC-AGI-3 62,7 of 99,9 procent scoorde afhankelijk van het gebruikte harnas lieten al zien dat een score pas betekenis krijgt met de opstelling eromheen.
Voor modelinkoop verschuift de relevante vraag daarmee van "welk model staat bovenaan?" naar "welk gedrag heb ik in mijn eigen workflow nodig?" Een model dat sterk is in het sluiten van stellingen hoeft niet het beste te zijn voor klantcontact, code of documentverwerking. Een kleine, taakgerichte test met echte voorbeelden krijgt daardoor meer besliswaarde dan een algemene totaalscore.
Wiskunde was niet de prioriteit
De opvallendste context komt van Jakub Pachocki, chief scientist van OpenAI. Hij schrijft dat OpenAI extra focus op specifiek wiskundeonderzoek bewust niet prioriteert vanwege de urgentie van recursive self-improvement en geautomatiseerde alignment.
De Astra-score op ErdosBench is daarmee geen bewijs dat OpenAI speciaal voor deze meetlat heeft geoptimaliseerd. Het is een voorbeeld van een capaciteit die naast andere prioriteiten zichtbaar wordt. Brede vooruitgang op één as voorspelt daardoor niet automatisch prestaties op alle werkzaamheden.
ErdosBench maakt die verschuiving concreet. De winnaar is niet simpelweg het model met de meeste grote claims, maar het model waarvan de kwaliteit, beperkingen en bewijsstatus het duidelijkst uit de test komen. Voor zakelijke AI wordt dat onderscheid steeds belangrijker naarmate modellen meer werk zelfstandig uitvoeren.
Veelgestelde vragen
Van benchmark naar werkende AI
Een model dat hoog scoort, moet nog passen in jouw echte workflow. Ik denk mee over de juiste AI-architectuur, ontwerp de evaluatie en bouw en automatiseer het geheel, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

