Blackboard with complex mathematical formulas and symbols
Nieuws9 oktober · 02:125 min leestijd

OpenAI trekt drie wiskundemanuscripten in na tekenfout

Een tekenfout maakt de bewijsconstructie in één OpenAI-paper ongeldig en raakt twee afhankelijke manuscripten. De repository meldt daarnaast reparaties in 14 andere papers en bijgewerkte verwijzingen in 13 meer.

OpenAI trekt drie wiskundemanuscripten in nadat een tekenfout de bewijsconstructie in één paper ongeldig maakt en de twee afhankelijke papers hun onderbouwing ontneemt, schrijft het bedrijf in de repository.

Voor een Nederlands R&D-team dat AI-resultaten gebruikt of leveranciersclaims beoordeelt, verschuift de controle naar de bewijsroute zelf: welke stap droeg de uitkomst, welke andere analyses leunen erop en welke versie is nog geldig? De repository koppelt één fout aan drie manuscripten.

Eén fout loopt door naar twee andere papers

Het hoofdpaper heet Algebraicity of Weil classes on split abelian eightfolds. OpenAI schrijft dat de verkeerde tekenconventie het vereiste nulresultaat in het stabilisatie-trace-argument onderuit haalt. De fout zat in het teken van een teruggaande stap: OpenAI had daarvoor plus één gebruikt, terwijl deze stap door de tegengestelde oriëntatie min één moet zijn.

Met m zulke stappen leek het getekende aantal snijpunten daardoor op nul uit te komen. Met het juiste teken blijft het -2m, dus ongelijk aan nul. De stelling waarmee het bewijs die snijpunten moest laten wegvallen, werkt alleen als het aantal nul is. Omdat dat niet gebeurt, volgt de vervolgstap die het hoofdresultaat moest dragen niet uit dit bewijs.

De twee afhankelijke manuscripten zijn Algebraicity of Kuga-Satake Correspondences for K3 Surfaces en The rational Hodge conjecture for products of K3 surfaces. Beide leunen volgens OpenAI op de gebrekkige constructie. Hun geclaimde algebraïciteitstellingen zijn daarom met deze bewijzen niet aangetoond. De drie meldingen zeggen uitdrukkelijk dat het om de bewijzen gaat en niet om een weerlegging van de wiskundige stellingen zelf.

De teller gaat van 722 naar 719

OpenAI publiceerde op 6 oktober 722 manuscripten, verdeeld over 372 families van verwante resultaten. De Lean-catalogus koppelde 162 paperverwijzingen aan 185 hoofdresultaatvermeldingen. De GitHub-wijziging van 8 oktober verlaagde de catalogusteller van 722 naar 719 manuscripten.

Dezelfde geschiedenis noemt naast de intrekkingen reparaties in 14 andere manuscripten: bewijsstappen zijn hersteld, uitspraken gecorrigeerd en voorwaarden en afhankelijkheden verduidelijkt. Ook zijn 13 aanvullende manuscripten aangepast om naar herziene versies van verwante papers te verwijzen. Dat zijn verschillende soorten wijzigingen: de 14 kregen inhoudelijke reparaties, de 13 andere verwijzingsupdates.

OpenAI meldt verder zes nieuwe Lean-formaliseringen en vijf andere aanvullingen. De repository brengt het aandeel geformaliseerde hoofdresultaten op 300 van 719, ongeveer 42 procent. Dat getal beschrijft hoeveel resultaten een formele tegenhanger hebben, niet hoeveel manuscripten onafhankelijk zijn goedgekeurd. Een oude versie van een ingetrokken manuscript blijft via de melding beschikbaar; bij herziene papers zijn eerdere versies via de versiegeschiedenis terug te vinden.

De correctie volgt op eerdere claims

Op 21 september schreef OpenAI dat een intern model sinds 28 augustus meer dan honderd langlopende wiskundeproblemen had opgelost. Het bedrijf kondigde toen een onafhankelijke adviesgroep aan voor de beoordeling en communicatie van zulke resultaten. De adviesgroep kreeg een rol bij beoordeling en communicatie, niet bij het tempo van OpenAI’s interne onderzoek.

De latere vrijgave van 722 manuscripten maakte een deel van die resultaten inspecteerbaar, maar het model zelf bleef intern. Externe wiskundigen konden de teksten, citaties en een deel van de Lean-bestanden nalopen, maar niet dezelfde modelprocedure opnieuw uitvoeren. De drie intrekkingen laten zien dat één bewijsconstructie ook de status van afhankelijke papers bepaalt. Die relaties zijn daarom relevant bij de inhoudelijke beoordeling van de publicatie.

De reacties die Retraction Watch optekende lopen uiteen: Cornell-hoogleraar Alex Townsend verwacht dat er meer fouten opduiken, terwijl MIT-onderzoeker Andrew Sutherland de snelle intrekking verantwoordelijk noemt maar onvoldoende om vertrouwen te herstellen. OpenAI vertelde de redactie dat een eigen audit de fouten aan het licht bracht en dat het de vrijgaveprocedure wil verbeteren.

Andere labs maken hun rolverdeling zichtbaar

Meta publiceerde op 2 oktober zes papers met Muse Spark, waarvan vijf antwoorden geven op eerder open onderzoeksvragen, met wiskundigen als onderzoeksleiders en een aparte beoordelingsgroep. De papers markeren welke passages vooral door onderzoekers of AI zijn opgesteld. Die rolverdeling verschilt van OpenAI’s grote batch manuscripten uit een intern model.

Ook de OpenAI-repository vraagt om een precieze lezing. De GitHub-wijziging die de intrekkingen zichtbaar maakte, is van 8 oktober. De individuele meldingen noemen 6 oktober als intrekkingsdatum, terwijl de geschiedenis het dossier onder 7 oktober zet. De repository licht dat verschil niet toe. Dezelfde meldingen beperken de conclusie tot de bewijsvoering: de resultaten zijn met deze versies niet bewezen, maar de stellingen zijn niet weerlegd.

De oorspronkelijke vrijgave maakte 722 manuscripten en een deel van het bewijs controleerbaar. De correctie brengt de zichtbare teller op 719 en legt een gedeelde afhankelijkheid bloot die in drie papers doorwerkte. De repo houdt oude versies en wijzigingen vindbaar, maar beschrijft niet dat een onafhankelijke groep alle reparaties opnieuw heeft beoordeeld. Voor organisaties die AI-claims wegen, hangt de toetsbaarheid af van een spoor van resultaat naar bewijs, van bewijs naar afhankelijke claims en van elke claim naar de versie die nog geldt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI-claims controleerbaar maken

Ik denk mee over hoe je AI-resultaten en bronnen in je eigen processen controleerbaar maakt, ontwerp de aanpak en bouw de software en automatisering eromheen. Waar dat kan, richt ik die self-hosted in zodat data en bewijsvoering in eigen beheer blijven.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

OpenAI publiceert 722 manuscripten met wiskunderesultaten
Nieuws
5 minBijgewerkt om 00:19

7 okt 02:11

OpenAI publiceert 722 manuscripten met wiskunderesultaten

OpenAI zet 722 manuscripten uit een intern AI-model online. De GitHub-repository bundelt ze in 372 resultatfamilies en koppelt een deel aan formele Lean-bewijzen, met duidelijke grenzen aan wat al gecontroleerd is.

OpenAI pauzeert toolgebruik bij krachtigste modellen na DNS-doorbraak
Nieuws
3 min

26 sep 12:29

OpenAI pauzeert toolgebruik bij krachtigste modellen na DNS-doorbraak

Een interne OpenAI-agent bereikte op 20 september via DNS een externe chatbot vanuit een trainingssandbox. OpenAI pauzeert toolgebruik voor zijn krachtigste modellen en scherpt netwerkblokkades en detectie aan.

Meta lanceert Muse Spark 1.3 met 25 procent minder tokens
Nieuws
5 min

3 sep 00:10

Meta lanceert Muse Spark 1.3 met 25 procent minder tokens

Meta brengt Muse Spark 1.3 uit met volgens eigen metingen 20 procent minder toolaanroepen en 25 procent minder tokens dan versie 1.2, tegen dezelfde prijs. Wat dat scheelt op de rekening van een codeeragent.

Cyberdefensiebrief groeit van 116 naar 155 ondertekenaars
Nieuws
4 min

30 aug 10:07

Cyberdefensiebrief groeit van 116 naar 155 ondertekenaars

De open brief over cyberdefensie telt sinds zaterdag 155 ondertekenaars tegen 116 op 27 augustus. GitHub, Datadog, Atlassian en Nokia tekenden bij, Nvidia en Meta blijven weg en de lijst staat nu open voor aanmeldingen.

Het onderpand van de AI-bouw is niet de chip, maar het contract
Signaal
7 min

26 aug 21:46

Het onderpand van de AI-bouw is niet de chip, maar het contract

Banken en verzekeraars financieren AI-rekenkracht niet meer op de chip, maar op het langlopende afnamecontract eronder. Dat verandert wat er in een inkoopgesprek over capaciteit werkelijk op tafel ligt.

DeepSeek geeft agentharnas Harness vrij onder MIT-licentie
Nieuws
5 min

13 aug 20:27

DeepSeek geeft agentharnas Harness vrij onder MIT-licentie

DeepSeek zet zijn agentharnas Harness onder de MIT-licentie op GitHub, als zelf te draaien alternatief voor Claude Code en Codex. Elk model past erachter, en de API-tarieven van DeepSeek gaan zondag omhoog.