OpenAI trekt drie wiskundemanuscripten in nadat een tekenfout de bewijsconstructie in één paper ongeldig maakt en de twee afhankelijke papers hun onderbouwing ontneemt, schrijft het bedrijf in de repository.
Voor een Nederlands R&D-team dat AI-resultaten gebruikt of leveranciersclaims beoordeelt, verschuift de controle naar de bewijsroute zelf: welke stap droeg de uitkomst, welke andere analyses leunen erop en welke versie is nog geldig? De repository koppelt één fout aan drie manuscripten.
Eén fout loopt door naar twee andere papers
Het hoofdpaper heet Algebraicity of Weil classes on split abelian eightfolds. OpenAI schrijft dat de verkeerde tekenconventie het vereiste nulresultaat in het stabilisatie-trace-argument onderuit haalt. De fout zat in het teken van een teruggaande stap: OpenAI had daarvoor plus één gebruikt, terwijl deze stap door de tegengestelde oriëntatie min één moet zijn.
Met m zulke stappen leek het getekende aantal snijpunten daardoor op nul uit te komen. Met het juiste teken blijft het -2m, dus ongelijk aan nul. De stelling waarmee het bewijs die snijpunten moest laten wegvallen, werkt alleen als het aantal nul is. Omdat dat niet gebeurt, volgt de vervolgstap die het hoofdresultaat moest dragen niet uit dit bewijs.
De twee afhankelijke manuscripten zijn Algebraicity of Kuga-Satake Correspondences for K3 Surfaces en The rational Hodge conjecture for products of K3 surfaces. Beide leunen volgens OpenAI op de gebrekkige constructie. Hun geclaimde algebraïciteitstellingen zijn daarom met deze bewijzen niet aangetoond. De drie meldingen zeggen uitdrukkelijk dat het om de bewijzen gaat en niet om een weerlegging van de wiskundige stellingen zelf.
De teller gaat van 722 naar 719
OpenAI publiceerde op 6 oktober 722 manuscripten, verdeeld over 372 families van verwante resultaten. De Lean-catalogus koppelde 162 paperverwijzingen aan 185 hoofdresultaatvermeldingen. De GitHub-wijziging van 8 oktober verlaagde de catalogusteller van 722 naar 719 manuscripten.
Dezelfde geschiedenis noemt naast de intrekkingen reparaties in 14 andere manuscripten: bewijsstappen zijn hersteld, uitspraken gecorrigeerd en voorwaarden en afhankelijkheden verduidelijkt. Ook zijn 13 aanvullende manuscripten aangepast om naar herziene versies van verwante papers te verwijzen. Dat zijn verschillende soorten wijzigingen: de 14 kregen inhoudelijke reparaties, de 13 andere verwijzingsupdates.
OpenAI meldt verder zes nieuwe Lean-formaliseringen en vijf andere aanvullingen. De repository brengt het aandeel geformaliseerde hoofdresultaten op 300 van 719, ongeveer 42 procent. Dat getal beschrijft hoeveel resultaten een formele tegenhanger hebben, niet hoeveel manuscripten onafhankelijk zijn goedgekeurd. Een oude versie van een ingetrokken manuscript blijft via de melding beschikbaar; bij herziene papers zijn eerdere versies via de versiegeschiedenis terug te vinden.
De correctie volgt op eerdere claims
Op 21 september schreef OpenAI dat een intern model sinds 28 augustus meer dan honderd langlopende wiskundeproblemen had opgelost. Het bedrijf kondigde toen een onafhankelijke adviesgroep aan voor de beoordeling en communicatie van zulke resultaten. De adviesgroep kreeg een rol bij beoordeling en communicatie, niet bij het tempo van OpenAI’s interne onderzoek.
De latere vrijgave van 722 manuscripten maakte een deel van die resultaten inspecteerbaar, maar het model zelf bleef intern. Externe wiskundigen konden de teksten, citaties en een deel van de Lean-bestanden nalopen, maar niet dezelfde modelprocedure opnieuw uitvoeren. De drie intrekkingen laten zien dat één bewijsconstructie ook de status van afhankelijke papers bepaalt. Die relaties zijn daarom relevant bij de inhoudelijke beoordeling van de publicatie.
De reacties die Retraction Watch optekende lopen uiteen: Cornell-hoogleraar Alex Townsend verwacht dat er meer fouten opduiken, terwijl MIT-onderzoeker Andrew Sutherland de snelle intrekking verantwoordelijk noemt maar onvoldoende om vertrouwen te herstellen. OpenAI vertelde de redactie dat een eigen audit de fouten aan het licht bracht en dat het de vrijgaveprocedure wil verbeteren.
Andere labs maken hun rolverdeling zichtbaar
Meta publiceerde op 2 oktober zes papers met Muse Spark, waarvan vijf antwoorden geven op eerder open onderzoeksvragen, met wiskundigen als onderzoeksleiders en een aparte beoordelingsgroep. De papers markeren welke passages vooral door onderzoekers of AI zijn opgesteld. Die rolverdeling verschilt van OpenAI’s grote batch manuscripten uit een intern model.
Ook de OpenAI-repository vraagt om een precieze lezing. De GitHub-wijziging die de intrekkingen zichtbaar maakte, is van 8 oktober. De individuele meldingen noemen 6 oktober als intrekkingsdatum, terwijl de geschiedenis het dossier onder 7 oktober zet. De repository licht dat verschil niet toe. Dezelfde meldingen beperken de conclusie tot de bewijsvoering: de resultaten zijn met deze versies niet bewezen, maar de stellingen zijn niet weerlegd.
De oorspronkelijke vrijgave maakte 722 manuscripten en een deel van het bewijs controleerbaar. De correctie brengt de zichtbare teller op 719 en legt een gedeelde afhankelijkheid bloot die in drie papers doorwerkte. De repo houdt oude versies en wijzigingen vindbaar, maar beschrijft niet dat een onafhankelijke groep alle reparaties opnieuw heeft beoordeeld. Voor organisaties die AI-claims wegen, hangt de toetsbaarheid af van een spoor van resultaat naar bewijs, van bewijs naar afhankelijke claims en van elke claim naar de versie die nog geldt.
Veelgestelde vragen
AI-claims controleerbaar maken
Ik denk mee over hoe je AI-resultaten en bronnen in je eigen processen controleerbaar maakt, ontwerp de aanpak en bouw de software en automatisering eromheen. Waar dat kan, richt ik die self-hosted in zodat data en bewijsvoering in eigen beheer blijven.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
