OpenAI meldt dat een intern model sinds 28 augustus meer dan honderd langlopende wiskundeproblemen heeft opgelost en kondigt een onafhankelijke adviesgroep aan om de resultaten te beoordelen.
Voor een Nederlandse organisatie is dit geen aankondiging van een product dat je morgen kunt inkopen. Het verschuift wel de lat voor AI-roadmaps: leveranciers claimen systemen die langlopende onderzoekstaken aankunnen, terwijl de bewijsvoering, menselijke controle en toegangsvoorwaarden nog niet vaststaan.
Wat OpenAI claimt
OpenAI schrijft dat het op 28 augustus met de training begon en dat het interne model sindsdien meer dan honderd langlopende problemen in de meeste deelgebieden van de wiskunde heeft opgelost. Het bedrijf zegt dat de snelheid van de vooruitgang ook zijn eigen wiskundigen verraste. Hetzelfde model ligt volgens OpenAI ook onder de eerder gepubliceerde Navier-Stokes-uitkomst.
Het getal volgt op de eerdere Navier-Stokes-proef met ongeveer 10.000 agents en 88 uur werk. OpenAI meldt in de primaire beschrijving dat de Lean-formalisering en verificatie nog 17 uur kostten. Dat is een belangrijk verschil met een gewone chatbotreactie: er was een grote zoekopstelling, selectie van resultaten en een formele controle achteraf.
De nieuwe aankondiging geeft geen lijst van de honderd problemen en publiceert er geen uitgewerkte oplossingen bij. The Decoder schrijft dat de problemen, de manier waarop ze zijn opgelost en hun betekenis nog open vragen zijn. Het woord ‘opgelost’ is hier dus een claim van de leverancier, geen onafhankelijke eindbeoordeling van honderd afzonderlijke resultaten.

De adviesgroep remt het tempo niet
De aangekondigde groep wordt gehost door het Institute for Advanced Study in Princeton en telt negen eerste leden. Timothy Gowers, Martin Hairer en Edward Witten behoren tot de bekende namen. De groep adviseert over de beoordeling van nieuwe resultaten, hun betekenis, de manier waarop ze worden verspreid en professionele standaarden voor wiskundig onderzoek.
De groep zegt zelf onafhankelijk van AI-bedrijven te werken, geen betaling te ontvangen en geen beslissingsmacht bij een AI-bedrijf te hebben. OpenAI zegt daarnaast dat de groep niet verantwoordelijk wordt voor advies over het tempo van zijn interne wiskundige onderzoek. De rol gaat dus over toetsing en communicatie, niet over een stopknop voor nieuwe modelcapaciteit.
Dat onderscheid is relevant voor leveranciersclaims. Een externe groep kan helpen bepalen hoe een resultaat moet worden uitgelegd en gedeeld, maar de partij die het model bouwt houdt de controle over ontwikkeling, toegang en vrijgave. Voor de Nederlandse koper blijven dat drie afzonderlijke vragen.
Het signaal voor AI-roadmaps
De zakelijke betekenis zit niet in de vraag of elk van de honderd problemen al een bruikbare uitvinding oplevert. Het signaal is dat een frontier-lab langlopende zoek- en redeneertaken op een schaal uitvoert die eerder bij gespecialiseerde onderzoeksteams lag. Dat is een capaciteitsclaim, geen bewijs dat algemene autonome onderzoekers nu beschikbaar zijn.
Voor teams in engineering, productontwikkeling, data-analyse en R&D verschuift daardoor de relevante toets. De benchmark is één onderdeel. De artefacten die een leverancier kan opleveren tellen evenzeer: welke bronnen en hulpmiddelen zijn gebruikt, welke menselijke controles vonden plaats, hoe herhaal je de uitkomst en wie tekent af als de uitkomst fout blijkt?
Bij de Navier-Stokes-publicatie lag er ten minste een formele Lean-controle naast de claim. Bij de nieuwe honderd resultaten zijn de afzonderlijke problemen en oplossingen nog niet publiek uitgewerkt. Het verschil tussen ‘een model zegt dat het iets heeft opgelost’ en ‘een organisatie kan erop bouwen’ zit precies in die tussenlaag van verificatie, herkomst en verantwoordelijkheid.
OpenAI's adviesgroep is daarmee vooral een teken van de nieuwe schaal van de leveranciersclaim. De groep helpt de buitenwereld de resultaten te beoordelen en te begrijpen, maar de snelheid van de frontier blijft bij het lab zelf liggen.
Veelgestelde vragen
Van claim naar werkend systeem
Ik help je AI-onderzoek en agentische processen vertalen naar een werkend systeem, van meedenken en ontwerp tot realiseren en automatiseren. Ik denk als ondernemer, ontwerp als maker en bouw als engineer, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

