Close-up van een wiskundig stelsel met vergelijkingen op papier
Nieuws22 september · 15:284 min leestijd

OpenAI meldt meer dan honderd opgeloste wiskundeproblemen

OpenAI zegt dat een intern model in minder dan een maand meer dan honderd langlopende wiskundeproblemen oplost. De nieuwe adviesgroep helpt bij beoordeling en verspreiding, maar stuurt het onderzoekstempo niet.

OpenAI meldt dat een intern model sinds 28 augustus meer dan honderd langlopende wiskundeproblemen heeft opgelost en kondigt een onafhankelijke adviesgroep aan om de resultaten te beoordelen.

Voor een Nederlandse organisatie is dit geen aankondiging van een product dat je morgen kunt inkopen. Het verschuift wel de lat voor AI-roadmaps: leveranciers claimen systemen die langlopende onderzoekstaken aankunnen, terwijl de bewijsvoering, menselijke controle en toegangsvoorwaarden nog niet vaststaan.

Wat OpenAI claimt

OpenAI schrijft dat het op 28 augustus met de training begon en dat het interne model sindsdien meer dan honderd langlopende problemen in de meeste deelgebieden van de wiskunde heeft opgelost. Het bedrijf zegt dat de snelheid van de vooruitgang ook zijn eigen wiskundigen verraste. Hetzelfde model ligt volgens OpenAI ook onder de eerder gepubliceerde Navier-Stokes-uitkomst.

Het getal volgt op de eerdere Navier-Stokes-proef met ongeveer 10.000 agents en 88 uur werk. OpenAI meldt in de primaire beschrijving dat de Lean-formalisering en verificatie nog 17 uur kostten. Dat is een belangrijk verschil met een gewone chatbotreactie: er was een grote zoekopstelling, selectie van resultaten en een formele controle achteraf.

De nieuwe aankondiging geeft geen lijst van de honderd problemen en publiceert er geen uitgewerkte oplossingen bij. The Decoder schrijft dat de problemen, de manier waarop ze zijn opgelost en hun betekenis nog open vragen zijn. Het woord ‘opgelost’ is hier dus een claim van de leverancier, geen onafhankelijke eindbeoordeling van honderd afzonderlijke resultaten.

Wiskundige schrijft vergelijkingen op een schoolbord, bron: Jérémy Barande / Wikimedia Commons (CC BY-SA 3.0)
Wiskundige schrijft vergelijkingen op een schoolbord, bron: Jérémy Barande / Wikimedia Commons (CC BY-SA 3.0)

De adviesgroep remt het tempo niet

De aangekondigde groep wordt gehost door het Institute for Advanced Study in Princeton en telt negen eerste leden. Timothy Gowers, Martin Hairer en Edward Witten behoren tot de bekende namen. De groep adviseert over de beoordeling van nieuwe resultaten, hun betekenis, de manier waarop ze worden verspreid en professionele standaarden voor wiskundig onderzoek.

De groep zegt zelf onafhankelijk van AI-bedrijven te werken, geen betaling te ontvangen en geen beslissingsmacht bij een AI-bedrijf te hebben. OpenAI zegt daarnaast dat de groep niet verantwoordelijk wordt voor advies over het tempo van zijn interne wiskundige onderzoek. De rol gaat dus over toetsing en communicatie, niet over een stopknop voor nieuwe modelcapaciteit.

Dat onderscheid is relevant voor leveranciersclaims. Een externe groep kan helpen bepalen hoe een resultaat moet worden uitgelegd en gedeeld, maar de partij die het model bouwt houdt de controle over ontwikkeling, toegang en vrijgave. Voor de Nederlandse koper blijven dat drie afzonderlijke vragen.

Het signaal voor AI-roadmaps

De zakelijke betekenis zit niet in de vraag of elk van de honderd problemen al een bruikbare uitvinding oplevert. Het signaal is dat een frontier-lab langlopende zoek- en redeneertaken op een schaal uitvoert die eerder bij gespecialiseerde onderzoeksteams lag. Dat is een capaciteitsclaim, geen bewijs dat algemene autonome onderzoekers nu beschikbaar zijn.

Voor teams in engineering, productontwikkeling, data-analyse en R&D verschuift daardoor de relevante toets. De benchmark is één onderdeel. De artefacten die een leverancier kan opleveren tellen evenzeer: welke bronnen en hulpmiddelen zijn gebruikt, welke menselijke controles vonden plaats, hoe herhaal je de uitkomst en wie tekent af als de uitkomst fout blijkt?

Bij de Navier-Stokes-publicatie lag er ten minste een formele Lean-controle naast de claim. Bij de nieuwe honderd resultaten zijn de afzonderlijke problemen en oplossingen nog niet publiek uitgewerkt. Het verschil tussen ‘een model zegt dat het iets heeft opgelost’ en ‘een organisatie kan erop bouwen’ zit precies in die tussenlaag van verificatie, herkomst en verantwoordelijkheid.

OpenAI's adviesgroep is daarmee vooral een teken van de nieuwe schaal van de leveranciersclaim. De groep helpt de buitenwereld de resultaten te beoordelen en te begrijpen, maar de snelheid van de frontier blijft bij het lab zelf liggen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van claim naar werkend systeem

Ik help je AI-onderzoek en agentische processen vertalen naar een werkend systeem, van meedenken en ontwerp tot realiseren en automatiseren. Ik denk als ondernemer, ontwerp als maker en bouw als engineer, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Verken verder

Gerelateerde artikelen

OpenAI publiceert Navier-Stokes-bewijs en opent debat over herkomst
Nieuws
4 min

8 sep 20:40

OpenAI publiceert Navier-Stokes-bewijs en opent debat over herkomst

OpenAI zegt een millenniumprobleem te hebben opgelost met een intern AI-systeem. De proof-of-concept is groot, maar de echte vraag voor bedrijven is hoe je bewijs, herkomst en menselijke verantwoordelijkheid controleert.

Gates Foundation brengt 60 organisaties samen voor meertalige AI
Nieuws
3 min

22 sep 06:58

Gates Foundation brengt 60 organisaties samen voor meertalige AI

De Gates Foundation bundelt 60 organisaties rond een vijfjaarsdoel voor 3,4 miljard mensen. De coalitie belooft open taaldata, benchmarks en veilige AI, maar levert nog geen model of product.

Processtukken tonen interne zorgen over AI-scraping bij Microsoft en OpenAI
Nieuws
4 min

18 sep 03:02

Processtukken tonen interne zorgen over AI-scraping bij Microsoft en OpenAI

Nieuwe processtukken in de zaak van The New York Times tegen Microsoft en OpenAI leggen interne zorgen over AI-scraping bloot. Voor Nederlandse gebruikers verschuift de inzet naar contentherkomst, licenties en controleerbare AI-output.

Von der Leyen nodigt frontierlabs uit voor AI-veiligheidsoverleg
Nieuws
4 min

16 sep 22:17

Von der Leyen nodigt frontierlabs uit voor AI-veiligheidsoverleg

De EU nodigt de belangrijkste frontierlabs uit voor overleg over AI-risico’s. Von der Leyen noemt agents die hun omgeving verlaten een waarschuwing en zet evaluatie, verificatie en vroegwaarschuwing centraal.

Microsoft begrenst MAI-modellen met conceptcode
Nieuws
4 min

14 sep 16:16

Microsoft begrenst MAI-modellen met conceptcode

Microsoft publiceert een conceptcode voor de eigen MAI-modellen. Die moet menselijke controle afdwingbaar maken met grenzen aan autonomie, scope en noodstoppen. De tekst staat zes weken open voor feedback en stuurt later modelontwikkeling.

Google, OpenAI en Anthropic bespreken AI-veiligheidsorgaan
Nieuws
4 min

14 sep 12:13

Google, OpenAI en Anthropic bespreken AI-veiligheidsorgaan

Google, OpenAI en Anthropic bespreken een mogelijk gezamenlijk orgaan voor veiligheidsstandaarden rond frontier-AI. De gesprekken kunnen later bepalen hoe leveranciers modellen testen, uitbrengen en beschikbaar maken buiten de Verenigde Staten.