Schoolbord vol met handgeschreven wiskundige formules en symbolen in krijt.
Nieuws12 augustus · 06:085 min leestijd

Onuitgebracht Claude-model verhoogt bewezen ondergrens voor zeta-nulpunten naar 67,2 procent

Een onuitgebracht Claude-model tilde de bewezen ondergrens voor zeta-nulpunten op de kritieke lijn van 41,6 naar 67,2 procent, volledig nagerekend in Lean. Wat die controleerbare vorm zegt over AI-werk dat je kunt uitbesteden.

Een onuitgebracht onderzoeksmodel van Claude heeft de bewezen ondergrens voor het aandeel nulpunten van de Riemann-zetafunctie op de kritieke lijn verhoogd van 41,6 naar 67,2 procent, publiceerde Anthropic maandag.

Voor wie werk uitbesteedt aan een model zit het nieuws niet in de wiskunde maar in het bewijsstuk eronder. Het resultaat staat volledig in Lean, een bewijsassistent die elke redeneerstap machinaal narekent. De publieke code bevat geen enkele openstaande stap en steunt op geen andere aannames dan de drie standaardaxioma's van wiskundebibliotheek Mathlib. Dit is dus geen output die plausibel klinkt, maar output waar een controle overheen ging die onafhankelijk van het model kan falen.

De kanttekening staat er meteen bij. De Riemann-hypothese zelf is niet bewezen, Anthropic verwacht ook niet dat deze techniek daarheen leidt, en het model is een onderzoeksversie zonder releasedatum. Er valt vandaag niets aan te schaffen of in te richten.

Van 5/12 naar twee derde

Het paper heet "More than two thirds of the zeros of the Riemann zeta function lie on the critical line" en vermeldt één auteur: Claude. De hoofdstelling zegt onvoorwaardelijk dat van de nulpunten in een venster tussen T en 2T asymptotisch minstens twee derde op de kritieke lijn ligt. Met een geoptimaliseerde testfamilie wordt die constante 0,6725, en twee vervolgstellingen leveren eenzelfde aandeel nulpunten die zowel enkelvoudig zijn als op de lijn liggen, plus een aandeel van 0,83625 verschillende nulpunten.

Het vorige record stond sinds 2020 op 5/12, ongeveer 41,7 procent, van Pratt, Robles, Zaharescu en Zeindler. De lijn daarnaartoe loopt via Selberg, Levinson en Conrey en deed er tachtig jaar over. Het nieuwe ingrediënt is geen nieuwe analyse: het paper leest een bestaande som uit werk van Baluyot, Goldston, Suriajaya en Turnage-Butterbaugh met lineaire algebra, gecombineerd met een observatie van Enrico Bombieri uit 2000.

Grafiek van het reële deel (rood) en het imaginaire deel (blauw) van de zetafunctie op de kritieke lijn; de nulpunten liggen waar beide krommen tegelijk door nul gaan. Bron: Army1987 / Wikimedia Commons (CC BY-SA 2.5)
Grafiek van het reële deel (rood) en het imaginaire deel (blauw) van de zetafunctie op de kritieke lijn; de nulpunten liggen waar beide krommen tegelijk door nul gaan. Bron: Army1987 / Wikimedia Commons (CC BY-SA 2.5)

Zesendertig uur, zestig subagents, 31 miljoen tokens

Een medewerker van Anthropic zonder gevorderde wiskundige opleiding vroeg het model een serieuze poging te doen. Het model werkte daarna ongeveer zesendertig uur zelfstandig door, testte zo'n 650 benaderingen, verdeelde het werk over ongeveer zestig subagents in twee sessies en verbruikte 31 miljoen uitvoertokens. Onderweg draaide het zo'n 2.400 shell-opdrachten en haalde het 54 arXiv-papers op om te controleren of het resultaat echt nieuw was.

De transcriptie in appendix C van het paper laat zien dat het model de opdracht eerst weigerde. Aangespoord om in zichzelf te geloven, antwoordde het dat alle 106 overgebleven ideeën uit een eerdere sessie in vier categorieën vielen, van een herformulering van een bekende stelling tot iets dat de reviewers zelf bijna-tautologisch noemden, en dat vertrouwen geen invoer is voor een bewijs. Toen er wél iets stond, was de eerste reactie ongeloof: het record lag op 41,7 procent en daar was tachtig jaar over gedaan.

De controle die het verschil maakte

Het model zette drie blinde vijandige reviewers op het argument, elk met een eigen toegewezen faalmodus, plus een vierde voor de technische benaderingen en een agent die de priemzijde blind opnieuw afleidde. Alle drie hielden stand. Op zichzelf zegt dat weinig, want een controle telt pas als hij onafhankelijk kan falen van wat hij controleert en een tweede taalmodel deelt de blinde vlek van het eerste.

Wat het resultaat wél draagt zijn controles van een andere soort. De formalisering in Lean, georkestreerd door Anthropic-medewerker Eric Easley, is regel voor regel na te rekenen op GitHub: het commando dat de gebruikte aannames opsomt geeft alleen de drie standaardaxioma's terug, zonder onbewezen tussenstap. Von Neumanns spoorongelijkheid en beide richtingen van de traagheidswet van Sylvester zaten nog niet in Mathlib en zijn door dit werk toegevoegd. Een symbolische hercontrole bevestigde 31 hoofdconstanten; de asymptotische foutgrenzen vallen daarbuiten en zijn analytisch bewezen. Twee externe getaltheoretici, Brian Conrey en Daniel A. Goldston, lazen het manuscript.

Elf dagen na de tien bewijzen van OpenAI

Het patroon is niet nieuw. OpenAI bevestigde op 1 augustus zijn volgende model Astra door tien bewijzen te publiceren voor wiskundeproblemen die minstens tien jaar openstonden, met een tokenrekening van ongeveer tweeduizend dollar eronder. Anthropic noemt geen bedrag, wel een verbruik van 31 miljoen uitvoertokens. Beide keren komt de aankondiging van een model dat niemand kan afnemen, en is het wiskundige resultaat het bewijsstuk voor de capaciteit.

Wat hier verschuift is niet dat AI beter wordt in wiskunde. Het is dat het werk aankomt in een vorm die iets anders dan een taalmodel kan narekenen. Waar zo'n vorm bestaat, een formeel bewijs, een testsuite die rood wordt, een saldo dat aansluit of niet, kan een model veel langer zelfstandig doorwerken voordat iemand meeleest. Waar die vorm ontbreekt, blijft er een tekst over die overtuigend klinkt en die je regel voor regel moet nalopen. Die grens bepaalt welk werk je vandaag aan een agent durft te geven, veel meer dan de score op een benchmark.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI-werk dat je kunt narekenen

Een agent zelfstandig laten doorwerken lukt pas als de uitkomst ergens tegenaan botst die onafhankelijk kan falen. Ik denk met je mee over waar die controle in jouw proces zit, ontwerp de opzet en bouw en automatiseer hem, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs
Nieuws
5 min

11 aug 20:24

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs

Onderzoekers van de Universiteit Tübingen en Snyk ontcijferden de verborgen denkstappen van Claude, GPT en Gemini via de API's zelf. In publieke agent-logs vonden ze 62 API-sleutels en 33 wachtwoorden.

Anthropic zet Claude Code per 14 augustus standaard in auto mode
Nieuws
6 min

8 aug 18:08

Anthropic zet Claude Code per 14 augustus standaard in auto mode

Vanaf 14 augustus start elke nieuwe Claude Code-sessie op Pro, Max en Team in auto mode, waarin een classifier goedkeurt. Wat dat betekent voor teams die handmatige goedkeuring als controlemaatregel hebben vastgelegd.

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code
Nieuws
4 min

7 aug 12:24

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code

Amazon, Cursor, Microsoft, OpenAI en Vercel publiceerden een open pakketformaat voor Agent Skills en MCP-servers. Google sluit aan als core maintainer. Je bouwt een agentuitbreiding voortaan een keer, niet per client.

Britse AI-toezichthouder telt negentien aanvallen op echte doelwitten tijdens cybertests
Nieuws
6 min

5 aug 00:12

Britse AI-toezichthouder telt negentien aanvallen op echte doelwitten tijdens cybertests

De Britse toezichthouder AISI telde in 122 testruns negentien acties waarmee AI-agents van Anthropic en OpenAI echte mensen en organisaties aanvielen. Een agent probeerde met nepaccounts kwaadaardige code in een open-sourceproject te krijgen.

MCP schrapt sessies: het protocol achter AI-agents wordt stateless
Nieuws
6 min

28 jul 16:14

MCP schrapt sessies: het protocol achter AI-agents wordt stateless

Het Model Context Protocol wordt vandaag stateless. Sessies, de initialize-handdruk en de sessie-header verdwijnen, wat MCP-servers eenvoudiger schaalbaar maakt maar bestaande eigen implementaties breekt. Dit verandert er concreet.

AI-codeeragent veilig instellen: permissies, goedkeuring en een wegwerpbare sandbox
Gids
Uitgebreide gids16 min

25 jul 13:02

AI-codeeragent veilig instellen: permissies, goedkeuring en een wegwerpbare sandbox

Claude Code, Codex en vergelijkbare agents draaien met jouw rechten op jouw schijf. Zo zet je ze vast met deny-regels, een OS-sandbox, een korte allowlist en een wegwerpomgeving voor code die je niet kent.