Twee wetenschappers werken aan computers in een laboratorium.
Nieuws19 september · 03:064 min leestijd

Anthropic meet 26 procent van AI-R&D op AL4-niveau

Anthropic zegt dat Claude 26 procent van het interne AI-R&D-werk op AL4-niveau uitvoert. Dat betekent meestal zelfstandig afronden onder menselijke supervisie, niet dat Claude al autonoom nieuwe modellen bouwt.

Anthropic meldt dat 26 procent van zijn AI-R&D-werk in augustus op AL4-niveau uitkomt, waar Claude het werk grotendeels zelfstandig uitvoert maar een mens toezicht houdt.

Voor een Nederlandse ondernemer maakt dat de meetlat voor AI-agents concreter: het verschil zit in twee dingen, hoeveel werk een model doet en welke taak het zelfstandig afmaakt terwijl menselijke controle blijft.

Wat ‘leiden’ bij Anthropic betekent

Anthropic gebruikt een schaal van AL0 tot AL5. AL3 staat voor samenwerken, waarbij AI grote delen van een taak uitvoert onder nauwe menselijke sturing. AL4 betekent dat AI het grootste deel van een taak van begin tot eind kan afronden vanaf een hoge instructie, terwijl een mens toezicht houdt. AL5 is volledig autonoom werk zonder mens in de lus.

Claude haalt AL5 in geen enkel gemeten onderdeel van Anthropics AI-R&D. Meer dan 90 procent van het onderzochte werk zit wel op minstens AL3. Het aandeel op AL4-niveau steeg van minder dan 1 procent in februari naar 26 procent in augustus 2026.

Grafiek van Anthropic met de stijging van AL4-werk in model-R&D naar 26 procent in augustus 2026, bron: Anthropic
Grafiek van Anthropic met de stijging van AL4-werk in model-R&D naar 26 procent in augustus 2026, bron: Anthropic

Een voorbeeld uit de methodiek maakt de grens tastbaar: Claude kan een bugrapport onderzoeken, een fix schrijven en testen, maar een engineer beslist nog of die fix wordt uitgerold. Die grens tussen AL4 en volledige autonomie blijft scherp.

26 procent is geen kwart van alle beslissingen

Het cijfer komt uit een prototype-index die Anthropic bouwde door AI-R&D-taken in kaart te brengen, ze op de AL-schaal te beoordelen en ze te wegen naar de tijd die medewerkers eraan besteden. Het gaat dus om een gewogen aandeel van het werk, niet om 26 procent van alle taken, beslissingen of onderzoekslijnen.

Voor de index nam Anthropic in elke week van juli 2026 een steekproef van 20 procent van de medewerkers uit afdelingen die aan de modelontwikkeling werken. Dat leverde ongeveer 15.000 gedetailleerde R&D-taken op, geordend in 542 knooppunten en 378 eindcategorieën. Claude-agenten haalden bewijs uit Slack en interne documentatie. Een andere Claude beoordeelde vervolgens hoe geautomatiseerd elke categorie was.

De controle op die methode laat zien waarom het percentage voorzichtig gelezen moet worden. Het Claude-oordeel kwam exact overeen met menselijke beoordelingen in 59 procent van de gevallen. Twee menselijke beoordelaars waren het onderling in 35 procent van de gevallen exact eens. In 97 procent van de gevallen lag het model maximaal één niveau van het menselijke oordeel af. Juist de grens tussen AL3 en AL4 kan het verschil maken tussen ‘samenwerken’ en ‘leiden’.

Toezicht krijgt een eigen meetlat

Anthropic publiceert naast de R&D-index ook cijfers over toezicht. Op het meest gebruikte interne platform draaien ongeveer 30.000 agents tegelijk. Volgens heise online ging meer dan een miljard beslissingen in augustus door een monitor, die ongeveer één op 47.000 beslissingen blokkeerde. Dat is 0,002 procent.

De online monitor controleert acties vóór uitvoering. Een tweede monitor leest acties achteraf. Beide dekken volgens Anthropic alle acties op dit platform. De controle achteraf markeert ongeveer 100.000 transcripties per week voor verdere beoordeling, waarvan ongeveer 50 meldingen naar menselijke reviewers gaan. De cijfers gelden alleen voor dit interne platform en voor een monitoringsysteem dat pas enkele maanden draait.

Daarmee laat Anthropic zien dat autonomie en toezicht twee aparte grootheden zijn. Een agent kan een taak grotendeels zelf afmaken, terwijl een organisatie nog moet aantonen hoe snel afwijkingen worden gevonden, wanneer een actie wordt gestopt en wie het laatste woord heeft.

Een ander cijfer dan de eerdere 65 procent

Het nieuwe getal is niet hetzelfde als Anthropics eerdere claim dat 65 procent van de productcode door Claude Tag werd gemaakt. Dat cijfer ging over codeproductie door een interne AI-collega. De nieuwe 26 procent gaat over een veel bredere verzameling R&D-activiteiten en gebruikt mensuren als gewicht. De twee percentages zijn daarom niet op één schaal te zetten.

De verschuiving voor Nederlandse organisaties zit in de vergelijkbaarheid van AI-claims. Een leverancierscijfer wordt bruikbaar zodra het benoemt welke taken zijn gemeten, hoe ze zijn gewogen, wanneer een mens ingrijpt en hoe afwijkingen worden geregistreerd. Anthropic zegt zelf dat een gemeenschappelijke methode en onafhankelijke controle nog ontbreken.

De nieuwigheid zit dus niet in een model dat zichzelf al bouwt. Het is dat een frontierlab de stap naar agentisch R&D probeert te meten, inclusief de gaten in de eigen meetmethode. Voor elk bedrijf dat AI-agents inzet, wordt precies die meetdiscipline de grens tussen een demo en een beheersbaar proces.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI meten vóór je opschaalt

Ik help bedrijven AI-agents inzetten en ontwerp, bouw en automatiseer het proces eromheen. Van meedenken tot realiseren, met toezicht en self-hosting waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Anthropic publiceert economisch AI-model voor 2030
Nieuws
4 min

9 sep 22:47

Anthropic publiceert economisch AI-model voor 2030

Anthropic publiceert drie Amerikaanse AI-scenario’s tot 2030. In het extreme pad groeit de economie sterk, maar loopt de werkloosheid onder cognitieve werkers op tot 17,9 procent. Het model is een rekenkader, geen voorspelling.

Vercel vervangt OpenAI-model in veiligheidsclassifier door Jev
Nieuws
4 min

18 sep 22:17

Vercel vervangt OpenAI-model in veiligheidsclassifier door Jev

Een Vercel-engineer meldt dat TypeSafe's Jev in een veiligheidsclassifier 5 tot 18 keer sneller en nauwkeuriger was dan GPT-5.6 Luna. De test maakt gespecialiseerde AI-beslissingen concreet voor agentsoftware.

Anthropic richt eigen biologielab in
Nieuws
4 min

18 sep 20:16

Anthropic richt eigen biologielab in

Anthropic bouwt een eigen biologielab in de Bay Area en onderzoekt hoe Claude fysieke experimenten kan aansturen. Voor Nederlandse pharma-, biotech- en laborganisaties verschuift AI daarmee van analyse naar de werkvloer.

Open modellen halen 56 procent van AI Gateway-tokens
Nieuws
4 min

18 sep 16:26

Open modellen halen 56 procent van AI Gateway-tokens

Open-weight-modellen verwerken voor het eerst meer dan de helft van de tokens op Vercels AI Gateway. Toch gaat 64 procent van de uitgaven naar Anthropic, wat modelrouting tot een kostenkeuze maakt.

Hacktron bereikt OpenAI-codeomgeving via forum en SSO
Nieuws
4 min

18 sep 14:15

Hacktron bereikt OpenAI-codeomgeving via forum en SSO

Drie Hacktron-onderzoekers bereikten via een forumlek en een SSO-fout een private OpenAI-codeomgeving en bewezen die toegang met een pull request. Ze lazen de broncode niet, maar de aanvalsketen toont hoe ver agentrechten reiken.

Claude Code Projects verdeelt programmeerwerk over parallelle threads
Nieuws
4 min

17 sep 22:20

Claude Code Projects verdeelt programmeerwerk over parallelle threads

Anthropic maakt Claude Code Projects tot een coördinatielaag die programmeerwerk verdeelt over cloudthreads met gedeeld geheugen, tests en pull requests. Daarmee verschuift de bottleneck naar review, toegangsrechten en agentgovernance.