Anthropic meldt dat 26 procent van zijn AI-R&D-werk in augustus op AL4-niveau uitkomt, waar Claude het werk grotendeels zelfstandig uitvoert maar een mens toezicht houdt.
Voor een Nederlandse ondernemer maakt dat de meetlat voor AI-agents concreter: het verschil zit in twee dingen, hoeveel werk een model doet en welke taak het zelfstandig afmaakt terwijl menselijke controle blijft.
Wat ‘leiden’ bij Anthropic betekent
Anthropic gebruikt een schaal van AL0 tot AL5. AL3 staat voor samenwerken, waarbij AI grote delen van een taak uitvoert onder nauwe menselijke sturing. AL4 betekent dat AI het grootste deel van een taak van begin tot eind kan afronden vanaf een hoge instructie, terwijl een mens toezicht houdt. AL5 is volledig autonoom werk zonder mens in de lus.
Claude haalt AL5 in geen enkel gemeten onderdeel van Anthropics AI-R&D. Meer dan 90 procent van het onderzochte werk zit wel op minstens AL3. Het aandeel op AL4-niveau steeg van minder dan 1 procent in februari naar 26 procent in augustus 2026.

Een voorbeeld uit de methodiek maakt de grens tastbaar: Claude kan een bugrapport onderzoeken, een fix schrijven en testen, maar een engineer beslist nog of die fix wordt uitgerold. Die grens tussen AL4 en volledige autonomie blijft scherp.
26 procent is geen kwart van alle beslissingen
Het cijfer komt uit een prototype-index die Anthropic bouwde door AI-R&D-taken in kaart te brengen, ze op de AL-schaal te beoordelen en ze te wegen naar de tijd die medewerkers eraan besteden. Het gaat dus om een gewogen aandeel van het werk, niet om 26 procent van alle taken, beslissingen of onderzoekslijnen.
Voor de index nam Anthropic in elke week van juli 2026 een steekproef van 20 procent van de medewerkers uit afdelingen die aan de modelontwikkeling werken. Dat leverde ongeveer 15.000 gedetailleerde R&D-taken op, geordend in 542 knooppunten en 378 eindcategorieën. Claude-agenten haalden bewijs uit Slack en interne documentatie. Een andere Claude beoordeelde vervolgens hoe geautomatiseerd elke categorie was.
De controle op die methode laat zien waarom het percentage voorzichtig gelezen moet worden. Het Claude-oordeel kwam exact overeen met menselijke beoordelingen in 59 procent van de gevallen. Twee menselijke beoordelaars waren het onderling in 35 procent van de gevallen exact eens. In 97 procent van de gevallen lag het model maximaal één niveau van het menselijke oordeel af. Juist de grens tussen AL3 en AL4 kan het verschil maken tussen ‘samenwerken’ en ‘leiden’.
Toezicht krijgt een eigen meetlat
Anthropic publiceert naast de R&D-index ook cijfers over toezicht. Op het meest gebruikte interne platform draaien ongeveer 30.000 agents tegelijk. Volgens heise online ging meer dan een miljard beslissingen in augustus door een monitor, die ongeveer één op 47.000 beslissingen blokkeerde. Dat is 0,002 procent.
De online monitor controleert acties vóór uitvoering. Een tweede monitor leest acties achteraf. Beide dekken volgens Anthropic alle acties op dit platform. De controle achteraf markeert ongeveer 100.000 transcripties per week voor verdere beoordeling, waarvan ongeveer 50 meldingen naar menselijke reviewers gaan. De cijfers gelden alleen voor dit interne platform en voor een monitoringsysteem dat pas enkele maanden draait.
Daarmee laat Anthropic zien dat autonomie en toezicht twee aparte grootheden zijn. Een agent kan een taak grotendeels zelf afmaken, terwijl een organisatie nog moet aantonen hoe snel afwijkingen worden gevonden, wanneer een actie wordt gestopt en wie het laatste woord heeft.
Een ander cijfer dan de eerdere 65 procent
Het nieuwe getal is niet hetzelfde als Anthropics eerdere claim dat 65 procent van de productcode door Claude Tag werd gemaakt. Dat cijfer ging over codeproductie door een interne AI-collega. De nieuwe 26 procent gaat over een veel bredere verzameling R&D-activiteiten en gebruikt mensuren als gewicht. De twee percentages zijn daarom niet op één schaal te zetten.
De verschuiving voor Nederlandse organisaties zit in de vergelijkbaarheid van AI-claims. Een leverancierscijfer wordt bruikbaar zodra het benoemt welke taken zijn gemeten, hoe ze zijn gewogen, wanneer een mens ingrijpt en hoe afwijkingen worden geregistreerd. Anthropic zegt zelf dat een gemeenschappelijke methode en onafhankelijke controle nog ontbreken.
De nieuwigheid zit dus niet in een model dat zichzelf al bouwt. Het is dat een frontierlab de stap naar agentisch R&D probeert te meten, inclusief de gaten in de eigen meetmethode. Voor elk bedrijf dat AI-agents inzet, wordt precies die meetdiscipline de grens tussen een demo en een beheersbaar proces.
Veelgestelde vragen
AI meten vóór je opschaalt
Ik help bedrijven AI-agents inzetten en ontwerp, bouw en automatiseer het proces eromheen. Van meedenken tot realiseren, met toezicht en self-hosting waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

