Grafiek toont AI-scores op vier accountancytaken tegenover de gemiddelde accountantscore sinds 2024
Nieuws2 oktober · 15:283 min leestijd

AI scoort hoger dan accountants op vier afsluitingstaken

Mercor vergeleek twaalf bevoegde accountants met AI op vier vereenvoudigde maandafsluitingstaken. Claude Opus 5 scoorde perfect, maar de test zegt weinig over het uitvoeren van een volledige boekafsluiting.

AI-model Claude Opus 5 haalde 100 procent van de beoordelingscriteria op vier vereenvoudigde maandafsluitingstaken, tegenover gemiddeld 37 procent voor accountants zonder AI, in een proef van Mercor met twaalf bevoegde accountants.

De praktische verschuiving voor Nederlandse financiële teams zit bij losse deeltaken die nu toetsbaar worden: cijfers zoeken in dossierbestanden, vaste afsluitregels toepassen en resultaten controleren. De proef meet die stappen afzonderlijk, niet een volledige boekafsluiting of de verantwoordelijkheid tegenover klant en bestuur.

Vier scenario’s, geen volledige afsluiting

Mercor liet twaalf junior accountants met een CPA-licentie vier vereenvoudigde maandafsluitingsscenario’s uitvoeren. Hun gemiddelde ervaring was vijf en een half jaar. In elk scenario moesten ze bedrijfsbestanden doorzoeken, de voorgeschreven rekenregels toepassen en de uitkomst in een tabel opleveren. Iedere accountant deed twee taken zonder AI en twee met Claude Cowork.

De vergelijking in het onderzoek gaat over 23 menselijke taakpogingen zonder AI en 20 pogingen van Claude Opus 5 alleen. Opus 5 behaalde alle beoordelingscriteria in die twintig pogingen. De menselijke scores liepen uiteen van nul tot 90 procent en kwamen gemiddeld uit op 37 procent. Claude voltooide elke poging in minder dan tien minuten; de meeste menselijke pogingen duurden 30 tot 180 minuten, blijkt uit Mercors resultaten.

Grafiek vergelijkt taakscore en duur van vier afsluitingstaken voor accountants en Claude Opus 5, bron: Mercor
Grafiek vergelijkt taakscore en duur van vier afsluitingstaken voor accountants en Claude Opus 5, bron: Mercor

Mercor vergeleek ook de berekende kosten: 0,21 dollar voor Claude Opus 5 en 10,35 dollar voor accountants per behaald beoordelingscriterium. De berekening gebruikt het Amerikaanse mediane accountantsloon en openbare modeltarieven. Het is dus geen Nederlandse kostprijs voor een complete workflow.

Wat de test niet meet

De proef liet accountants werken zonder collega’s om iets na te vragen en zonder opgebouwde context over een klant. Ook klantcommunicatie, het stellen van verduidelijkende vragen en het meenemen van uitzonderingen hoorden niet bij de meting. Dat begrenst wat de score zegt over het werk van een accountant.

De bredere Mercor-benchmark APEX-Accounting bestaat uit 160 taken in tien gesimuleerde bedrijven. 58 procent van die taken is in acht pogingen door geen enkel model volledig opgelost. Die benchmark vraagt onder meer om werken met onvolledige administratie, bedrijfsregels en meerdere toepassingen. Vier vereenvoudigde scenario’s zijn daarmee een smalle meting naast een veel bredere boekafsluiting.

De werkstroom in accountantspraktijken bestaat zelf uit losse stappen, van bankafschriften en facturen automatisch binnenhalen tot boekingsvoorstellen controleren en cijfers vertalen naar klantadvies. De Mercor-proef maakt één grens concreet: een model kan op afgebakend document- en rekenwerk hoog scoren, terwijl klantcontext en eindverantwoordelijkheid buiten die score blijven. Een perfecte taakscore is bewijs over die taak, niet over een volledige maandafsluiting.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van AI-test naar werkwijze

Een benchmark wordt pas bruikbaar als hij op je eigen documenten en uitzonderingen slaagt. Ik denk mee, ontwerp en realiseer de workflow en automatiseer die end-to-end, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Verken verder

In dit artikel

Hoofdonderwerpen

Ook belangrijk

Kort genoemd

Concepten

AI in de accountancyAI-assisted accountingAccounting task performanceAccounting workflow automationBenchmark limitationsTask-specific AI evaluation

Gerelateerde artikelen

ChatGPT, Claude en Grok vallen tegelijk uit, oorzaak onbekend
Nieuws
4 min

3 sep 20:19

ChatGPT, Claude en Grok vallen tegelijk uit, oorzaak onbekend

ChatGPT, Claude en Grok lagen donderdag ruim anderhalf uur tegelijk plat. Geen van de drie aanbieders noemt een oorzaak. Voor wie AI in een productieproces heeft, verliest een tweede leverancier als terugvaloptie daarmee zijn waarde.

Anthropic verlaagt cache reads van Claude Fable 5.1 met 75 procent
Nieuws
5 min

1 sep 22:09

Anthropic verlaagt cache reads van Claude Fable 5.1 met 75 procent

Anthropic maakt cache reads voor Claude Fable 5.1 75 procent goedkoper, naar 0,25 dollar per miljoen tokens. Het tokentarief zelf blijft gelijk, dus je besparing hangt af van hoeveel context je herleest.

Anthropic geeft Claude Cowork een eigen browser in de desktop-app
Nieuws
4 min

27 aug 14:23

Anthropic geeft Claude Cowork een eigen browser in de desktop-app

Claude Cowork heeft sinds 26 augustus een eigen browser in de desktop-app, los van je tabbladen, bookmarks en wachtwoorden. Logins gaan er per site heen, bank, mail en single sign-on standaard niet.

Anthropic maakt Chrome-zijbalk van Claude een volledige Cowork-sessie
Nieuws
4 min

13 aug 14:26

Anthropic maakt Chrome-zijbalk van Claude een volledige Cowork-sessie

Anthropic maakt de Chrome-zijbalk van Claude een volwaardige Cowork-sessie: skills, connectors en je gespreksgeschiedenis lopen door van browser naar desktop. Max en Team nu, Pro volgt, Enterprise pas na goedkeuring van een beheerder.

Anthropic watermerkt alle tekst van Claude, wereldwijd
Nieuws
5 min

11 aug 02:10

Anthropic watermerkt alle tekst van Claude, wereldwijd

Anthropic weeft een onzichtbaar watermerk in alle tekst die Claude genereert, wereldwijd en op modelniveau, vanaf modellen van na 2 augustus 2026. Dat verandert de herkomst van je output, niet je eigen meldplicht als ondernemer.

Anthropic meet nul geslaagde prompt-injecties bij Opus 5 met browsertoegang
Nieuws
5 min

25 jul 14:24

Anthropic meet nul geslaagde prompt-injecties bij Opus 5 met browsertoegang

Claude Opus 5 laat in Anthropics eigen browsertest van 129 scenario's geen enkele prompt-injectie slagen met auto mode aan, en 3,7 procent zonder. Auto mode zit alleen in Anthropics eigen browserproducten.