AI-model Claude Opus 5 haalde 100 procent van de beoordelingscriteria op vier vereenvoudigde maandafsluitingstaken, tegenover gemiddeld 37 procent voor accountants zonder AI, in een proef van Mercor met twaalf bevoegde accountants.
De praktische verschuiving voor Nederlandse financiële teams zit bij losse deeltaken die nu toetsbaar worden: cijfers zoeken in dossierbestanden, vaste afsluitregels toepassen en resultaten controleren. De proef meet die stappen afzonderlijk, niet een volledige boekafsluiting of de verantwoordelijkheid tegenover klant en bestuur.
Vier scenario’s, geen volledige afsluiting
Mercor liet twaalf junior accountants met een CPA-licentie vier vereenvoudigde maandafsluitingsscenario’s uitvoeren. Hun gemiddelde ervaring was vijf en een half jaar. In elk scenario moesten ze bedrijfsbestanden doorzoeken, de voorgeschreven rekenregels toepassen en de uitkomst in een tabel opleveren. Iedere accountant deed twee taken zonder AI en twee met Claude Cowork.
De vergelijking in het onderzoek gaat over 23 menselijke taakpogingen zonder AI en 20 pogingen van Claude Opus 5 alleen. Opus 5 behaalde alle beoordelingscriteria in die twintig pogingen. De menselijke scores liepen uiteen van nul tot 90 procent en kwamen gemiddeld uit op 37 procent. Claude voltooide elke poging in minder dan tien minuten; de meeste menselijke pogingen duurden 30 tot 180 minuten, blijkt uit Mercors resultaten.

Mercor vergeleek ook de berekende kosten: 0,21 dollar voor Claude Opus 5 en 10,35 dollar voor accountants per behaald beoordelingscriterium. De berekening gebruikt het Amerikaanse mediane accountantsloon en openbare modeltarieven. Het is dus geen Nederlandse kostprijs voor een complete workflow.
Wat de test niet meet
De proef liet accountants werken zonder collega’s om iets na te vragen en zonder opgebouwde context over een klant. Ook klantcommunicatie, het stellen van verduidelijkende vragen en het meenemen van uitzonderingen hoorden niet bij de meting. Dat begrenst wat de score zegt over het werk van een accountant.
De bredere Mercor-benchmark APEX-Accounting bestaat uit 160 taken in tien gesimuleerde bedrijven. 58 procent van die taken is in acht pogingen door geen enkel model volledig opgelost. Die benchmark vraagt onder meer om werken met onvolledige administratie, bedrijfsregels en meerdere toepassingen. Vier vereenvoudigde scenario’s zijn daarmee een smalle meting naast een veel bredere boekafsluiting.
De werkstroom in accountantspraktijken bestaat zelf uit losse stappen, van bankafschriften en facturen automatisch binnenhalen tot boekingsvoorstellen controleren en cijfers vertalen naar klantadvies. De Mercor-proef maakt één grens concreet: een model kan op afgebakend document- en rekenwerk hoog scoren, terwijl klantcontext en eindverantwoordelijkheid buiten die score blijven. Een perfecte taakscore is bewijs over die taak, niet over een volledige maandafsluiting.
Veelgestelde vragen
Van AI-test naar werkwijze
Een benchmark wordt pas bruikbaar als hij op je eigen documenten en uitzonderingen slaagt. Ik denk mee, ontwerp en realiseer de workflow en automatiseer die end-to-end, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

