ReviewBench is openbaar: GitHub laat AI-code-reviewers dezelfde 219 openbare pull requests beoordelen, zodat teams meldingen en gemiste fouten onder één meetlat kunnen vergelijken.
Een Nederlands ontwikkelteam kan zo AI-reviewers op vaste pull requests vergelijken. Die cijfers geven houvast voordat opmerkingen automatisch naar ontwikkelaars gaan of een AI-agent zelfstandig wijzigingen samenvoegt. De benchmark telt zowel gevonden problemen als onterechte meldingen. Veel opmerkingen betekenen dus niet automatisch een goede review.
De set is breed, maar niet willekeurig
De 219 pull requests komen uit 187 openbare repositories met een open licentie en beslaan 19 programmeertalen. De benchmark volgt grotendeels de verdeling van programmeertalen en repositorygroottes. Middelgrote en grote wijzigingen krijgen bewust meer gewicht, zodat kleine aanpassingen in één bestand de test niet domineren.
De volledige lijst met pull requests en de bijbehorende bevindingen staan in de openbare ReviewBench-repository. Dat maakt een run op dezelfde voorbeelden controleerbaar, maar zegt nog niets over interne code of eigen programmeerafspraken.

De score telt ook wat de agent mist
De referentieset combineert menselijke reviews, problemen uit vervolgcommits, statische analysetools en meldingen van meerdere taalmodellen. Dubbele bevindingen zijn samengevoegd. Een melding telt alleen als die waar, relevant en niet triviaal is. Senior engineers buiten het datasetteam controleerden de labels opnieuw. De modelbeoordeling voor waar of onwaar stemde in 96,6 procent van de gevallen met hen overeen.
Claude Sonnet 5 helpt bij het toekennen van labels en het beoordelen van nieuwe meldingen. ReviewBench rapporteert zes scores: precisie, recall en F1 voor bekende bevindingen, en dezelfde drie maten voor alle bevindingen inclusief nieuwe vondsten. Precisie is het aandeel meldingen dat klopt, recall is hoeveel bekende problemen de agent vindt en F1 vat beide samen. De eerste groep vergelijkt elke agent met dezelfde vaste labels. De tweede kan ook een goed probleem erkennen dat nog niet in de referentieset stond.
Augmented recall is minder geschikt voor een directe vergelijking. De noemer groeit mee met nieuwe problemen die een agent vindt. Daardoor is de uitkomst geen vaste maat tussen agents. GitHub gebruikt grounded recall als hoofdmaat en laat de Fβ-score de voorkeur voor precisie of recall meewegen. De cijfers zijn ook uit te splitsen naar ernst en soort probleem. De methodologie beschrijft de formules en bekende beperkingen. De methode is reproduceerbaar, maar labels blijven afhankelijk van de rubric, Claude Sonnet 5 en een taalmodel dat meldingen aan referentieproblemen koppelt.
GitHub zegt dat ReviewBench ook de richting van een Copilot Code Review-proef voorspelde. In de A/B-test van een ensemble met onafhankelijke modelruns steeg het aandeel opmerkingen dat ontwikkelaars met een codewijziging oppakten met 8 procent. Recall steeg met 13,6 procent; de kosten per review daalden met 8 procent. GitHub bepaalt zelf met een taalmodel of een opmerking tot een codewijziging leidde.
De bron spreekt zichzelf tegen over commentaarvolume: de tekst noemt 61 procent meer opmerkingen, de grafiek eronder 25 procent online tegenover 40 procent voorspeld. Voor kritieke opmerkingen noemt GitHub 262 procent online tegenover 227 procent voorspeld. Dit zijn resultaten van een interne Copilot-proef, geen garantie dat een vergelijkbare score andere teams dezelfde uitkomst geeft.
Andere meetlatten stellen andere vragen
Kodus testte met CodeReviewBench 30 samengevoegde pull requests uit vijf repositories tegen 95 bevestigde fouten. Alle modellen draaien in dezelfde Kodus-reviewomgeving, één keer per model. De makers waarschuwen dat de betrouwbaarheidsintervallen bij veel scores overlappen. Kleine rangverschillen kunnen daardoor ruis zijn. De 219 gevallen van GitHub maken de tests niet rechtstreeks vergelijkbaar: repositories, beoordelaars en uitvoeringsomgevingen verschillen.
CodeRabbit voegde triage, uitleg van wijzigingen en beveiligingsscans na samenvoegen toe. Daarmee loopt de werkstroom van het verdelen van menselijke aandacht tot bewaking van code die al draait. De ReviewBench-score meet bevindingen in pull requests, niet prioritering, aansluiting op interne afspraken of beveiliging na de merge. CodeRabbits reviewlaag kreeg ook triage en beveiligingsfuncties.
Een openbare score is de eerste selectie
De proefset met 25 pull requests is bedoeld voor kleine technische testruns, niet voor een prestatiemeting. De ranglijst gebruikt alle 219 wijzigingen en drie runs, waarna een beheerder de inzending goedkeurt. Een volledige eigen beoordeling vraagt rekenkracht en modelaanroepen voor zowel de reviewer als de beoordelaar; de open beoordelingspijplijn koppelt meldingen aan de vaste referentieset.
De kwaliteit van openbare codeerbenchmarks is eerder onder druk komen te staan. OpenAI schatte in juli 2026 dat ongeveer 30 procent van de 731 taken in SWE-Bench Pro defect was, waarna het bedrijf zijn eerdere aanbeveling introk. Dat was een benchmark voor code schrijven, niet voor code review. De audit laat zien waarom ranglijsten alleen iets zeggen als testgevallen en scoreberekening inzichtelijk blijven. De terugtrekking van OpenAI’s aanbeveling na die audit is een eerdere waarschuwing bij het lezen van nieuwe AI-scores.
Sinds 2 oktober kunnen teams GitHub Copilot Code Review via REST- en GraphQL-API’s aanroepen en per verzoek de grondigheid instellen. De functie is beschikbaar op Pro, Pro+, Max, Business en Enterprise. Een team kan AI-review daardoor in eigen scripts opnemen, waar een foutieve melding of gemiste fout verder reist dan één suggestie in een pull request.
ReviewBench maakt vergelijking controleerbaar doordat iedere kandidaat dezelfde pull requests krijgt en wordt vergeleken met gepubliceerde referentielabels. De benchmark zegt niet hoeveel meldingen jouw ontwikkelaars aankunnen of welke fouten voor je product het zwaarst wegen. Nu reviewagents via API’s makkelijker in ontwikkelprocessen komen, telt de afweging tussen ruis en gemiste problemen zwaarder. De ranglijst geeft een beginpunt; de eigen code laat zien waar die afweging uitkomt.
Veelgestelde vragen
AI-review in je ontwikkelproces
Ik denk met je mee over hoe AI-code review in jouw ontwikkelproces past, ontwerp de controlepunten en realiseer de oplossing van eerste idee tot livegang. Waar dat kan, kies ik voor self-hosted software.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
