Twee ontwikkelaars doen een code review bij een monitor.
Nieuws6 oktober · 02:115 min leestijd

GitHub opent ReviewBench voor AI-code review

ReviewBench laat ontwikkelteams AI-code-reviewers vergelijken op 219 openbare pull requests. De dataset en scoremethode zijn openbaar, maar labels steunen deels op een taalmodel en de volledige score vraagt eigen rekencapaciteit.

ReviewBench is openbaar: GitHub laat AI-code-reviewers dezelfde 219 openbare pull requests beoordelen, zodat teams meldingen en gemiste fouten onder één meetlat kunnen vergelijken.

Een Nederlands ontwikkelteam kan zo AI-reviewers op vaste pull requests vergelijken. Die cijfers geven houvast voordat opmerkingen automatisch naar ontwikkelaars gaan of een AI-agent zelfstandig wijzigingen samenvoegt. De benchmark telt zowel gevonden problemen als onterechte meldingen. Veel opmerkingen betekenen dus niet automatisch een goede review.

De set is breed, maar niet willekeurig

De 219 pull requests komen uit 187 openbare repositories met een open licentie en beslaan 19 programmeertalen. De benchmark volgt grotendeels de verdeling van programmeertalen en repositorygroottes. Middelgrote en grote wijzigingen krijgen bewust meer gewicht, zodat kleine aanpassingen in één bestand de test niet domineren.

De volledige lijst met pull requests en de bijbehorende bevindingen staan in de openbare ReviewBench-repository. Dat maakt een run op dezelfde voorbeelden controleerbaar, maar zegt nog niets over interne code of eigen programmeerafspraken.

Grafische weergave van ReviewBench met een benchmarkranglijst, bron: ReviewBench
Grafische weergave van ReviewBench met een benchmarkranglijst, bron: ReviewBench

De score telt ook wat de agent mist

De referentieset combineert menselijke reviews, problemen uit vervolgcommits, statische analysetools en meldingen van meerdere taalmodellen. Dubbele bevindingen zijn samengevoegd. Een melding telt alleen als die waar, relevant en niet triviaal is. Senior engineers buiten het datasetteam controleerden de labels opnieuw. De modelbeoordeling voor waar of onwaar stemde in 96,6 procent van de gevallen met hen overeen.

Claude Sonnet 5 helpt bij het toekennen van labels en het beoordelen van nieuwe meldingen. ReviewBench rapporteert zes scores: precisie, recall en F1 voor bekende bevindingen, en dezelfde drie maten voor alle bevindingen inclusief nieuwe vondsten. Precisie is het aandeel meldingen dat klopt, recall is hoeveel bekende problemen de agent vindt en F1 vat beide samen. De eerste groep vergelijkt elke agent met dezelfde vaste labels. De tweede kan ook een goed probleem erkennen dat nog niet in de referentieset stond.

Augmented recall is minder geschikt voor een directe vergelijking. De noemer groeit mee met nieuwe problemen die een agent vindt. Daardoor is de uitkomst geen vaste maat tussen agents. GitHub gebruikt grounded recall als hoofdmaat en laat de Fβ-score de voorkeur voor precisie of recall meewegen. De cijfers zijn ook uit te splitsen naar ernst en soort probleem. De methodologie beschrijft de formules en bekende beperkingen. De methode is reproduceerbaar, maar labels blijven afhankelijk van de rubric, Claude Sonnet 5 en een taalmodel dat meldingen aan referentieproblemen koppelt.

GitHub zegt dat ReviewBench ook de richting van een Copilot Code Review-proef voorspelde. In de A/B-test van een ensemble met onafhankelijke modelruns steeg het aandeel opmerkingen dat ontwikkelaars met een codewijziging oppakten met 8 procent. Recall steeg met 13,6 procent; de kosten per review daalden met 8 procent. GitHub bepaalt zelf met een taalmodel of een opmerking tot een codewijziging leidde.

De bron spreekt zichzelf tegen over commentaarvolume: de tekst noemt 61 procent meer opmerkingen, de grafiek eronder 25 procent online tegenover 40 procent voorspeld. Voor kritieke opmerkingen noemt GitHub 262 procent online tegenover 227 procent voorspeld. Dit zijn resultaten van een interne Copilot-proef, geen garantie dat een vergelijkbare score andere teams dezelfde uitkomst geeft.

Andere meetlatten stellen andere vragen

Kodus testte met CodeReviewBench 30 samengevoegde pull requests uit vijf repositories tegen 95 bevestigde fouten. Alle modellen draaien in dezelfde Kodus-reviewomgeving, één keer per model. De makers waarschuwen dat de betrouwbaarheidsintervallen bij veel scores overlappen. Kleine rangverschillen kunnen daardoor ruis zijn. De 219 gevallen van GitHub maken de tests niet rechtstreeks vergelijkbaar: repositories, beoordelaars en uitvoeringsomgevingen verschillen.

CodeRabbit voegde triage, uitleg van wijzigingen en beveiligingsscans na samenvoegen toe. Daarmee loopt de werkstroom van het verdelen van menselijke aandacht tot bewaking van code die al draait. De ReviewBench-score meet bevindingen in pull requests, niet prioritering, aansluiting op interne afspraken of beveiliging na de merge. CodeRabbits reviewlaag kreeg ook triage en beveiligingsfuncties.

Een openbare score is de eerste selectie

De proefset met 25 pull requests is bedoeld voor kleine technische testruns, niet voor een prestatiemeting. De ranglijst gebruikt alle 219 wijzigingen en drie runs, waarna een beheerder de inzending goedkeurt. Een volledige eigen beoordeling vraagt rekenkracht en modelaanroepen voor zowel de reviewer als de beoordelaar; de open beoordelingspijplijn koppelt meldingen aan de vaste referentieset.

De kwaliteit van openbare codeerbenchmarks is eerder onder druk komen te staan. OpenAI schatte in juli 2026 dat ongeveer 30 procent van de 731 taken in SWE-Bench Pro defect was, waarna het bedrijf zijn eerdere aanbeveling introk. Dat was een benchmark voor code schrijven, niet voor code review. De audit laat zien waarom ranglijsten alleen iets zeggen als testgevallen en scoreberekening inzichtelijk blijven. De terugtrekking van OpenAI’s aanbeveling na die audit is een eerdere waarschuwing bij het lezen van nieuwe AI-scores.

Sinds 2 oktober kunnen teams GitHub Copilot Code Review via REST- en GraphQL-API’s aanroepen en per verzoek de grondigheid instellen. De functie is beschikbaar op Pro, Pro+, Max, Business en Enterprise. Een team kan AI-review daardoor in eigen scripts opnemen, waar een foutieve melding of gemiste fout verder reist dan één suggestie in een pull request.

ReviewBench maakt vergelijking controleerbaar doordat iedere kandidaat dezelfde pull requests krijgt en wordt vergeleken met gepubliceerde referentielabels. De benchmark zegt niet hoeveel meldingen jouw ontwikkelaars aankunnen of welke fouten voor je product het zwaarst wegen. Nu reviewagents via API’s makkelijker in ontwikkelprocessen komen, telt de afweging tussen ruis en gemiste problemen zwaarder. De ranglijst geeft een beginpunt; de eigen code laat zien waar die afweging uitkomt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI-review in je ontwikkelproces

Ik denk met je mee over hoe AI-code review in jouw ontwikkelproces past, ontwerp de controlepunten en realiseer de oplossing van eerste idee tot livegang. Waar dat kan, kies ik voor self-hosted software.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Microsoft zet MAI-Code-1.1-Flash in GitHub Copilot, 73 procent goedkoper dan zijn voorganger
Nieuws
4 min

12 aug 08:22

Microsoft zet MAI-Code-1.1-Flash in GitHub Copilot, 73 procent goedkoper dan zijn voorganger

Microsoft zet MAI-Code-1.1-Flash in GitHub Copilot, met een listprijs die 73 procent onder die van zijn voorganger ligt. Wat het model kost, wat het kan, en waarom het bij Business en Enterprise standaard uit staat.

Kimi K2.7 Code nu kiesbaar in GitHub Copilot: eerste open-weight model in de modelkeuze
Nieuws
6 min

3 jul 04:10

Kimi K2.7 Code nu kiesbaar in GitHub Copilot: eerste open-weight model in de modelkeuze

GitHub heeft Kimi K2.7 Code algemeen beschikbaar gemaakt in de Copilot-modelkeuze. Het is het eerste open-weight model in de picker, fors goedkoper dan de frontier-modellen, en je devteam kan vandaag overstappen zonder tooling te wijzigen.

OpenAI verlaagt API-prijzen voor GPT-6 Sol en Luna
Nieuws
4 min

22 sep 22:12

OpenAI verlaagt API-prijzen voor GPT-6 Sol en Luna

OpenAI brengt GPT-6 Sol en Luna uit met lagere API-tarieven: 2 en 10 dollar voor Sol, 0,10 en 0,50 dollar voor Luna per miljoen tokens. Voor Nederlandse teams wordt modelkeuze per taak belangrijker.

Microsoft-medewerkers melden mediaan 300 dollar AI-verbruik per maand
Nieuws
4 min

25 aug 14:24

Microsoft-medewerkers melden mediaan 300 dollar AI-verbruik per maand

Een interne loonspreadsheet bij Microsoft toont voor het eerst gerealiseerde AI-uitgaven per medewerker: mediaan zo'n 300 dollar over 28 dagen, met een uitschieter van 28.000 dollar en grote verschillen per team.

Slack lanceert Slack Code: codeeragents in gedeelde kanalen
Nieuws
5 min

20 aug 20:24

Slack lanceert Slack Code: codeeragents in gedeelde kanalen

Slack Code zet codeeragents als Claude, Devin en GitHub Copilot in projectgebonden kanalen waar het hele team de diff en de preview ziet. Beschikbaar op elk abonnement, en dat verschuift je codereview naar Slack.

GitHub meldt zware storing in API, Actions, Pull Requests en Copilot
Nieuws
4

17 aug 18:08

GitHub meldt zware storing in API, Actions, Pull Requests en Copilot

GitHub zet API Requests, Issues, Pull Requests, Actions en Copilot op major outage. Het incident loopt sinds 15.40 uur zonder bekende oorzaak, met 20 procent fouten op het web en 50 procent op downloads.