Een vergrootglas naast een laptop op een tafel.
Nieuws9 juli · 16:324 leestijd

OpenAI trekt aanbeveling van codeerbenchmark SWE-Bench Pro in na eigen audit

OpenAI trekt na een eigen audit zijn aanbeveling van codeerbenchmark SWE-Bench Pro in: ongeveer 30 procent van de opgaven blijkt kapot. Wat dat betekent als je je modelkeuze op ranglijsten baseert.

OpenAI trekt zijn aanbeveling van SWE-Bench Pro in, een van de meest gebruikte tests voor AI-codeermodellen, nadat een eigen audit uitwees dat ongeveer 30 procent van de opgaven kapot is.

Voor bedrijven die hun keuze voor een codeermodel of coding-agent op openbare ranglijsten baseren, is dat een direct probleem. Een benchmarkscore bepaalt vaak welk model een team inkoopt of laat meeschrijven aan zijn software. Als bijna een derde van de meetpunten onbetrouwbaar is, meet de ranglijst niet wat je denkt: een model kan zijn afgerekend op opgaven die niemand goed kon oplossen, of juist geslaagd op taken die te makkelijk waren. De cijfers waarop je je modelkeuze baseert, staan dan op drijfzand.

Wat de audit vond

OpenAI liet zijn eigen analysepijplijn en vijf ervaren software-engineers los op de openbare set van 731 opgaven. De geautomatiseerde screening markeerde 200 taken (27,4 procent) als kapot, de menselijke beoordelaars kwamen op 249 (34,1 procent). Bij elkaar schat OpenAI dat ongeveer 30 procent van de opgaven onbruikbaar is.

De problemen vallen in vier soorten. Sommige tests zijn te streng en keuren werkende oplossingen af omdat ze een implementatiedetail eisen dat nergens in de opdracht staat. Andere opdrachten zijn te vaag en verwachten eisen die alleen in verborgen tests staan. Weer andere tests controleren te weinig, zodat een halve oplossing toch slaagt. En soms wijst de opdracht het model simpelweg de verkeerde kant op. In een van de voorbeelden verschilde de opdracht een enkele spatie van de verborgen test: wie de instructie letterlijk volgde, zakte.

Twee keer op rij een codeertest afgekeurd

Het is de tweede keer in korte tijd dat OpenAI een veelgebruikte codeertest afserveert. Eerder concludeerde het bedrijf dat de voorganger, SWE-bench Verified, fundamentele ontwerp- en besmettingsproblemen had en geen betekenisvol signaal meer gaf; toen raadde het de sector juist aan om over te stappen op SWE-Bench Pro. Die aanbeveling trekt OpenAI nu zelf terug.

Opvallend is dat het bedrijf geen nieuwe favoriet aanwijst. In plaats daarvan roept het de bredere gemeenschap op om nieuwe benchmarks te bouwen die door ervaren ontwikkelaars zijn opgezet, moeilijk te bespelen zijn en het echte kunnen van een model meten. OpenAI staat daarin niet alleen: analysebureau Artificial Analysis haalde SWE-Bench Pro medio juni al uit zijn ranglijst en verving het door DeepSWE, omdat modellen oplossingen konden overnemen uit de commitgeschiedenis waaruit de opgaven waren samengesteld.

Waarom deze tests zo breekbaar zijn

Het patroon achter beide missers is hetzelfde: de opgaven komen uit de geschiedenis van echte softwareprojecten, uit issues en pull requests die ooit voor mensen zijn geschreven, niet om een model eerlijk te toetsen. De tests die bij zo'n wijziging horen, zijn vaak geschreven om precies die ene aanpassing te controleren, niet om een taak los van de implementatie af te bakenen. Daardoor lekt er ruis in de score.

Het bevestigt een terugkerend probleem met leaderboards: een getal dat objectief oogt, kan om allerlei redenen misleiden. Het Britse AI-veiligheidsinstituut liet eerder zien dat lage benchmarkscores van AI-agents vaak aan een te krap tokenbudget liggen, niet aan een zwakker model. Dezelfde ranglijst kan een model dus onterecht af- of juist opwaarderen.

Voor wie een model of coding-agent kiest, betekent dit niet dat benchmarks waardeloos zijn, maar dat een publieke ranglijst hooguit een vertrekpunt is. De harde toets is een proef op je eigen werk. Databricks liet dat deze week zien door het open model GLM 5.2 op zijn eigen codebase van miljoenen regels te testen in plaats van op een publiek leaderboard, en pas op basis daarvan zijn standaardmodel te kiezen. Dat OpenAI zijn eigen aanraders nu binnen enkele maanden weer intrekt, onderstreept dezelfde les: de enige meting die telt voor jouw beslissing, is er een op jouw code en jouw taken.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Kiezen zonder leaderboard-gok

Welk AI-model of welke agent jouw werk het beste doet, blijkt niet uit een ranglijst maar uit een proef op je eigen situatie. Ik denk met je mee, ontwerp die aanpak en bouw de agents en meetopstelling die de keuze concreet maken, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Meta lanceert Muse Spark 1.3 met 25 procent minder tokens
Nieuws
5 min

3 sep 00:10

Meta lanceert Muse Spark 1.3 met 25 procent minder tokens

Meta brengt Muse Spark 1.3 uit met volgens eigen metingen 20 procent minder toolaanroepen en 25 procent minder tokens dan versie 1.2, tegen dezelfde prijs. Wat dat scheelt op de rekening van een codeeragent.

GLM-5.2 weigert in test van SaferAI geen enkele offensieve cyber- of biotaak
Nieuws
5 min

5 aug 04:11

GLM-5.2 weigert in test van SaferAI geen enkele offensieve cyber- of biotaak

Het Franse SaferAI mat GLM-5.2 langs de vier systeemrisico's van de EU-Gedragscode. Het Chinese open model weigerde geen enkele offensieve cyber- of biologietaak, terwijl Claude Opus 4.7 zo vaak weigerde dat een benchmark niet af kwam.

Cyberdefensiebrief groeit van 116 naar 155 ondertekenaars
Nieuws
4 min

30 aug 10:07

Cyberdefensiebrief groeit van 116 naar 155 ondertekenaars

De open brief over cyberdefensie telt sinds zaterdag 155 ondertekenaars tegen 116 op 27 augustus. GitHub, Datadog, Atlassian en Nokia tekenden bij, Nvidia en Meta blijven weg en de lijst staat nu open voor aanmeldingen.

Google DeepMind laat Gemini dubbelblind toetsen zonder de testvragen te zien
Nieuws
5 min

28 aug 16:27

Google DeepMind laat Gemini dubbelblind toetsen zonder de testvragen te zien

Google DeepMind toetste Gemini 2.5 Flash Lite in een versleutelde enclave waarin de evaluator de gewichten niet zag en Google de vragen niet. Een score publiceert het bedrijf niet: dit is een pilot, geen norm.

OpenAI-beleidschef waarschuwt voor aanhoudende cyberaanvallen door AI
Nieuws
5 min

23 aug 14:22

OpenAI-beleidschef waarschuwt voor aanhoudende cyberaanvallen door AI

OpenAI-topman Chris Lehane zegt dat bedrijven zich moeten voorbereiden op doorlopende AI-aanvallen vanuit open modellen. Dat verschuift de rekening van preventie naar detectie, logging en wat je in een leverancierscontract vastlegt.

Z.ai brengt GLM-5.3 uit en houdt de gewichten twee weken achter
Nieuws
5 min

14 aug 12:10

Z.ai brengt GLM-5.3 uit en houdt de gewichten twee weken achter

Z.ai bracht GLM-5.3 uit via zijn API, maar de gewichten volgen pas over twee weken omdat de post-training onverwacht sterke exploitvaardigheden opleverde. Zelf hosten kan dus nog niet, meelopen via een Chinese API wel.