Softwareontwikkelaar werkt aan code op een laptop in een technische werkplek
Nieuws9 september · 04:304 min leestijd

Sierra maakt agentbouw meetbaar met Hyper-τ-Bench

Sierra maakt met Hyper-τ-Bench zichtbaar of coding-agents echt klantagenten kunnen bouwen. De beste configuratie haalt 23,9 procent, tegenover 82,2 procent voor een expertreferentie op dezelfde evaluaties.

Hyper-τ-Bench maakt agentbouw meetbaar: Sierra stelt op 8 september een open benchmark beschikbaar waarin coding-agents een klantagent bouwen en die op afgeschermde klanttaken laten presteren.

Voor een Nederlandse ondernemer verandert daarmee de toets voor een klantagent. Het gaat niet alleen om code of een goed antwoord, maar om requirements uit bedrijfsdocumenten halen, een klant ondervragen, bestaande systemen via een API bedienen en binnen een kostenlimiet betrouwbare gesprekken voeren.

Een echte klantopdracht in een sandbox

De developer-agent krijgt de documenten en gegevens die een bedrijf in de praktijk bij elkaar heeft: handboeken, supportgesprekken, spreadsheets, screenshots, opnames en een client-API. Een gesimuleerde klant kan aanvullende eisen kennen. De agent moet die informatie verzamelen, een architectuur kiezen en een uitvoerbare klantservice-agent opleveren.

Daarna draait die gebouwde agent tegen gesimuleerde klanten op verborgen taken. Het modelmenu en het budget per gesprek liggen vast. Ook kan de API van de klant subtiele fouten bevatten. De benchmark test zo het hele traject van specificatie naar werkend systeem, niet alleen de kwaliteit van één antwoord.

Schema van Hyper-τ-Bench met bedrijfsbewijs, agentbouw in een sandbox en evaluatie via gesimuleerde klanten. Bron: Sierra Research en arXiv, CC BY 4.0
Schema van Hyper-τ-Bench met bedrijfsbewijs, agentbouw in een sandbox en evaluatie via gesimuleerde klanten. Bron: Sierra Research en arXiv, CC BY 4.0

De openbare repo bevat 53 taken in vier domeinen: luchtvaart, retail, telecom en bankieren. Sierra publiceert de code onder de MIT-licentie, zodat teams de opzet kunnen bestuderen en zelf draaien.

De scorekloof is geen modelranglijst

De resultaten zijn hard. Over die 53 taken haalt de beste geautomatiseerde combinatie, Claude Opus 5 met Claude Code, 23,9 procent. Een expertreferentie, waarbij een engineer met diepe context samenwerkt met een frontier-model, haalt 82,2 procent op dezelfde evaluaties.

Die vergelijking is geen losse modeltest. De score omvat ook hoe goed de developer requirements vindt, een architectuur kiest, API-fouten opvangt, het budget beheert en eigen tests bouwt. Sierra zag op bankingtaken dat agents minder dan 80 van ongeveer 1.700 bestanden openden. Ze stelden hooguit vier vragen terwijl de gesimuleerde klant voor 20 tot 25 requirements de enige bron was. In 92 procent van de builds bleef de architectuur één enkele LLM-tool-lus.

Voor een bedrijf maakt dat onderscheid zichtbaar wat in een offerte snel vervaagt: een model kan een taak uitvoeren, terwijl het bouwproces nog geen betrouwbare agent oplevert. De relevante bewijzen liggen naast antwoordkwaliteit: welke bronnen zijn gelezen, welke eisen zijn uit de klant gehaald, hoe zit de API-adapter in elkaar, wat kost een gesprek en hoe presteert de agent op ongeziene gevallen.

Ook het rekenbudget hoort bij de score. Een eerdere AISI-meting liet zien dat een tienvoudig tokenbudget het slagingspercentage op softwaretaken ongeveer 25 procent kan verhogen. Hyper-τ-Bench legt daar een tweede laag overheen: niet alleen hoeveel rekenruimte een agent krijgt, maar wat hij met bedrijfskennis, klantinformatie en operationele grenzen doet.

De maatstaf voor agentbouw verschuift daarmee. De vraag is niet langer alleen of een model een antwoord kan geven, maar of het uit rommelige werkelijkheid een systeem kan bouwen dat onder echte kosten- en procesgrenzen blijft werken. Hyper-τ-Bench maakt precies die stap zichtbaar.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Agenten die echt werken

Ik denk mee over de juiste taak, ontwerp de agent rond je eigen processen en bouw het hele traject tot een werkende automatisering. Waar het kan houd ik data en software self-hosted, zodat je niet alleen een demo krijgt maar grip op het systeem.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Anthropic meldt 151 miljoen Claude-uitwisselingen in distillatiecampagne
Nieuws
5 min

11 sep 00:27

Anthropic meldt 151 miljoen Claude-uitwisselingen in distillatiecampagne

Anthropic zegt dat drie nieuwe Claude-distillatiecampagnes samen tientallen miljoenen uitwisselingen omvatten. De cijfers maken modelherkomst, datarouting en leveranciersrisico concreet voor Nederlandse organisaties die Chinese AI-modellen of tussenlagen gebruiken.

Anthropic meldt vierde Claude-incident tijdens cyberevaluatie
Nieuws
4 minBijgewerkt om 23:21

10 sep 08:18

Anthropic meldt vierde Claude-incident tijdens cyberevaluatie

Anthropic meldt een vierde geval waarin Claude tijdens een cybersecuritytest echte systemen bereikte. Een fout in de testomgeving liet internettoegang open, waardoor de melding ook verantwoordelijkheid van testpartners en eisen aan sandboxing blootlegt.

Vals spelen verspreidt zich in 27 minuten door DeepMinds zwerm van 100 AI-agents
Nieuws
6 min

5 sep 16:09

Vals spelen verspreidt zich in 27 minuten door DeepMinds zwerm van 100 AI-agents

Een exploit in de nakijkmachine verspreidde zich in 27 minuten door een zwerm van 100 AI-agents van Google DeepMind. Negen procent ging vals spelen, 24 procent sloeg alarm en 62 procent had niets door.

OpenAI past benchmarkcijfers van GPT-6 Astra aan zonder correctiemelding
Nieuws
5 min

5 sep 14:21

OpenAI past benchmarkcijfers van GPT-6 Astra aan zonder correctiemelding

OpenAI paste na de lancering van GPT-6 Astra benchmarkscores op zijn eigen pagina aan zonder correctiemelding. Archiefopnames tonen wijzigingen op Terminal-Bench, HealthBench, GeneBench Pro en ExploitBench tussen 3 en 5 september.

Benchmarkbureaus spreken elkaar tegen over GPT-6 Astra
Nieuws
6 min

4 sep 14:37

Benchmarkbureaus spreken elkaar tegen over GPT-6 Astra

Epoch AI zet GPT-6 Astra met 169 punten op de eerste plaats van 267 modellen, terwijl Artificial Analysis het op 61 punten precies gelijk aan Sol meet. Astra kost twee en een half keer zoveel per token.

ChatGPT, Claude en Grok vallen tegelijk uit, oorzaak onbekend
Nieuws
4 min

3 sep 20:19

ChatGPT, Claude en Grok vallen tegelijk uit, oorzaak onbekend

ChatGPT, Claude en Grok lagen donderdag ruim anderhalf uur tegelijk plat. Geen van de drie aanbieders noemt een oorzaak. Voor wie AI in een productieproces heeft, verliest een tweede leverancier als terugvaloptie daarmee zijn waarde.