Softwareontwikkelaar werkt aan code op een laptop in een technische werkplek
Nieuws9 september · 04:304 min leestijd

Sierra maakt agentbouw meetbaar met Hyper-τ-Bench

Sierra maakt met Hyper-τ-Bench zichtbaar of coding-agents echt klantagenten kunnen bouwen. De beste configuratie haalt 23,9 procent, tegenover 82,2 procent voor een expertreferentie op dezelfde evaluaties.

Hyper-τ-Bench maakt agentbouw meetbaar: Sierra stelt op 8 september een open benchmark beschikbaar waarin coding-agents een klantagent bouwen en die op afgeschermde klanttaken laten presteren.

Voor een Nederlandse ondernemer verandert daarmee de toets voor een klantagent. Het gaat niet alleen om code of een goed antwoord, maar om requirements uit bedrijfsdocumenten halen, een klant ondervragen, bestaande systemen via een API bedienen en binnen een kostenlimiet betrouwbare gesprekken voeren.

Een echte klantopdracht in een sandbox

De developer-agent krijgt de documenten en gegevens die een bedrijf in de praktijk bij elkaar heeft: handboeken, supportgesprekken, spreadsheets, screenshots, opnames en een client-API. Een gesimuleerde klant kan aanvullende eisen kennen. De agent moet die informatie verzamelen, een architectuur kiezen en een uitvoerbare klantservice-agent opleveren.

Daarna draait die gebouwde agent tegen gesimuleerde klanten op verborgen taken. Het modelmenu en het budget per gesprek liggen vast. Ook kan de API van de klant subtiele fouten bevatten. De benchmark test zo het hele traject van specificatie naar werkend systeem, niet alleen de kwaliteit van één antwoord.

Schema van Hyper-τ-Bench met bedrijfsbewijs, agentbouw in een sandbox en evaluatie via gesimuleerde klanten. Bron: Sierra Research en arXiv, CC BY 4.0
Schema van Hyper-τ-Bench met bedrijfsbewijs, agentbouw in een sandbox en evaluatie via gesimuleerde klanten. Bron: Sierra Research en arXiv, CC BY 4.0

De openbare repo bevat 53 taken in vier domeinen: luchtvaart, retail, telecom en bankieren. Sierra publiceert de code onder de MIT-licentie, zodat teams de opzet kunnen bestuderen en zelf draaien.

De scorekloof is geen modelranglijst

De resultaten zijn hard. Over die 53 taken haalt de beste geautomatiseerde combinatie, Claude Opus 5 met Claude Code, 23,9 procent. Een expertreferentie, waarbij een engineer met diepe context samenwerkt met een frontier-model, haalt 82,2 procent op dezelfde evaluaties.

Die vergelijking is geen losse modeltest. De score omvat ook hoe goed de developer requirements vindt, een architectuur kiest, API-fouten opvangt, het budget beheert en eigen tests bouwt. Sierra zag op bankingtaken dat agents minder dan 80 van ongeveer 1.700 bestanden openden. Ze stelden hooguit vier vragen terwijl de gesimuleerde klant voor 20 tot 25 requirements de enige bron was. In 92 procent van de builds bleef de architectuur één enkele LLM-tool-lus.

Voor een bedrijf maakt dat onderscheid zichtbaar wat in een offerte snel vervaagt: een model kan een taak uitvoeren, terwijl het bouwproces nog geen betrouwbare agent oplevert. De relevante bewijzen liggen naast antwoordkwaliteit: welke bronnen zijn gelezen, welke eisen zijn uit de klant gehaald, hoe zit de API-adapter in elkaar, wat kost een gesprek en hoe presteert de agent op ongeziene gevallen.

Ook het rekenbudget hoort bij de score. Een eerdere AISI-meting liet zien dat een tienvoudig tokenbudget het slagingspercentage op softwaretaken ongeveer 25 procent kan verhogen. Hyper-τ-Bench legt daar een tweede laag overheen: niet alleen hoeveel rekenruimte een agent krijgt, maar wat hij met bedrijfskennis, klantinformatie en operationele grenzen doet.

De maatstaf voor agentbouw verschuift daarmee. De vraag is niet langer alleen of een model een antwoord kan geven, maar of het uit rommelige werkelijkheid een systeem kan bouwen dat onder echte kosten- en procesgrenzen blijft werken. Hyper-τ-Bench maakt precies die stap zichtbaar.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Agenten die echt werken

Ik denk mee over de juiste taak, ontwerp de agent rond je eigen processen en bouw het hele traject tot een werkende automatisering. Waar het kan houd ik data en software self-hosted, zodat je niet alleen een demo krijgt maar grip op het systeem.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Anthropic zet live internet uit bij interne evaluaties
Nieuws
5 min

10 okt 04:13

Anthropic zet live internet uit bij interne evaluaties

Anthropic zet live internettoegang uit bij alle interne evaluaties, nadat Claude tijdens tests echte websites en systemen bereikte. De maatregel verandert de proefopstelling, maar kondigt geen algemene productstop voor klanten aan.

Claude Haiku 5.5 krijgt een contextvenster van 1 miljoen tokens
Nieuws
4 min

8 okt 04:27

Claude Haiku 5.5 krijgt een contextvenster van 1 miljoen tokens

Anthropic vergroot Haiku 5.5 van 200.000 naar 1 miljoen contexttokens. Grotere dossiers passen daardoor in één verzoek, maar langere prompts raken eerder de hogere prijsgrens en de uitkomst blijft afhankelijk van de taak.

Anthropic stelt veiligheidsvoorwaarden aan Claude op machines
Nieuws
4 min

8 okt 22:33

Anthropic stelt veiligheidsvoorwaarden aan Claude op machines

Vanaf 12 november moeten Claude-gebruikers bij risicovolle fysieke toepassingen zorgen voor een operator die kan ingrijpen, apparatuur die veilig blijft bij verbindingsverlies en grenzen die onafhankelijk van het model werken.

Anthropic lanceert Haiku 5.5 met 90% lagere korte-prompttarieven
Nieuws
4 min

7 okt 22:29

Anthropic lanceert Haiku 5.5 met 90% lagere korte-prompttarieven

Anthropic brengt Claude Haiku 5.5 uit met 90 procent lagere API-tarieven voor prompts tot 100.000 tokens. De gemiddelde taakkosten dalen volgens het bedrijf met 75 procent, al telt de nieuwe tokenizer meer tokens.

Anthropic breidt Claude-cybertoegang uit met drie niveaus
Nieuws
4 min

7 okt 00:09

Anthropic breidt Claude-cybertoegang uit met drie niveaus

Anthropic geeft securityteams drie toegangsniveaus voor Claude-cybermodellen. Elk niveau biedt dezelfde modelreeks, maar verschilt in toegestane taken, verificatie, beveiliging en gegevensbewaring voor teams die kwetsbaarheden onderzoeken of systemen testen.

Anthropic lanceert Claude Opus 5.5 met lagere taakkosten
Nieuws
3 min

22 sep 20:15

Anthropic lanceert Claude Opus 5.5 met lagere taakkosten

Anthropic brengt Claude Opus 5.5 uit met 20 procent lagere input- en outputtarieven en volgens het bedrijf 40 procent lagere kosten per typische taak. Het verschil zit in tokens, niet alleen in de prijslijst.