4 min
9 sep 04:30
Sierra maakt agentbouw meetbaar met Hyper-τ-Bench
Sierra maakt met Hyper-τ-Bench zichtbaar of coding-agents echt klantagenten kunnen bouwen. De beste configuratie haalt 23,9 procent, tegenover 82,2 procent voor een expertreferentie op dezelfde evaluaties.