Beursgrafiek met bewegende koerslijn op een laptopscherm
Nieuws6 juli · 18:115 min leestijd

Microsoft meet: Claude Sonnet 5 kan tokenverbruik tot 12x opdrijven

Microsoft testte 150 agenttaken en zag Claude Sonnet 5 bij architectuurwerk mediaan 12 keer meer tokens verbruiken dan Sonnet 4.6, met een uitschieter van 69 miljoen. Goedkopere tokens, hogere rekening: stuur op kosten per taak.

Microsoft heeft in een eigen enterprise-test gemeten dat een overstap naar Claude Sonnet 5 het tokenverbruik bij architectuurtaken mediaan 12 keer opdrijft, ondanks een 33 procent lagere prijs per token. In een enkel scenario slokte een run zelfs 47 keer het gebruikelijke volume op, met een uitschieter van 69 miljoen tokens.

Voor iedereen die een AI-budget beheert is dat een scherpe waarschuwing: de prijslijst zegt weinig. Je rekening is het tarief maal het aantal tokens, en een model dat per token goedkoper is kan per taak juist flink duurder uitpakken. Bij Microsofts code-upgradetaken kostte Sonnet 5 gemiddeld $2,01 per run tegen $0,55 voor de vorige versie, 3,7 keer zoveel. Op de architectuurtaken viel het juist 12 procent goedkoper uit. Welke kant jouw werk op gaat, weet je pas als je het meet.

Goedkopere tokens, hogere rekening

Op de tarievenkaart wint Sonnet 5 op elke regel. De inputprijs zakte van $3 naar $2 per miljoen tokens, de outputprijs van $15 naar $10, over de hele linie 33 procent lager. Maar tarieven bepalen je rekening niet, het verbruik doet dat.

Microsoft draaide 150 agenttaken over 15 scenario's op twee modellen, Sonnet 4.6 en Sonnet 5, via GitHub Copilot in Visual Studio Code. Bij de 12 architectuurscenario's, 60 runs per model, lag het mediane tokenverbruik van Sonnet 5 twaalf keer hoger. Bij de drie code-upgradescenario's tien keer. Een korting van 33 procent overleeft zo'n stijging niet.

Wat dat in euro's doet, hangt af van de taak. Op de code-upgrades werd de goedkopere Sonnet 5 in de praktijk 3,7 keer zo duur, terwijl hij op de architectuurtaken 12 procent voordeliger uitkwam omdat de tokenstijging daar mild genoeg bleef om de korting te laten winnen.

Gemiddelde kosten per run in Microsofts test, per taaktype (bron: Microsoft)

Meer tokens, niet per se beter werk

Het hogere verbruik leverde niet automatisch beter werk op. Op de architectuurtaken haalden beide modellen dezelfde voltooiingsscore van 75 procent, maar op de kwaliteitsmaat scoorde de oudere Sonnet 4.6 90 procent tegen 78 procent voor Sonnet 5. In 8 van de 9 vergelijkbare scenario's was het oudere model gelijk of beter. Bij het ontwerp van een IoT-analyse-architectuur haalde Sonnet 4.6 de kwaliteitscheck in 4 van de 5 runs, Sonnet 5 in slechts 1.

Bij de code-upgrades draaide het beeld om. Waar Sonnet 4.6 een gevraagde SharePoint-versie in alle vijf runs verkeerd installeerde, volgde Sonnet 5 de instructie elke keer exact en passeerde het de eerste kwaliteitspoort in 100 procent van de runs, tegen 60 procent voor de voorganger. Eén run groef zich met 69 miljoen tokens door ongedocumenteerde migratiestappen heen, maar dat bleek niet reproduceerbaar: de vier andere runs in datzelfde scenario haalden die diepte niet.

Onvoorspelbaarheid als kostenpost

Het echte risico zit in de spreiding. Sonnet 4.6 bleef bij eenvoudige architectuurtaken netjes tussen 14.000 en 45.000 tokens per run, wat begroten simpel maakt. Sonnet 5 schoot alle kanten op: in hetzelfde IoT-scenario verbruikte de ene run 6,6 miljoen tokens en de andere 16.000. Eén uitschieter kan meer kosten dan een hele batch runs op het oude model, en bij Sonnet 5 was zo'n uitschieter eerder regel dan uitzondering.

Er was ook een harde bovengrens die geen van beide modellen doorbrak. Op de structurele toolchain-migraties was de configuratie in 100 procent van de gevallen fout, omdat de benodigde stappen nergens gedocumenteerd staan. Microsoft telde zeven concrete bestands- en configuratiewijzigingen die geen model zelf kon vinden. Een nieuwer model repareert geen gat in de brondocumentatie.

Wat dit verschuift

De les is niet dat het ene model beter of slechter is, maar dat een modelupgrade een hypothese is, geen zekerheid. AI-vaardigheid is een grillige grens: taken die even moeilijk lijken vallen aan verschillende kanten van wat een model aankan. Onafhankelijke metingen lieten eerder al zien dat Sonnet 5 rond 40 procent meer outputtokens per taak verbruikt; Microsofts praktijkcijfers liggen daar ver boven en laten zien hoe sterk het per taaktype verschilt.

Voor een Nederlands bedrijf dat agentische AI inzet, verandert daarmee de manier van inkopen. Niet de prijs per token op de offerte telt, maar de gemeten kosten per taak op je eigen werk, en de spreiding daaromheen. Wie de AI-rekening van zulke agenten in toom wil houden, meet het verbruik voor en na een modelwissel op de echte workload voordat een upgrade organisatiebreed live gaat.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI-kosten die niet ontsporen

Ik denk met je mee over welke modellen en agenten passen bij jouw werk, ontwerp de opzet en bouw hem end-to-end, self-hosted waar dat kan, zodat je op kosten per taak stuurt in plaats van op een prijslijst.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Microsoft zet MAI-Code-1.1-Flash in GitHub Copilot, 73 procent goedkoper dan zijn voorganger
Nieuws
4 min

12 aug 08:22

Microsoft zet MAI-Code-1.1-Flash in GitHub Copilot, 73 procent goedkoper dan zijn voorganger

Microsoft zet MAI-Code-1.1-Flash in GitHub Copilot, met een listprijs die 73 procent onder die van zijn voorganger ligt. Wat het model kost, wat het kan, en waarom het bij Business en Enterprise standaard uit staat.

Kimi K2.7 Code nu kiesbaar in GitHub Copilot: eerste open-weight model in de modelkeuze
Nieuws
6 min

3 jul 04:10

Kimi K2.7 Code nu kiesbaar in GitHub Copilot: eerste open-weight model in de modelkeuze

GitHub heeft Kimi K2.7 Code algemeen beschikbaar gemaakt in de Copilot-modelkeuze. Het is het eerste open-weight model in de picker, fors goedkoper dan de frontier-modellen, en je devteam kan vandaag overstappen zonder tooling te wijzigen.

GitHub Copilot krijgt modelroutering tussen pc en cloud
Nieuws
5 min

8 okt 06:15

GitHub Copilot krijgt modelroutering tussen pc en cloud

GitHub Copilot gaat taken automatisch lokaal of in de cloud verwerken. De keuze raakt de datastroom van broncode, het geheugen dat modellen vragen en de rechten waarmee agenten tools uitvoeren.

OpenAI verlaagt API-prijzen voor GPT-6 Sol en Luna
Nieuws
4 min

22 sep 22:12

OpenAI verlaagt API-prijzen voor GPT-6 Sol en Luna

OpenAI brengt GPT-6 Sol en Luna uit met lagere API-tarieven: 2 en 10 dollar voor Sol, 0,10 en 0,50 dollar voor Luna per miljoen tokens. Voor Nederlandse teams wordt modelkeuze per taak belangrijker.

Microsoft kondigt Project Zenith aan voor pc's die 30B-modellen lokaal draaien
Nieuws
4 min

4 sep 20:22

Microsoft kondigt Project Zenith aan voor pc's die 30B-modellen lokaal draaien

Microsoft kondigt Project Zenith aan, een vooraf ingerichte Windows 11-opzet voor ontwikkelmachines met 64 GB geheugen en 250 GB/s bandbreedte. Modellen van 30 miljard parameters draaien er lokaal, en dat verschuift de AI-rekening van tokens naar hardware.

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code
Nieuws
4 min

7 aug 12:24

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code

Amazon, Cursor, Microsoft, OpenAI en Vercel publiceerden een open pakketformaat voor Agent Skills en MCP-servers. Google sluit aan als core maintainer. Je bouwt een agentuitbreiding voortaan een keer, niet per client.