Microsoft legt zijn eigen engineers een tokenbudget op en maakt het goedkopere GPT-5.6 het standaardmodel voor intern gebruik, blijkt uit een interne e-mail die 404 Media inzag.
Voor een Nederlands ontwikkelteam is dat een lastig signaal om te negeren. Het bedrijf dat AI-capaciteit verkoopt, GitHub Copilot bezit en zelf tot de grootste afnemers van OpenAI hoort, concludeert intern dat ongeremd tokenverbruik geen werkbaar uitgangspunt is. De maatregel is klein genoeg om te kopiëren: een budgetdoel per divisie, inzicht per medewerker in het eigen verbruik, en een goedkoper model als standaard. Er zit ook een ijkpunt in voor wie zijn eigen rekening wil wegen. Volgens Microsofts interne data geven veel engineers tussen de paar honderd en een paar duizend dollar per maand aan tokens uit.
Wat er in de mail staat
De mail komt van Jay Parikh, executive vice president bij Microsoft. "As we accelerate our use of GitHub Copilot to deliver on our goals, we all need to be aware of how we consume tokens", schrijft hij aan het personeel. "Tokenmaxxing is not what we are optimizing for. I want all of us focused on maximizing outcomes that move the needle for our customers and our business." Microsoft beheert tokenverbruik voortaan met dezelfde discipline als elke andere kritieke resource en past daarvoor de interne richtlijnen aan, staat in diezelfde mail.
Die richtlijnen zijn concreter dan de mail zelf. Sinds juli 2026 hebben Microsoft-divisies een "AI token budget target" en kunnen medewerkers hun individuele AI-uitgaven volgen. Een streefbedrag deelt het document niet, en het houdt verdere beperkingen open zodra het verbruik goed in beeld is. Om meer waarde uit dezelfde token-investering te halen wordt OpenAI's GPT-5.6, goedkoper in gebruik dan de zwaardere modellen, intern de standaard.
Geldnood is de aanleiding niet. Microsoft boekte over het afgelopen jaar hogere omzet, een hoger bedrijfsresultaat en een hogere nettowinst dan analisten verwachtten. Een medewerker die anoniem wilde blijven noemde het tegenover 404 Media juist veelzeggend dat een bedrijf dat zoveel AI-inferentie subsidieert zijn eigen mensen tot matiging maant, en vroeg zich hardop af hoe de klanten aan wie het die inferentie verkoopt dat dan moeten opbrengen.

Niet minder tokens, maar meer per token
"We are not optimizing for fewer tokens. We are optimizing for more impact per token", schrijft Parikh. Dat onderscheid is meer dan retoriek. Een budgetdoel per divisie met een teller per medewerker stuurt op de verhouding tussen kosten en uitkomst; een harde limiet per persoon knijpt alleen het verbruik af en raakt het nuttige gebruik even hard als het verspilde. Toen Accenture eerder deze zomer dezelfde bocht nam, ging het wel die kant op: senior medewerkers liepen daar eerst promotie mis als ze de AI-tools links lieten liggen, waarna het concern juist naar afremmen zocht.
De grootste knop die Microsoft omzet is geen gedrag maar modelkeuze. Het bedrijf mat eerder zelf dat een overstap naar Claude Sonnet 5 bij architectuurtaken mediaan twaalf keer meer tokens verbruikte, ondanks een 33 procent lagere prijs per token. Diezelfde rekensom zit achter de keuze om intern op GPT-5.6 te standaardiseren, en achter de eerdere verkenning van een zelf gehoste, bijgestelde DeepSeek V4 als goedkoper alternatief voor de Claude-modellen onder Copilot Cowork.
Waarom de rekening onder Copilot harder aankomt
De maatregel valt samen met een prijsmodel dat Microsoft zelf invoerde. GitHub verving de premium requests door AI Credits, die sinds 1 juni afrekenen op het werkelijke tokenverbruik tegen de gepubliceerde API-tarieven per model. Copilot Business kost 19 dollar per gebruiker per maand met 19 dollar aan credits inbegrepen, Copilot Enterprise 39 dollar met 39 dollar aan credits. Code-aanvullingen blijven gratis, alles boven de bundel is variabel. Na de overstap liepen de kosten bij sommige gebruikers snel op tot tegen hun limiet.
Voor een Nederlands team verandert dat de aard van de post op de begroting. Copilot is geen vast bedrag per zetel meer, maar een rekening die meebeweegt met hoe zwaar je agents draaien en welk model ze daarvoor aanroepen. Dat is precies wat Microsoft nu intern probeert te temmen.
Eén mail, geen bevestiging
Het verhaal rust op één document. 404 Media zag de mail en de bijbehorende richtlijnen in, PCMag en Firstpost schreven het bericht na, en Microsoft reageerde niet op een verzoek om commentaar. Officieel bevestigd is de maatregel dus niet.
Het patroon eromheen staat wel vast. Amazon, Adobe, Atlassian en Citi zetten eerder al de rem op het AI-gebruik van hun personeel; Microsoft is een van de laatste grote bedrijven die volgt, en tegelijk het bedrijf dat de capaciteit levert. Dat maakt de omslag scherper dan bij de anderen. De leverancier van de infrastructuur behandelt tokens nu als een schaarse post met een doelbedrag en een teller per persoon, niet meer als een groeimotor die je vooral niet moet afremmen. De prijs per token daalt al een jaar terwijl de totale rekening stijgt, doordat agenten per taak steeds meer tokens verstoken. Wie dat verschil zelf niet meet, ontdekt het pas als de rekening al binnen is.
Veelgestelde vragen
Grip op je AI-rekening
Een tokenbudget werkt pas als je ziet waar het verbruik heen gaat en welk model welke taak doet. Ik denk mee over die opzet, ontwerp de meting en bouw de koppelingen en automatisering eromheen, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
