AT&T verlaagde de kosten van codeer- en andere geavanceerde AI-taken met tot 56 procent door vragen van medewerkers via een modelrouter naar goedkopere open modellen te sturen, meldt The Information.
Het cijfer dat er voor een Nederlands bedrijf met een oplopende AI-rekening het meest toe doet, is niet die besparing maar de prijs ervan: de kwaliteit van de uitkomsten ging volgens AT&T 2 procent achteruit. Daarmee verschuift de vraag van "kunnen open modellen dit werk aan" naar "welk deel van je verkeer kan verhuizen, en wat lever je daarvoor in". Dat is een inkoopbeslissing geworden, geen technisch experiment.
Wat AT&T meet
De routers komen van LiteLLM en beoordelen hoe zwaar een taak is voordat ze hem doorsturen naar het goedkoopste model dat volstaat. Open modellen verwerken nu ongeveer 40 procent van de vragen van medewerkers. AT&T wil naar 60 tot 70 procent, terwijl de uitgaven aan modellen van Anthropic en OpenAI gelijk blijven. Niet omlaag dus, maar bevroren: de groei in gebruik moet naar de open kant.
Het gaat om Nemotron van Nvidia, Llama van Meta en Gemma van Google. De Chinese modellen van DeepSeek en Moonshot worden wel op risico's onderzocht, maar zijn nog niet in gebruik. Mark Austin, de AT&T-vicepresident die over de AI-tools van medewerkers gaat, schat dat open modellen zes tot tien maanden achterlopen op de frontiermodellen, maar zegt dat ze inmiddels net zo goed of beter zijn dan oudere modellen van Anthropic en OpenAI. Precies daar stuurt de router op: veel werk hoeft niet door het nieuwste model gedaan te worden, alleen door een model dat goed genoeg is.

De schaal eronder
Routeren is bij AT&T geen proef aan de rand van de organisatie. Het concern verbruikt gemiddeld 45 miljard AI-tokens per dag en haalt daar inmiddels ongeveer een kwart van uit open modellen, zei Chief Data and AI Officer Andy Markus op 12 augustus tegen WSJ CIO Journal. Op termijn mikt hij op 70 tot 80 procent van al het AI-gebruik. In bepaalde toepassingen loopt de besparing daarbij op tot 80 of 90 procent, ruim boven de 56 procent bij codeerwerk. Dat verschil is logisch: codeertaken zijn juist het terrein waar de dure modellen hun voorsprong het langst vasthouden.
Markus noemt naast de rekening een tweede motief. Open modellen kunnen op eigen hardware draaien, waardoor bedrijfsgegevens niet door de omgeving van een leverancier hoeven. Voor een organisatie die met klantdata of broncode werkt, telt dat argument los van elke euro besparing.
Wat het draaiboek waard is buiten Texas
De onderdelen zijn niet exotisch. LiteLLM is open source en draait ook op je eigen server, en een router met neutrale modelnamen en een open-weight fallback via Ollama is een kwestie van dagen werk, niet van kwartalen. De schaal van AT&T bepaalt hoeveel euro's het oplevert, niet of het principe werkt.
Het patroon zelf is ook niet nieuw. Coinbase bracht zijn AI-uitgaven bijna met de helft omlaag terwijl het tokenverbruik juist steeg, met dezelfde combinatie van standaard open modellen, routing per taak en caching. Het verschil zit in wie het nu doet. Coinbase is een techbedrijf dat vroeg overstapt. AT&T is een telecomconcern met meer dan duizend interne AI-toepassingen, van juridische ondersteuning tot netwerkbeheer, en met een inkoopafdeling die niets van experimenteren hoeft te hebben.
Voor Anthropic en OpenAI zit de pijn dan ook niet in een opzegging maar in die bevriezing. AT&T stapt niet op, het zet een plafond op wat het bij hen uitgeeft en laat elke extra vraag naar de open kant lopen. Dat is moeilijker te keren dan een vertrek, want er is geen contract om terug te winnen, alleen een router die per vraag opnieuw kiest. En nu de tarieven bij de labs zelf ook zakken en de tokenprijsindex sinds midden juli bijna een kwart lager staat, wint de partij die zijn verkeer meet en kan verleggen twee keer: hij profiteert van elke prijsronde en hoeft er geen enkele af te wachten.
Veelgestelde vragen
Grip op je AI-rekening
Ik kijk met je mee waar je AI-verkeer heen gaat, ontwerp de route eromheen en bouw hem ook, van gateway tot een open model op je eigen server waar dat kan. Van meedenken tot draaiende automatisering, in een traject.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
