Rijen gegevens op verlichte beeldschermen in een controlekamer.
Nieuws21 augustus · 04:094 min leestijd

AT&T verlaagt kosten van AI-taken met 56 procent via open modellen

AT&T stuurt vragen van medewerkers via een LiteLLM-router naar open modellen en verlaagde de kosten van codeer- en andere AI-taken met tot 56 procent, bij 2 procent kwaliteitsverlies. De uitgaven aan Anthropic en OpenAI blijven bevroren.

AT&T verlaagde de kosten van codeer- en andere geavanceerde AI-taken met tot 56 procent door vragen van medewerkers via een modelrouter naar goedkopere open modellen te sturen, meldt The Information.

Het cijfer dat er voor een Nederlands bedrijf met een oplopende AI-rekening het meest toe doet, is niet die besparing maar de prijs ervan: de kwaliteit van de uitkomsten ging volgens AT&T 2 procent achteruit. Daarmee verschuift de vraag van "kunnen open modellen dit werk aan" naar "welk deel van je verkeer kan verhuizen, en wat lever je daarvoor in". Dat is een inkoopbeslissing geworden, geen technisch experiment.

Wat AT&T meet

De routers komen van LiteLLM en beoordelen hoe zwaar een taak is voordat ze hem doorsturen naar het goedkoopste model dat volstaat. Open modellen verwerken nu ongeveer 40 procent van de vragen van medewerkers. AT&T wil naar 60 tot 70 procent, terwijl de uitgaven aan modellen van Anthropic en OpenAI gelijk blijven. Niet omlaag dus, maar bevroren: de groei in gebruik moet naar de open kant.

Het gaat om Nemotron van Nvidia, Llama van Meta en Gemma van Google. De Chinese modellen van DeepSeek en Moonshot worden wel op risico's onderzocht, maar zijn nog niet in gebruik. Mark Austin, de AT&T-vicepresident die over de AI-tools van medewerkers gaat, schat dat open modellen zes tot tien maanden achterlopen op de frontiermodellen, maar zegt dat ze inmiddels net zo goed of beter zijn dan oudere modellen van Anthropic en OpenAI. Precies daar stuurt de router op: veel werk hoeft niet door het nieuwste model gedaan te worden, alleen door een model dat goed genoeg is.

Het hoofdkantoor van AT&T in Dallas met het bedrijfslogo op de gevel. Bron: FoUTASportscaster / Wikimedia Commons (Public domain)
Het hoofdkantoor van AT&T in Dallas met het bedrijfslogo op de gevel. Bron: FoUTASportscaster / Wikimedia Commons (Public domain)

De schaal eronder

Routeren is bij AT&T geen proef aan de rand van de organisatie. Het concern verbruikt gemiddeld 45 miljard AI-tokens per dag en haalt daar inmiddels ongeveer een kwart van uit open modellen, zei Chief Data and AI Officer Andy Markus op 12 augustus tegen WSJ CIO Journal. Op termijn mikt hij op 70 tot 80 procent van al het AI-gebruik. In bepaalde toepassingen loopt de besparing daarbij op tot 80 of 90 procent, ruim boven de 56 procent bij codeerwerk. Dat verschil is logisch: codeertaken zijn juist het terrein waar de dure modellen hun voorsprong het langst vasthouden.

Markus noemt naast de rekening een tweede motief. Open modellen kunnen op eigen hardware draaien, waardoor bedrijfsgegevens niet door de omgeving van een leverancier hoeven. Voor een organisatie die met klantdata of broncode werkt, telt dat argument los van elke euro besparing.

Wat het draaiboek waard is buiten Texas

De onderdelen zijn niet exotisch. LiteLLM is open source en draait ook op je eigen server, en een router met neutrale modelnamen en een open-weight fallback via Ollama is een kwestie van dagen werk, niet van kwartalen. De schaal van AT&T bepaalt hoeveel euro's het oplevert, niet of het principe werkt.

Het patroon zelf is ook niet nieuw. Coinbase bracht zijn AI-uitgaven bijna met de helft omlaag terwijl het tokenverbruik juist steeg, met dezelfde combinatie van standaard open modellen, routing per taak en caching. Het verschil zit in wie het nu doet. Coinbase is een techbedrijf dat vroeg overstapt. AT&T is een telecomconcern met meer dan duizend interne AI-toepassingen, van juridische ondersteuning tot netwerkbeheer, en met een inkoopafdeling die niets van experimenteren hoeft te hebben.

Voor Anthropic en OpenAI zit de pijn dan ook niet in een opzegging maar in die bevriezing. AT&T stapt niet op, het zet een plafond op wat het bij hen uitgeeft en laat elke extra vraag naar de open kant lopen. Dat is moeilijker te keren dan een vertrek, want er is geen contract om terug te winnen, alleen een router die per vraag opnieuw kiest. En nu de tarieven bij de labs zelf ook zakken en de tokenprijsindex sinds midden juli bijna een kwart lager staat, wint de partij die zijn verkeer meet en kan verleggen twee keer: hij profiteert van elke prijsronde en hoeft er geen enkele af te wachten.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Grip op je AI-rekening

Ik kijk met je mee waar je AI-verkeer heen gaat, ontwerp de route eromheen en bouw hem ook, van gateway tot een open model op je eigen server waar dat kan. Van meedenken tot draaiende automatisering, in een traject.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Nvidia werkt aan open Nemotron 4 met minstens een biljoen parameters
Nieuws
4 min

12 aug 02:22

Nvidia werkt aan open Nemotron 4 met minstens een biljoen parameters

Nvidia werkt volgens The Information aan Nemotron 4, een open model van minstens een biljoen parameters. Er is geen releasedatum en Nvidia bevestigt de details niet, maar de hardwaredrempel om zelf te draaien groeit wel mee.

Open-weight-brief aan Washington verdubbelt naar 50 ondertekenaars
Nieuws
4 min

26 jul 16:09

Open-weight-brief aan Washington verdubbelt naar 50 ondertekenaars

De open-weight-brief aan Washington telt nu 50 ondertekenaars, dubbel zoveel als bij publicatie. Google staat er alsnog op. Alleen Anthropic, Amazon en xAI blijven weg, en dat verschuift het politieke risico voor open modellen.

OpenAI tekent alsnog de open-weight-brief, Anthropic en Google blijven weg
Nieuws
4 min

25 jul 10:15

OpenAI tekent alsnog de open-weight-brief, Anthropic en Google blijven weg

OpenAI staat sinds vrijdagavond alsnog op de open-weight-brief aan Washington, die inmiddels 35 ondertekenaars telt. Anthropic en Google blijven als enige grote frontier-aanbieders buiten de coalitie die pleit tegen beperkingen op open modellen.

Andrew Ng lanceert OpenWorker: open-source AI-collega die lokaal draait
Nieuws
4 min

24 jul 06:10

Andrew Ng lanceert OpenWorker: open-source AI-collega die lokaal draait

AI-onderzoeker Andrew Ng bracht OpenWorker uit, een gratis en open-source AI-collega die volledig op je eigen computer draait, elk model gebruikt en afgerond werk oplevert in plaats van een chatgesprek. Zonder abonnement of vendor lock-in.

Google bouwt inference-chip Frozen v2 die Gemini in silicium bakt
Nieuws
4

20 jul 18:11

Google bouwt inference-chip Frozen v2 die Gemini in silicium bakt

Google werkt aan Frozen v2, een inference-chip die delen van Gemini in het silicium legt en per token zes tot tien keer zuiniger zou zijn dan zijn huidige AI-chips. Wat dat betekent voor wie AI op Google Cloud draait.

Open-weight ontwijkt de Amerikaanse lock-in en belandt in Beijing
Inzicht
6 min

18 jul 17:00

Open-weight ontwijkt de Amerikaanse lock-in en belandt in Beijing

Bedrijven kiezen open-weight modellen om onder de Amerikaanse AI-lock-in uit te komen. Maar de sterkste open modellen komen nu uit Chinese labs. Zo ruil je één afhankelijkheid in voor een jurisdictierisico, tenzij je echt zelf host.