Netwerkapparatuur in een rack met blauwe ethernetkabels, met een cloud router switch in beeld
Nieuws18 augustus · 16:205 min leestijd

Snowflake stuurt AI-taken automatisch naar het goedkoopste model dat volstaat

Snowflake kondigt dynamic model routing aan in Cortex AI Gateway: per taak automatisch het goedkoopste model dat de kwaliteit haalt. De functie zit nog niet in private preview en een prijs ontbreekt.

Snowflake kondigt dynamic model routing aan in Cortex AI Gateway, een functie die per taak automatisch het model kiest met de beste balans tussen kwaliteit en kosten.

Voor een Nederlands bedrijf dat zijn AI-rekening ziet oplopen, raakt dat precies de knop waar het aan wil draaien. In de praktijk gaat nu vaak elk verzoek naar hetzelfde zware model, ook een classificatie of een samenvatting van drie regels die een klein model prima afhandelt. De router neemt die keuze over: eenvoudig en repeterend werk naar efficiënte modellen, werk dat echt redeneren vraagt naar frontiermodellen. Wie op Snowflake draait, hoeft dan geen eigen routeringstabel meer bij te houden bij elke nieuwe modelrelease.

Aangekondigd, nog niet aan te zetten

In de voetnoten van het persbericht staat de status die de aankondiging zelf niet uitspreekt. Dynamic model routing gaat binnenkort in private preview en is er dus nog niet. Van de twee nieuwe open modellen zit DeepSeek-V4-Flash 0731 wel al in private preview, terwijl GLM-5.3 nog moet volgen en die toezegging afhangt van de beschikbaarheid van het model. Een prijs noemt Snowflake nergens, en een besparingspercentage evenmin.

Dat laatste telt voor wie hier een businesscase op wil bouwen. Snowflake belooft geen lagere factuur, maar betere intelligence efficiency, een eigen term voor hoe effectief een organisatie rekenkracht, modellen, data en context omzet in zakelijke waarde. Topman Sridhar Ramaswamy schrijft dat voor veel eenvoudige, goed afgebakende taken de beste open modellen sterke prestaties leveren tegen een fractie van de kosten van frontiermodellen.

De cijfers die er wel liggen

Snowflake publiceert drie meetpunten, allemaal uit eigen tests. Agents die met routering een dbt-pipeline bouwden, deden dat met tot drie keer meer tokenefficiëntie dan een pad waarin alleen frontiermodellen werden gebruikt, bij gelijke kwaliteit. Een engineeringteam rondde hetzelfde aantal pull requests af met ongeveer 25 procent minder tokens. In de voetnoot staat dat het om interne tests gaat, dat de methodiek op aanvraag beschikbaar is en dat resultaten per workload verschillen.

Ook de modellen zelf komen met een score. Op ADE-bench, het evaluatieraamwerk dat dbt bouwde voor agents op echte analytics- en data-engineeringtaken, haalde DeepSeek-V4-Flash 74,4 procent op data-engineeringtaken en versloeg daarmee het sterkste gesloten model in die test. GLM-5.2 scoorde lager, maar had van alle geteste modellen het laagste tokenverbruik. Let op wat hier gemeten wordt: tokenefficiëntie, niet euro’s. Minder tokens op een goedkoper model drukt de rekening, maar hoeveel precies hangt af van je eigen mix.

Schema van Snowflake waarin een verzoek van een gebruiker of AI-agent via Cortex AI Gateway loopt, dat de taak beoordeelt en complex redeneerwerk naar frontiermodellen stuurt en simpele of repeterende taken naar efficiënte open modellen. Beeld: Snowflake
Schema van Snowflake waarin een verzoek van een gebruiker of AI-agent via Cortex AI Gateway loopt, dat de taak beoordeelt en complex redeneerwerk naar frontiermodellen stuurt en simpele of repeterende taken naar efficiënte open modellen. Beeld: Snowflake

Wat de beheerder in handen krijgt

De router kiest niet vrij. Hij mag alleen uit modellen die de beheerder heeft goedgekeurd, houdt zich aan de ingestelde dataresidentie en legt elke routeringsbeslissing vast in een logboek. Dat bouwt voort op de poort die Snowflake eind juli aankondigde om te bepalen bij welke modellen, data en tools AI-agents mogen en om uitgavenlimieten af te dwingen, ook voor agents van derden zoals Claude Code en Cursor. Routeren was daar een governancekwestie: alleen naar wat is toegestaan. Nu komt er een kostenmotief bij: naar wat volstaat.

Daaromheen zitten de budgetknoppen. Beheerders kunnen standaardmodellen instellen, verbruik toerekenen aan een team of kostenplaats, quota per gebruiker vastleggen en een melding krijgen als het verbruik richting de limiet loopt. Voor organisaties die met regionale modelbeschikbaarheid of sectorregels te maken hebben, bepaalt diezelfde laag welke aanbieders hun gebruikers überhaupt te zien krijgen.

Snowflake is niet de enige met een router

Nieuw is het idee niet. Microsoft heeft Model Router in AI Foundry en Databricks routeert via zijn Unity AI Gateway, naast onafhankelijke partijen als Vercel en OpenRouter, de routeringsdienst waarover Stripe in gesprek is over een overname voor naar verluidt ongeveer 10 miljard dollar. Analist Sanjeev Mohan van SanjMo zegt tegenover TechTarget dat het routeringsalgoritme dan ook niet het onderscheid maakt, maar de plek: routeren binnen de grens waar de data al onder governance staat, met de uitgaven toegerekend aan het juiste team. Hij noemt Canva als voorbeeld van wat er misgaat zonder die discipline, dat zijn groeiverwachting terugschroefde van 30 naar 20 procent doordat het te zwaar leunde op frontiermodellen die duurder uitvielen dan verwacht.

Dat alle grote leveranciers dit tegelijk bouwen, heeft een reden. Gartner voorspelde deze week dat de inferentiekosten per agentische workflow tot 2028 meer dan vervijfvoudigen terwijl de prijs per token blijft dalen, en noemt werk toewijzen aan het goedkoopste model dat de klus aankan een van de twee manieren om agents rendabel te houden.

Het principe is ouder dan de knop. Coinbase halveerde zijn AI-rekening door Chinese open-weight modellen te combineren met slimme routering, zonder dat daar een productaankondiging aan te pas kwam. Wat nu verschuift is wie dat werk doet: van een routeringstabel die je zelf onderhoudt naar een functie in het platform dat je data al beheert. Dat scheelt engineeringtijd, en het legt de vraag welk model jouw werk doet, en wat dat kost, bij dezelfde leverancier neer. Zolang de functie in preview zit blijft die afweging theoretisch. De regel erachter, het goedkoopste model dat de taak aankan, geldt vandaag al.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Grip op je AI-rekening

Ik denk met je mee over welk werk echt een zwaar model nodig heeft en welk niet, en bouw daarna de routering, de koppelingen en de limieten die daarbij horen. Van ontwerp tot draaiende automatisering, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Microsoft vervangt OpenAI en kroont GPT-5.6 in dezelfde week: je AI-leverancier kiezen is de verkeerde vraag
Inzicht
8 min

11 jul 09:00

Microsoft vervangt OpenAI en kroont GPT-5.6 in dezelfde week: je AI-leverancier kiezen is de verkeerde vraag

In dezelfde week zette Microsoft eigen modellen in Excel om OpenAI-kosten te drukken en maakte het GPT-5.6 voorkeursmodel in Copilot. Geen tegenspraak, maar een strategie: zelfs de grootste inkoper kiest geen AI-leverancier, hij routeert per taak. Waarom welke leverancier de verkeerde vraag is.

Welke motor draait onder je AI-assistent? Waarom de engine je rekening en je afhankelijkheid bepaalt, niet het merk
Inzicht
7 min

27 jun 17:00

Welke motor draait onder je AI-assistent? Waarom de engine je rekening en je afhankelijkheid bepaalt, niet het merk

Op de doos staat Copilot of Claude, maar je rekening en je afhankelijkheid worden een laag dieper bepaald: door de motor eronder. Waarom die engine de echte keuze is, en hoe je hem vergelijkt.

Chinese modellen bezetten OpenRouter-top tien, alleen Anthropic houdt stand voor de VS
Nieuws
4 min

10 jul 20:21

Chinese modellen bezetten OpenRouter-top tien, alleen Anthropic houdt stand voor de VS

Chinese AI-modellen bezetten acht van de tien drukst gebruikte plekken op OpenRouter. OpenAI en Google vielen volledig uit de top tien. Van de Amerikanen houdt alleen Anthropic met Claude nog stand.

Meituan brengt LongCat-2.0 uit: een open codeermodel van 1,6 biljoen parameters, getraind zonder Nvidia
Nieuws
6 min

30 jun 08:32

Meituan brengt LongCat-2.0 uit: een open codeermodel van 1,6 biljoen parameters, getraind zonder Nvidia

Het Chinese Meituan geeft LongCat-2.0 vrij onder de MIT-licentie: een open codeermodel van 1,6 biljoen parameters, volledig getraind op Chinese chips zonder een enkele Nvidia-kaart. Dat verschuift opnieuw de prijs-kwaliteitverhouding.

Coinbase halveert zijn AI-rekening met Chinese modellen en slimme routing
Nieuws
6 min

28 jun 16:26

Coinbase halveert zijn AI-rekening met Chinese modellen en slimme routing

Coinbase bracht zijn AI-kosten bijna omlaag met de helft terwijl het tokenverbruik juist steeg. Topman Brian Armstrong deelt het draaiboek: Chinese open modellen, taakroutering en caching in plaats van budgetlimieten.

SpaceXAI lanceert Grok 4.6 en houdt de tokenprijs gelijk
Nieuws
4 min

12 aug 22:09

SpaceXAI lanceert Grok 4.6 en houdt de tokenprijs gelijk

SpaceXAI brengt Grok 4.6 uit met 61 punten op de Artificial Analysis Intelligence Index, gelijk aan GPT-5.6 Sol, terwijl de tokenprijs op 2 en 6 dollar per miljoen blijft staan.