Snowflake kondigt dynamic model routing aan in Cortex AI Gateway, een functie die per taak automatisch het model kiest met de beste balans tussen kwaliteit en kosten.
Voor een Nederlands bedrijf dat zijn AI-rekening ziet oplopen, raakt dat precies de knop waar het aan wil draaien. In de praktijk gaat nu vaak elk verzoek naar hetzelfde zware model, ook een classificatie of een samenvatting van drie regels die een klein model prima afhandelt. De router neemt die keuze over: eenvoudig en repeterend werk naar efficiënte modellen, werk dat echt redeneren vraagt naar frontiermodellen. Wie op Snowflake draait, hoeft dan geen eigen routeringstabel meer bij te houden bij elke nieuwe modelrelease.
Aangekondigd, nog niet aan te zetten
In de voetnoten van het persbericht staat de status die de aankondiging zelf niet uitspreekt. Dynamic model routing gaat binnenkort in private preview en is er dus nog niet. Van de twee nieuwe open modellen zit DeepSeek-V4-Flash 0731 wel al in private preview, terwijl GLM-5.3 nog moet volgen en die toezegging afhangt van de beschikbaarheid van het model. Een prijs noemt Snowflake nergens, en een besparingspercentage evenmin.
Dat laatste telt voor wie hier een businesscase op wil bouwen. Snowflake belooft geen lagere factuur, maar betere intelligence efficiency, een eigen term voor hoe effectief een organisatie rekenkracht, modellen, data en context omzet in zakelijke waarde. Topman Sridhar Ramaswamy schrijft dat voor veel eenvoudige, goed afgebakende taken de beste open modellen sterke prestaties leveren tegen een fractie van de kosten van frontiermodellen.
De cijfers die er wel liggen
Snowflake publiceert drie meetpunten, allemaal uit eigen tests. Agents die met routering een dbt-pipeline bouwden, deden dat met tot drie keer meer tokenefficiëntie dan een pad waarin alleen frontiermodellen werden gebruikt, bij gelijke kwaliteit. Een engineeringteam rondde hetzelfde aantal pull requests af met ongeveer 25 procent minder tokens. In de voetnoot staat dat het om interne tests gaat, dat de methodiek op aanvraag beschikbaar is en dat resultaten per workload verschillen.
Ook de modellen zelf komen met een score. Op ADE-bench, het evaluatieraamwerk dat dbt bouwde voor agents op echte analytics- en data-engineeringtaken, haalde DeepSeek-V4-Flash 74,4 procent op data-engineeringtaken en versloeg daarmee het sterkste gesloten model in die test. GLM-5.2 scoorde lager, maar had van alle geteste modellen het laagste tokenverbruik. Let op wat hier gemeten wordt: tokenefficiëntie, niet euro’s. Minder tokens op een goedkoper model drukt de rekening, maar hoeveel precies hangt af van je eigen mix.

Wat de beheerder in handen krijgt
De router kiest niet vrij. Hij mag alleen uit modellen die de beheerder heeft goedgekeurd, houdt zich aan de ingestelde dataresidentie en legt elke routeringsbeslissing vast in een logboek. Dat bouwt voort op de poort die Snowflake eind juli aankondigde om te bepalen bij welke modellen, data en tools AI-agents mogen en om uitgavenlimieten af te dwingen, ook voor agents van derden zoals Claude Code en Cursor. Routeren was daar een governancekwestie: alleen naar wat is toegestaan. Nu komt er een kostenmotief bij: naar wat volstaat.
Daaromheen zitten de budgetknoppen. Beheerders kunnen standaardmodellen instellen, verbruik toerekenen aan een team of kostenplaats, quota per gebruiker vastleggen en een melding krijgen als het verbruik richting de limiet loopt. Voor organisaties die met regionale modelbeschikbaarheid of sectorregels te maken hebben, bepaalt diezelfde laag welke aanbieders hun gebruikers überhaupt te zien krijgen.
Snowflake is niet de enige met een router
Nieuw is het idee niet. Microsoft heeft Model Router in AI Foundry en Databricks routeert via zijn Unity AI Gateway, naast onafhankelijke partijen als Vercel en OpenRouter, de routeringsdienst waarover Stripe in gesprek is over een overname voor naar verluidt ongeveer 10 miljard dollar. Analist Sanjeev Mohan van SanjMo zegt tegenover TechTarget dat het routeringsalgoritme dan ook niet het onderscheid maakt, maar de plek: routeren binnen de grens waar de data al onder governance staat, met de uitgaven toegerekend aan het juiste team. Hij noemt Canva als voorbeeld van wat er misgaat zonder die discipline, dat zijn groeiverwachting terugschroefde van 30 naar 20 procent doordat het te zwaar leunde op frontiermodellen die duurder uitvielen dan verwacht.
Dat alle grote leveranciers dit tegelijk bouwen, heeft een reden. Gartner voorspelde deze week dat de inferentiekosten per agentische workflow tot 2028 meer dan vervijfvoudigen terwijl de prijs per token blijft dalen, en noemt werk toewijzen aan het goedkoopste model dat de klus aankan een van de twee manieren om agents rendabel te houden.
Het principe is ouder dan de knop. Coinbase halveerde zijn AI-rekening door Chinese open-weight modellen te combineren met slimme routering, zonder dat daar een productaankondiging aan te pas kwam. Wat nu verschuift is wie dat werk doet: van een routeringstabel die je zelf onderhoudt naar een functie in het platform dat je data al beheert. Dat scheelt engineeringtijd, en het legt de vraag welk model jouw werk doet, en wat dat kost, bij dezelfde leverancier neer. Zolang de functie in preview zit blijft die afweging theoretisch. De regel erachter, het goedkoopste model dat de taak aankan, geldt vandaag al.
Veelgestelde vragen
Grip op je AI-rekening
Ik denk met je mee over welk werk echt een zwaar model nodig heeft en welk niet, en bouw daarna de routering, de koppelingen en de limieten die daarbij horen. Van ontwerp tot draaiende automatisering, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
