Ramp lanceert Router.com, een API die elk AI-verzoek naar het goedkoopste model stuurt dat de taak nog aankan en klanten daarmee gemiddeld 40 procent op hun inferentiekosten scheelt. De dienst is voorlopig alleen in de Verenigde Staten af te nemen.
Die laatste zin bepaalt wat een Nederlandse inkoper er vandaag mee kan. Router.com staat open voor ontwikkelaars en teams in de VS, andere landen volgen "binnenkort", en de modellen erachter draaien allemaal op Amerikaanse infrastructuur. Aanzetten vanuit Rotterdam of Eindhoven kan dus niet. Wat wel overdraagbaar is, is de rekensom eronder. Volgens de eigen Ramp AI Index zijn de AI-uitgaven van bedrijven sinds juni 2025 met een factor 20,7 gestegen, en routeren is zowat de enige knop waarmee je die post omlaag krijgt zonder functionaliteit te schrappen.
Eén sleutel, ruim vijftig modellen
Router.com zet één endpoint voor modellen van OpenAI, Anthropic, xAI, DeepSeek, Kimi, GLM, MiniMax, Qwen en Nvidia. Dat endpoint spreekt de Responses-API van OpenAI, zodat bestaande code met een gewijzigde basis-URL blijft werken. Je applicatie houdt één sleutel, de sleutels van de aanbieders blijven bij Ramp. Valt een provider uit of loop je tegen een limiet aan, dan schuift het verzoek door naar een ander model uit je lijst. Ondersteuning voor Google, AWS, Together AI, Baseten en Crusoe staat als "binnenkort" op de site.
De besparing komt uit vier strategieën. De eerste, cost-efficient routing, staat standaard aan en verschuift geschikte verzoeken naar de goedkopere Flex-capaciteit van hetzelfde model wanneer dat de kwaliteit naar verwachting niet raakt; je betaalt dat met hogere en minder voorspelbare wachttijd. Verder kun je routeren op benchmarkscore, prompt-caching aanzetten en met Shadow Mode een deel van je echte productieverkeer stiekem laten meelopen op één tot drie alternatieve modellen om te zien wat die zouden hebben gekost.
De cijfers, en hun kleine lettertjes
Ramp zegt bij zichzelf ongeveer 30 procent van de inferentiekosten te hebben geschrapt bij gelijke output; de 40 procent is het gemiddelde dat klanten melden. Het bedrijf claimt verder ruim 99,9 procent betrouwbaarheid op productieverkeer. CTO Rahul Sengottuvelu noemt AI de snelst groeiende kostenpost bij de meeste bedrijven, en tegelijk de post die ze het slechtst kunnen meten. Router.com is drie jaar intern gebouwd voordat het naar buiten ging.
Waar die percentages vandaan komen, wordt zichtbaar in de prijslijst zelf. Het goedkoopste model in de catalogus, DeepSeek V4 Flash, kost 0,14 dollar per miljoen invoertokens en 0,28 dollar per miljoen uitvoertokens; het duurste, GPT-5.5 Pro, rekent 30 en 180 dollar. Zelfs binnen één modelfamilie loopt het hard uiteen: GPT-5.6 Luna kost 0,20 dollar aan invoer, GPT-5.6 Sol 5 dollar. Wie alles naar het zwaarste model stuurt, betaalt een veelvoud voor het routinewerk: classificeren, labelen, korte samenvattingen.

Routeren is gratis tot en met 2026 en nieuwe gebruikers krijgen 26 dollar aan modeltegoed. De tokens zelf betaal je tegen listprijs. Wat de dienst daarna kost, is niet bekendgemaakt, en enterprise-functies zijn er nog niet.
De VS-grens en wat er met je data gebeurt
Ook als Router.com hier straks wel te koop is, blijft er een beslissing over. In de privacyverklaring van 19 augustus 2026 staat dat Ramp voor deze dienst optreedt als verwerkingsverantwoordelijke, niet als verwerker, tenzij de voorwaarden anders bepalen. Dat is een wezenlijk andere rolverdeling dan een Nederlandse organisatie gewend is bij een leverancier die alleen verkeer doorgeeft. Invoer, uitvoer en tool-aanroepen worden standaard een jaar bewaard tenzij je opslag uitzet. Doe je dat, dan blijft gemarkeerde content nog dertig dagen staan voor onderzoek, en een instelling aan de kant van Ramp garandeert niet dat de modelaanbieder erachter ook niets bewaart.
Daar zit meteen een ruil in die je niet ziet in de marketing: Shadow Mode werkt alleen als contentopslag aan staat en is niet beschikbaar op sleutels met je eigen provider-credentials. De functie die je het scherpst laat zien welk goedkoper model jouw werk aankan, is precies de functie die je uitzet zodra je de strengste dataregels hanteert. Voor doorgifte vanuit de EER leunt Ramp op standaardcontractbepalingen en het EU-VS Data Privacy Framework, terwijl Mistral 10 procent toeslag rekent om verzoeken volledig binnen de EU te verwerken. Dat prijsverschil is de eigenlijke keuze.
Derde routeringszet in vier dagen
Router.com verscheen op dezelfde dag dat Stripe de overname van OpenRouter bevestigde, de dienst die naar eigen zeggen ruim 10 biljoen tokens per dag over 400 modellen van meer dan 80 aanbieders verwerkt. Een dag eerder kondigde Snowflake dynamic model routing aan in zijn Cortex AI Gateway, dat per taak het goedkoopste passende model kiest maar nog in private preview zit. Naast OpenRouters 400 modellen is de catalogus van Router.com met ruim vijftig namen bescheiden, maar de doelgroep is dan ook een andere: bedrijven die hun AI-factuur willen zien en beheersen, niet ontwikkelaars die elk exotisch model willen proberen.
Het patroon eronder is ouder dan de knop. Coinbase bracht zijn AI-rekening bijna tot de helft terug met Chinese open-weight modellen en een eigen routerings- en cachesysteem, zonder dat daar een product bij te pas kwam. Wat nu verschuift, is wie dat werk doet. Binnen een week is de routeringslaag van een zelfgebouwd stuk plumbing veranderd in een dienst die een betaalbedrijf, een dataplatform en een expense-leverancier alle drie in de etalage zetten. Zolang Router.com de grens niet over is, is het bruikbare deel voor een Nederlands bedrijf de meetlat, niet het product: weten welk aandeel van je tokens naar een model gaat dat zwaarder en duurder is dan de taak vraagt. Die vraag beantwoorden kost geen Amerikaanse API.
Veelgestelde vragen
Grip op je AI-rekening
Als je niet weet welk deel van je tokens naar een te zwaar model gaat, valt er ook niets te besparen. Ik denk mee over die keuze, ontwerp de laag ervoor en bouw hem af, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
