IBM bouwt op IBM Cloud een cluster van ongeveer 2.000 Nvidia Blackwell-chips waarop Together AI open modellen gaat draaien, onder een meerjarig contract van 240 miljoen dollar dat beide bedrijven dinsdag bekendmaakten.
Op korte termijn verandert dit niets aan de AI-rekening van een Nederlands bedrijf. De capaciteit komt pas in het eerste kwartaal van 2027 vrij en het cluster komt in de Verenigde Staten te staan. Wat wel schuift, is de aanbodkant. Open modellen draaien is geen doe-het-zelfproject meer maar een dienst die je per token inkoopt, en de partijen die die dienst leveren zetten nu jaren vooruit hardware vast om die prijs te kunnen bieden.
Wat er is afgesproken
IBM plaatst Nvidia HGX B300-systemen op IBM Cloud, gekoppeld via Spectrum-X Ethernet. Het is het eerste cluster op IBM Cloud dat specifiek voor inferentie is gebouwd, dus voor het draaien van getrainde modellen in productie en niet voor het trainen ervan. Nvidia claimt dertig keer meer output dan de vorige generatie. StorageReview tekent daarbij aan dat zo'n cijfer afhangt van modelarchitectuur, precisie, batchgrootte en serveerconfiguratie.
Together AI is de afnemer, niet de bouwer. Het bedrijf verwerkt naar eigen zeggen 400 biljoen tokens per maand op zijn inferentieplatform en kreeg in juli een waardering van 8,3 miljard dollar. De eerste uitrol telt volgens Reuters ongeveer 2.000 Blackwell 300-chips en komt in de Verenigde Staten te staan.

De prijzen waar het om draait
Together AI verkoopt open modellen per miljoen tokens, en het verschil binnen dat open aanbod is groter dan het verschil tussen open en gesloten. Op de eigen prijslijst kost gpt-oss-120B 0,15 dollar per miljoen invoertokens en 0,60 dollar per miljoen uitvoertokens, terwijl Kimi K3 op 3,00 en 15,00 dollar staat. Een factor 25 op de uitvoerkant.
Wie honderd miljoen uitvoertokens per maand verstookt, betaalt bij gpt-oss-120B zestig dollar en bij Kimi K3 vijftienhonderd. Voor een bedrijf dat een samenvattings-, classificatie- of zoekfunctie draait, bepaalt de modelkeuze de rekening dus sterker dan de keuze van de leverancier.
Wat het niet oplost
De capaciteit is nog niet geleverd en nu al krap. Chief revenue officer Kai Mak van Together AI verwacht dat het cluster twee tot drie maanden voor oplevering is uitverkocht. Inferentiecapaciteit wordt dus vooruit verhuurd zoals kantoorruimte, niet afgeroepen zoals stroom. Wie in 2027 een vast volume wil, onderhandelt daarover in 2026.
Blijft over de vraag waar je data terechtkomt. Het nieuwe cluster staat in de Verenigde Staten en op de prijslijst van Together AI staat geen Europese regio of dataresidentie vermeld. Voor een organisatie die persoonsgegevens of vertrouwelijke klantdossiers in de prompt zet, is dat de eerste vraag aan de leverancier, nog voor de tokenprijs. Zelf hosten beantwoordt die locatievraag wel, maar kent zijn eigen rekensom: zodra je GPU-leegloop, beheer en piekcapaciteit meetelt valt zelf draaien vaak duurder uit dan een cloud-API.
Waar dit heen wijst
De deal past in een verschuiving die al een jaar loopt: kapitaal beweegt van het trainen van modellen naar het draaien ervan. Gespecialiseerde partijen die open modellen goedkoper draaien dan de gesloten API's van OpenAI en Anthropic, waar een klant dertig procent lagere kosten meldde, halen inmiddels miljardenwaarderingen op. De software eromheen volgt dezelfde lijn: Nvidia's open agent-stack draait in LangChains eigen benchmark tien keer goedkoper dan gesloten alternatieven en wordt onder meer via Together AI aangeboden.
Deze 240 miljoen laat de keerzijde van die lage tokenprijs zien. Die prijs rust op meerjarige hardwarecontracten, getekend voor chips die pas over twee kwartalen in een rack staan. Open modellen zijn aan de inkoopkant goedkoper omdat iemand anders het kapitaalrisico draagt. Dat maakt het makkelijker dan zelf bouwen, en het levert precies dezelfde vraag op als bij de gesloten API die je ermee wilde vervangen: hoe snel kun je weg bij deze leverancier als de prijs of de voorwaarden veranderen.
Veelgestelde vragen
Open modellen slim inkopen
Wat AI je kost hangt sterker af van je modelkeuze en je architectuur dan van de leverancier op de factuur. Ik denk met je mee over die keuze, ontwerp de opzet en bouw en automatiseer hem af, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
