Close-up van een server in een serverruimte
Nieuws11 augustus · 20:384 min leestijd

IBM bouwt inferentiecluster van 240 miljoen dollar waarop Together AI open modellen draait

IBM bouwt voor Together AI een inferentiecluster van 240 miljoen dollar op IBM Cloud, met ongeveer 2.000 Nvidia Blackwell-chips in de Verenigde Staten. De capaciteit komt naar verwachting in het eerste kwartaal van 2027 beschikbaar.

IBM bouwt op IBM Cloud een cluster van ongeveer 2.000 Nvidia Blackwell-chips waarop Together AI open modellen gaat draaien, onder een meerjarig contract van 240 miljoen dollar dat beide bedrijven dinsdag bekendmaakten.

Op korte termijn verandert dit niets aan de AI-rekening van een Nederlands bedrijf. De capaciteit komt pas in het eerste kwartaal van 2027 vrij en het cluster komt in de Verenigde Staten te staan. Wat wel schuift, is de aanbodkant. Open modellen draaien is geen doe-het-zelfproject meer maar een dienst die je per token inkoopt, en de partijen die die dienst leveren zetten nu jaren vooruit hardware vast om die prijs te kunnen bieden.

Wat er is afgesproken

IBM plaatst Nvidia HGX B300-systemen op IBM Cloud, gekoppeld via Spectrum-X Ethernet. Het is het eerste cluster op IBM Cloud dat specifiek voor inferentie is gebouwd, dus voor het draaien van getrainde modellen in productie en niet voor het trainen ervan. Nvidia claimt dertig keer meer output dan de vorige generatie. StorageReview tekent daarbij aan dat zo'n cijfer afhangt van modelarchitectuur, precisie, batchgrootte en serveerconfiguratie.

Together AI is de afnemer, niet de bouwer. Het bedrijf verwerkt naar eigen zeggen 400 biljoen tokens per maand op zijn inferentieplatform en kreeg in juli een waardering van 8,3 miljard dollar. De eerste uitrol telt volgens Reuters ongeveer 2.000 Blackwell 300-chips en komt in de Verenigde Staten te staan.

Een Nvidia HGX-baseboard met acht GPU-modules en vloeistofkoelleidingen (bron: Nvidia)
Een Nvidia HGX-baseboard met acht GPU-modules en vloeistofkoelleidingen (bron: Nvidia)

De prijzen waar het om draait

Together AI verkoopt open modellen per miljoen tokens, en het verschil binnen dat open aanbod is groter dan het verschil tussen open en gesloten. Op de eigen prijslijst kost gpt-oss-120B 0,15 dollar per miljoen invoertokens en 0,60 dollar per miljoen uitvoertokens, terwijl Kimi K3 op 3,00 en 15,00 dollar staat. Een factor 25 op de uitvoerkant.

Wie honderd miljoen uitvoertokens per maand verstookt, betaalt bij gpt-oss-120B zestig dollar en bij Kimi K3 vijftienhonderd. Voor een bedrijf dat een samenvattings-, classificatie- of zoekfunctie draait, bepaalt de modelkeuze de rekening dus sterker dan de keuze van de leverancier.

Uitvoerprijs per miljoen tokens bij Together AI, in dollar (bron: prijslijst Together AI, 11 augustus 2026)

Wat het niet oplost

De capaciteit is nog niet geleverd en nu al krap. Chief revenue officer Kai Mak van Together AI verwacht dat het cluster twee tot drie maanden voor oplevering is uitverkocht. Inferentiecapaciteit wordt dus vooruit verhuurd zoals kantoorruimte, niet afgeroepen zoals stroom. Wie in 2027 een vast volume wil, onderhandelt daarover in 2026.

Blijft over de vraag waar je data terechtkomt. Het nieuwe cluster staat in de Verenigde Staten en op de prijslijst van Together AI staat geen Europese regio of dataresidentie vermeld. Voor een organisatie die persoonsgegevens of vertrouwelijke klantdossiers in de prompt zet, is dat de eerste vraag aan de leverancier, nog voor de tokenprijs. Zelf hosten beantwoordt die locatievraag wel, maar kent zijn eigen rekensom: zodra je GPU-leegloop, beheer en piekcapaciteit meetelt valt zelf draaien vaak duurder uit dan een cloud-API.

Waar dit heen wijst

De deal past in een verschuiving die al een jaar loopt: kapitaal beweegt van het trainen van modellen naar het draaien ervan. Gespecialiseerde partijen die open modellen goedkoper draaien dan de gesloten API's van OpenAI en Anthropic, waar een klant dertig procent lagere kosten meldde, halen inmiddels miljardenwaarderingen op. De software eromheen volgt dezelfde lijn: Nvidia's open agent-stack draait in LangChains eigen benchmark tien keer goedkoper dan gesloten alternatieven en wordt onder meer via Together AI aangeboden.

Deze 240 miljoen laat de keerzijde van die lage tokenprijs zien. Die prijs rust op meerjarige hardwarecontracten, getekend voor chips die pas over twee kwartalen in een rack staan. Open modellen zijn aan de inkoopkant goedkoper omdat iemand anders het kapitaalrisico draagt. Dat maakt het makkelijker dan zelf bouwen, en het levert precies dezelfde vraag op als bij de gesloten API die je ermee wilde vervangen: hoe snel kun je weg bij deze leverancier als de prijs of de voorwaarden veranderen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Open modellen slim inkopen

Wat AI je kost hangt sterker af van je modelkeuze en je architectuur dan van de leverancier op de factuur. Ik denk met je mee over die keuze, ontwerp de opzet en bouw en automatiseer hem af, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Nvidia-topman Huang spreekt Lutnick terwijl Commerce Blackwell-export onderzoekt
Nieuws
4 min

29 jul 00:26

Nvidia-topman Huang spreekt Lutnick terwijl Commerce Blackwell-export onderzoekt

Jensen Huang sprak dinsdag met minister Lutnick terwijl diens ministerie de export van Blackwell-chips naar China onderzoekt. Uiterlijk 1 augustus presenteert Washington een AI-raamwerk dat ook de koers voor open Chinese modellen vastlegt.

Nvidia, Microsoft en Meta bepleiten open AI-modellen bij Washington
Nieuws
4 min

24 jul 18:21

Nvidia, Microsoft en Meta bepleiten open AI-modellen bij Washington

Voor het eerst zetten de grootste Amerikaanse AI-leveranciers zelf, niet alleen startups, gezamenlijk hun gewicht achter open modellen. In een brief aan Washington vragen Nvidia, Microsoft, Meta en Palantir om geen beperkingen op open-weight AI.

Nvidia's open agent-stack draait tien keer goedkoper in LangChains eigen benchmark
Nieuws
4 min

9 jul 04:25

Nvidia's open agent-stack draait tien keer goedkoper in LangChains eigen benchmark

Nvidia en LangChain brachten een open agent-stack uit rond het model Nemotron 3 Ultra. In hun eigen benchmark draait die tien keer goedkoper dan het dichtstbijzijnde gesloten model. Wat betekent dat, en hoe hard is de claim?

DeepSeek ontwikkelt eigen AI-chip om Nvidia en Huawei te ontlopen
Nieuws
4 min

8 jul 14:12

DeepSeek ontwikkelt eigen AI-chip om Nvidia en Huawei te ontlopen

DeepSeek ontwikkelt een eigen AI-chip voor inference om losser te komen van Nvidia en Huawei, meldt Reuters. De hardwarelaag onder AI versplintert, en dat raakt hoe je straks een model en zijn ecosysteem kiest.

Witte Huis blaast sancties en cloudverbod op Chinese open modellen af
Nieuws
4 min

4 aug 16:25

Witte Huis blaast sancties en cloudverbod op Chinese open modellen af

Het Witte Huis overwoog sancties, een handelszwarte lijst en een verbod voor Amerikaanse cloudbedrijven om zaken te doen met Chinese makers van open AI-modellen. Na verzet uit Silicon Valley ging dat pakket van tafel, meldt The New York Times.

Brits kabinet overweegt AI-regels als vrijwillige tests tekortschieten
Nieuws
4 min

4 aug 12:27

Brits kabinet overweegt AI-regels als vrijwillige tests tekortschieten

AI-minister Kanishka Narayan zegt tegen Reuters dat het VK regels overweegt als vrijwillige tests tekortschieten, en de ICO volgt OpenAI en Anthropic. Twee uitspraken, geen wetsvoorstel, en het derde regime in vijf dagen.