Together AI draait als eerste klant op een nieuw B300-inferentiecluster van IBM Cloud, meldt het bedrijf op 6 oktober, ruim vóór de eerder verwachte beschikbaarheid in Q1 2027.
Open modellen draaien daarmee al op de infrastructuur die in augustus nog voor volgend jaar was aangekondigd. Voor een Nederlands team dat inferentie via Together AI inkoopt, verschuift de mogelijke start naar voren. De aankondiging maakt alleen niet duidelijk hoeveel capaciteit er draait, welke modellen erop staan of wat een klant vandaag kan reserveren.
De eerste inzet valt vóór de planning
IBM kondigde de samenwerking op 11 augustus aan. Het noemde een meerjarige overeenkomst van 240 miljoen dollar en verwachte beschikbaarheid in het eerste kwartaal van 2027. Twee maanden later meldt Together AI dat het er als eerste klant op draait. Dat bevestigt een eerdere operationele start, maar niet dat alle afgesproken capaciteit al is opgeleverd.
De planning betrof een groot cluster voor open-modelinferentie op IBM Cloud. In het eerdere bericht over de overeenkomst van 240 miljoen dollar met een verwachte start in Q1 2027 stond die uitrol nog als toekomstige capaciteit. Daarmee verschuift het project van geplande naar gemelde operationele inzet, terwijl de datum voor de volledige uitrol openblijft.
De formulering heeft een duidelijke grens: Together zegt dat het zelf de eerste klant is die op het cluster draait. Het zegt niet dat een externe onderneming al toegang heeft, hoeveel systemen actief zijn of wanneer alle klanten van het platform die capaciteit kunnen gebruiken. De bevestiging gaat over een draaiend cluster, niet over de oplevering van elk onderdeel van het contract.
IBM levert de cloud, Together de inferentie
Het cluster is gebouwd voor inferentie: het uitvoeren van vragen op een al getraind model. Dat is de stap achter ieder gegenereerd antwoord in bijvoorbeeld een zoekfunctie, assistent of tekstverwerker. Modeltraining maakt de gewichten; inferentie gebruikt die gewichten telkens wanneer een gebruiker een vraag stelt.
De taakverdeling bestaat uit drie partijen. IBM levert IBM Cloud, NVIDIA levert de B300-GPU's en Spectrum-X Ethernet-netwerkapparatuur, en Together AI verzorgt de inferentielaag. Together beschrijft dit als een speciaal ingericht cluster voor grootschalige modeluitvoering.

Together meldt ook dat het maandelijks honderden biljoenen tokens serveert aan meer dan een miljoen ontwikkelaars. Dat zijn cijfers van het bedrijf over het volledige platform, niet over dit ene cluster. Ze geven wel de schaal van de vraag aan waarop de extra capaciteit aansluit.
Een draaiend cluster geeft nog geen klanttoegang
De aankondiging noemt geen aantal B300-GPU's, geen capaciteit per model en geen prijs. Ook ontbreken responstijden, servicegaranties en voorwaarden waaronder een afnemer capaciteit kan vastleggen. De aankondiging beschrijft Spectrum-X als netwerk voor inferentie met hoge doorvoer. Er staat geen benchmark bij die laat zien hoeveel sneller een specifieke toepassing hierdoor wordt.
Voor een bedrijf dat een open model in een klantproces wil gebruiken, is het verschil praktisch. Een werkend cluster betekent dat de hardware al in gebruik is. Een draaiend cluster maakt nog niet duidelijk of het gewenste model op die capaciteit beschikbaar is, of een klant het cluster kan kiezen en welk volume de dienst aankan. De aankondiging maakt de hardwareplanning concreter. De commerciële toegang blijft onbeschreven.
Een aparte route volgt in 2027
Dezelfde partners bereiden ook een andere vorm van modelinfrastructuur voor. Equinix kondigde op 2 september met NVIDIA en Together AI een Inference Exchange aan die meer dan 200 open modellen moet ondersteunen. Die aparte Equinix-route staat gepland voor Q1 2027. De eerdere berichtgeving over Equinix' dienst met Together AI en meer dan 200 modellen beschreef ook die latere start.
Het gaat om een afzonderlijk aanbod: IBM levert de cloud voor het B300-cluster, terwijl Equinix de andere dienst op zijn eigen datacenterinfrastructuur plant. Together bouwt zo zijn inferentieplatform via meer dan één infrastructuurpartner, met verschillende startmomenten.
Together heeft de inzet op clusterniveau bevestigd. Voor een Nederlandse organisatie is de resterende timingvraag welke open modellen en welk reserveerbaar volume op deze capaciteit beschikbaar komen. Die gegevens maken duidelijk of de eerdere hardware-inzet ook een eerdere start voor een concrete toepassing oplevert.
Veelgestelde vragen
Van model naar werkend systeem
Ik help je bepalen waar open modellen in je product passen, ontwerp de software en realiseer de koppelingen en automatisering end-to-end, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.


