Een router-switch met aangesloten netwerkkabels in een netwerkrek.
Nieuws7 oktober · 04:384 min leestijd

Together AI draait op IBM's B300-inferentiecluster

Together AI zegt al te draaien op het B300-cluster van IBM Cloud, vóór de eerder verwachte start in Q1 2027. De aankondiging bevestigt operationeel gebruik, maar laat capaciteit en klanttoegang open.

Together AI draait als eerste klant op een nieuw B300-inferentiecluster van IBM Cloud, meldt het bedrijf op 6 oktober, ruim vóór de eerder verwachte beschikbaarheid in Q1 2027.

Open modellen draaien daarmee al op de infrastructuur die in augustus nog voor volgend jaar was aangekondigd. Voor een Nederlands team dat inferentie via Together AI inkoopt, verschuift de mogelijke start naar voren. De aankondiging maakt alleen niet duidelijk hoeveel capaciteit er draait, welke modellen erop staan of wat een klant vandaag kan reserveren.

De eerste inzet valt vóór de planning

IBM kondigde de samenwerking op 11 augustus aan. Het noemde een meerjarige overeenkomst van 240 miljoen dollar en verwachte beschikbaarheid in het eerste kwartaal van 2027. Twee maanden later meldt Together AI dat het er als eerste klant op draait. Dat bevestigt een eerdere operationele start, maar niet dat alle afgesproken capaciteit al is opgeleverd.

De planning betrof een groot cluster voor open-modelinferentie op IBM Cloud. In het eerdere bericht over de overeenkomst van 240 miljoen dollar met een verwachte start in Q1 2027 stond die uitrol nog als toekomstige capaciteit. Daarmee verschuift het project van geplande naar gemelde operationele inzet, terwijl de datum voor de volledige uitrol openblijft.

De formulering heeft een duidelijke grens: Together zegt dat het zelf de eerste klant is die op het cluster draait. Het zegt niet dat een externe onderneming al toegang heeft, hoeveel systemen actief zijn of wanneer alle klanten van het platform die capaciteit kunnen gebruiken. De bevestiging gaat over een draaiend cluster, niet over de oplevering van elk onderdeel van het contract.

IBM levert de cloud, Together de inferentie

Het cluster is gebouwd voor inferentie: het uitvoeren van vragen op een al getraind model. Dat is de stap achter ieder gegenereerd antwoord in bijvoorbeeld een zoekfunctie, assistent of tekstverwerker. Modeltraining maakt de gewichten; inferentie gebruikt die gewichten telkens wanneer een gebruiker een vraag stelt.

De taakverdeling bestaat uit drie partijen. IBM levert IBM Cloud, NVIDIA levert de B300-GPU's en Spectrum-X Ethernet-netwerkapparatuur, en Together AI verzorgt de inferentielaag. Together beschrijft dit als een speciaal ingericht cluster voor grootschalige modeluitvoering.

Schematische weergave van de inferentielaag, cloud en netwerkhardware (bron: Together AI)
Schematische weergave van de inferentielaag, cloud en netwerkhardware (bron: Together AI)

Together meldt ook dat het maandelijks honderden biljoenen tokens serveert aan meer dan een miljoen ontwikkelaars. Dat zijn cijfers van het bedrijf over het volledige platform, niet over dit ene cluster. Ze geven wel de schaal van de vraag aan waarop de extra capaciteit aansluit.

Een draaiend cluster geeft nog geen klanttoegang

De aankondiging noemt geen aantal B300-GPU's, geen capaciteit per model en geen prijs. Ook ontbreken responstijden, servicegaranties en voorwaarden waaronder een afnemer capaciteit kan vastleggen. De aankondiging beschrijft Spectrum-X als netwerk voor inferentie met hoge doorvoer. Er staat geen benchmark bij die laat zien hoeveel sneller een specifieke toepassing hierdoor wordt.

Voor een bedrijf dat een open model in een klantproces wil gebruiken, is het verschil praktisch. Een werkend cluster betekent dat de hardware al in gebruik is. Een draaiend cluster maakt nog niet duidelijk of het gewenste model op die capaciteit beschikbaar is, of een klant het cluster kan kiezen en welk volume de dienst aankan. De aankondiging maakt de hardwareplanning concreter. De commerciële toegang blijft onbeschreven.

Een aparte route volgt in 2027

Dezelfde partners bereiden ook een andere vorm van modelinfrastructuur voor. Equinix kondigde op 2 september met NVIDIA en Together AI een Inference Exchange aan die meer dan 200 open modellen moet ondersteunen. Die aparte Equinix-route staat gepland voor Q1 2027. De eerdere berichtgeving over Equinix' dienst met Together AI en meer dan 200 modellen beschreef ook die latere start.

Het gaat om een afzonderlijk aanbod: IBM levert de cloud voor het B300-cluster, terwijl Equinix de andere dienst op zijn eigen datacenterinfrastructuur plant. Together bouwt zo zijn inferentieplatform via meer dan één infrastructuurpartner, met verschillende startmomenten.

Together heeft de inzet op clusterniveau bevestigd. Voor een Nederlandse organisatie is de resterende timingvraag welke open modellen en welk reserveerbaar volume op deze capaciteit beschikbaar komen. Die gegevens maken duidelijk of de eerdere hardware-inzet ook een eerdere start voor een concrete toepassing oplevert.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van model naar werkend systeem

Ik help je bepalen waar open modellen in je product passen, ontwerp de software en realiseer de koppelingen en automatisering end-to-end, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

IBM bouwt inferentiecluster van 240 miljoen dollar waarop Together AI open modellen draait
Nieuws
4 min

11 aug 20:38

IBM bouwt inferentiecluster van 240 miljoen dollar waarop Together AI open modellen draait

IBM bouwt voor Together AI een inferentiecluster van 240 miljoen dollar op IBM Cloud, met ongeveer 2.000 Nvidia Blackwell-chips in de Verenigde Staten. De capaciteit komt naar verwachting in het eerste kwartaal van 2027 beschikbaar.

Equinix kondigt inferentiedienst voor open modellen aan met Nvidia en Together AI
Nieuws
4 min

3 sep 02:21

Equinix kondigt inferentiedienst voor open modellen aan met Nvidia en Together AI

Equinix brengt open AI-modellen naar zijn eigen datacenters, samen met Nvidia en Together AI. De dienst komt in het eerste kwartaal van 2027, maar welke metro's als eerste aangaan is nog niet bekend.

Prime Intellect opent inferentie-API voor open modellen
Nieuws
2 min

3 okt 08:12

Prime Intellect opent inferentie-API voor open modellen

Prime Intellect maakt open modellen beschikbaar via een OpenAI-compatibele API. Serverloze eindpunten zijn direct te gebruiken; gereserveerde capaciteit loopt via overleg, terwijl eigen implementaties met één klik nog op de roadmap staan.

Broadcom verzamelt $60 miljard voor AI-chipfinanciering
Nieuws
2 min

3 okt 06:58

Broadcom verzamelt $60 miljard voor AI-chipfinanciering

Broadcom verzamelt volgens Bloomberg $60 miljard voor AI-chipfinanciering. Een prospectus koppelt een lening van maximaal $42 miljard aan Anthropics TPU-lease en noemt versnelde betaling bij bepaalde wanbetalingen.

CoreWeave stelt NVIDIA Vera Rubin NVL72 beperkt beschikbaar
Nieuws
1 min

30 sep 18:17

CoreWeave stelt NVIDIA Vera Rubin NVL72 beperkt beschikbaar

CoreWeave stelt NVIDIA Vera Rubin NVL72 beperkt beschikbaar. Cognition meldt tot 4,8 keer meer tokendoorvoer dan met GB200 bij een test voor zijn programmeeragent. De aankondiging noemt geen algemene snelheidsgarantie; de cloudcapaciteit blijft voorlopig beperkt.

Salesforce brengt CRM-redeneermodel Koa naar Agentforce
Nieuws
4 min

15 sep 22:36

Salesforce brengt CRM-redeneermodel Koa naar Agentforce

Salesforce brengt met NVIDIA Koa naar Agentforce, een CRM-redeneermodel voor complexe meerstaptaken. Het model belooft minder fouten en blijft binnen Salesforce’ infrastructuur, maar pilots, Amerikaanse beschikbaarheid en Missionforce lopen door elkaar.