Zwarte serverracks van Imgix met blauwe bekabeling in een datacenter
Nieuws3 oktober · 08:122 min leestijd

Prime Intellect opent inferentie-API voor open modellen

Prime Intellect maakt open modellen beschikbaar via een OpenAI-compatibele API. Serverloze eindpunten zijn direct te gebruiken; gereserveerde capaciteit loopt via overleg, terwijl eigen implementaties met één klik nog op de roadmap staan.

Prime Inference is sinds 2 oktober beschikbaar via een OpenAI-compatibele API voor open modellen, met serverloze API-eindpunten en gereserveerde capaciteit op GPU-infrastructuur van Prime Intellect, meldt het bedrijf.

Voor een Nederlandse organisatie die open modellen wil inzetten zonder zelf GPU-servers te beheren, neemt Prime het beheer van de GPU's en het draaien van modellen over. Als je de OpenAI SDK al gebruikt, kun je de code behouden en het API-eindpunt en de sleutel aanpassen.

Eén API, twee uitvoerroutes

De API garandeert niet dat elk model op Prime's eigen infrastructuur draait. Prime's documentatie maakt onderscheid tussen modellen die daar worden uitgevoerd en gatewaymodellen, waarbij aanvragen naar externe aanbieders gaan. GLM-5.3 is het eerste model dat Prime zelf draait. De modelcatalogus toont per model de uitvoerroute, beschikbaarheid en prijs.

Dat onderscheid telt voor organisaties met eisen aan kosten of datalocatie. De lancering noemt meerdere datacenters, maar geen specifieke regio's. Een OpenAI-compatibele aansluiting zegt dus op zichzelf niet waar ieder model draait.

Prime geeft ook technische cijfers voor GLM-5.3 op Nvidia GB200 NVL72. In de eigen test daalde de p90-vertraging tussen tokens bijna 40 procent nadat promptverwerking en token-generatie over aparte groepen GPU's werden verdeeld. P90 is de grens waaronder 90 procent van de metingen valt. Dit is het resultaat voor die configuratie, geen algemene prestatiegarantie. Prime zegt daarnaast dat het platform intern bijna een biljoen tokens per dag verwerkte voor evaluaties, synthetische data en codeeragenten. Dit bedrijfscijfer is geen maat voor de capaciteit die klanten kunnen boeken.

Capaciteit vraagt om overleg

Prime noemt gereserveerde capaciteit als optie voor aanhoudend gebruik. De productpagina verwijst organisaties die dedicated modelcapaciteit nodig hebben naar een gesprek met Prime; een openbare zelfserviceboeking of tarief voor die dienst staat er niet bij. Eigen implementaties met één klik op gereserveerde capaciteit staan nog op de roadmap.

De stap past naast Equinix' plan om samen met Nvidia en Together AI pas in het eerste kwartaal van 2027 een inferentiedienst voor open modellen te starten. Prime noemt geen regio's in de aankondiging; actuele tarieven en uitvoerroutes staan per model in de catalogus. Voor bedrijven verschuift de afweging van zelf GPU's beheren naar modelroute, prijs en datalocatie.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van model naar toepassing

Ik denk mee waar een open model past, ontwerp de koppelingen en bouw de AI-toepassing tot livegang. Ik automatiseer het werk eromheen en houd de modelroute self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

VS en China plannen AI-veiligheidsoverleg voor half september
Nieuws
4 min

5 sep 06:09

VS en China plannen AI-veiligheidsoverleg voor half september

De VS en China willen half september voor het eerst exclusief over AI-veiligheid praten, meldt Reuters op basis van twee ingewijden. Op de voorgestelde agenda staat ook de distillatie van Amerikaanse modellen door Chinese labs.

Equinix kondigt inferentiedienst voor open modellen aan met Nvidia en Together AI
Nieuws
4 min

3 sep 02:21

Equinix kondigt inferentiedienst voor open modellen aan met Nvidia en Together AI

Equinix brengt open AI-modellen naar zijn eigen datacenters, samen met Nvidia en Together AI. De dienst komt in het eerste kwartaal van 2027, maar welke metro's als eerste aangaan is nog niet bekend.

Z.ai vervijfvoudigt halfjaaromzet en haalt 86 procent uit zijn API
Nieuws
4 min

1 sep 10:09

Z.ai vervijfvoudigt halfjaaromzet en haalt 86 procent uit zijn API

Z.ai vervijfvoudigde zijn halfjaaromzet naar 953,9 miljoen yuan en haalt 86,5 procent daarvan uit zijn API. De omzet uit installaties bij klanten op locatie zakte juist met 54,6 procent.

Nvidia legt omzetdelingsdeals met AI-clouds stil uit vrees voor kartelonderzoek
Nieuws
4 min

28 aug 00:14

Nvidia legt omzetdelingsdeals met AI-clouds stil uit vrees voor kartelonderzoek

Nvidia pauzeert deals in het programma dat AI-clouds kredietsteun gaf in ruil voor omzetdeling, meldt The Wall Street Journal. Eigen medewerkers vreesden kartelonderzoek. Er hangt 36 miljard dollar aan toegezegde verplichtingen aan.

IBM bouwt inferentiecluster van 240 miljoen dollar waarop Together AI open modellen draait
Nieuws
4 min

11 aug 20:38

IBM bouwt inferentiecluster van 240 miljoen dollar waarop Together AI open modellen draait

IBM bouwt voor Together AI een inferentiecluster van 240 miljoen dollar op IBM Cloud, met ongeveer 2.000 Nvidia Blackwell-chips in de Verenigde Staten. De capaciteit komt naar verwachting in het eerste kwartaal van 2027 beschikbaar.

Nvidia praat over garantie van 250 miljard dollar voor OpenAI-datacenter
Nieuws
4 min

27 jul 02:08

Nvidia praat over garantie van 250 miljard dollar voor OpenAI-datacenter

Nvidia onderhandelt over een garantie van ongeveer 250 miljard dollar op de financiering van een OpenAI-datacenter in Ohio. De chipmaker wordt daarmee medeverantwoordelijk voor de schuld van zijn grootste klant.