Prime Inference is sinds 2 oktober beschikbaar via een OpenAI-compatibele API voor open modellen, met serverloze API-eindpunten en gereserveerde capaciteit op GPU-infrastructuur van Prime Intellect, meldt het bedrijf.
Voor een Nederlandse organisatie die open modellen wil inzetten zonder zelf GPU-servers te beheren, neemt Prime het beheer van de GPU's en het draaien van modellen over. Als je de OpenAI SDK al gebruikt, kun je de code behouden en het API-eindpunt en de sleutel aanpassen.
Eén API, twee uitvoerroutes
De API garandeert niet dat elk model op Prime's eigen infrastructuur draait. Prime's documentatie maakt onderscheid tussen modellen die daar worden uitgevoerd en gatewaymodellen, waarbij aanvragen naar externe aanbieders gaan. GLM-5.3 is het eerste model dat Prime zelf draait. De modelcatalogus toont per model de uitvoerroute, beschikbaarheid en prijs.
Dat onderscheid telt voor organisaties met eisen aan kosten of datalocatie. De lancering noemt meerdere datacenters, maar geen specifieke regio's. Een OpenAI-compatibele aansluiting zegt dus op zichzelf niet waar ieder model draait.
Prime geeft ook technische cijfers voor GLM-5.3 op Nvidia GB200 NVL72. In de eigen test daalde de p90-vertraging tussen tokens bijna 40 procent nadat promptverwerking en token-generatie over aparte groepen GPU's werden verdeeld. P90 is de grens waaronder 90 procent van de metingen valt. Dit is het resultaat voor die configuratie, geen algemene prestatiegarantie. Prime zegt daarnaast dat het platform intern bijna een biljoen tokens per dag verwerkte voor evaluaties, synthetische data en codeeragenten. Dit bedrijfscijfer is geen maat voor de capaciteit die klanten kunnen boeken.
Capaciteit vraagt om overleg
Prime noemt gereserveerde capaciteit als optie voor aanhoudend gebruik. De productpagina verwijst organisaties die dedicated modelcapaciteit nodig hebben naar een gesprek met Prime; een openbare zelfserviceboeking of tarief voor die dienst staat er niet bij. Eigen implementaties met één klik op gereserveerde capaciteit staan nog op de roadmap.
De stap past naast Equinix' plan om samen met Nvidia en Together AI pas in het eerste kwartaal van 2027 een inferentiedienst voor open modellen te starten. Prime noemt geen regio's in de aankondiging; actuele tarieven en uitvoerroutes staan per model in de catalogus. Voor bedrijven verschuift de afweging van zelf GPU's beheren naar modelroute, prijs en datalocatie.
Veelgestelde vragen
Van model naar toepassing
Ik denk mee waar een open model past, ontwerp de koppelingen en bouw de AI-toepassing tot livegang. Ik automatiseer het werk eromheen en houd de modelroute self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
