Een computerprocessor vastgehouden met een zwarte pincet tegen een neutrale achtergrond.
Nieuws27 augustus · 06:105 min leestijd

OpenAI meet Jalapeno op 1,9 keer meer tokens per watt dan Blackwell

OpenAI publiceerde de eerste gemeten resultaten van zijn Jalapeno-chip: 1,5 tot 1,9 keer meer AI-werk per watt dan de vergeleken Nvidia-systemen. Op kosten per token ontloopt hij Vera Rubin nauwelijks, en de productie loopt pas in 2027 op.

OpenAI publiceerde dinsdag op de Hot Chips-conferentie de eerste gemeten prestaties van Jalapeno, zijn eigen inferentiechip: 1,5 tot 1,9 keer meer AI-werk per watt dan de Nvidia-systemen waartegen het testte.

Op je OpenAI-rekening verandert daar dit jaar niets door. De chip bestaat voorlopig als engineeringsample, en de eerste exemplaren gaan naar OpenAI's eigen datacenters, niet naar een cloudmenu waar je capaciteit uit kiest. Wat wel verschuift is de onderbouwing onder de prijs die je vanaf volgend jaar betaalt. Tot dinsdag rustte Jalapeno op een claim over prestatie per watt; nu liggen er cijfers waar iedereen op kan schieten. En het eerste dat daarin opvalt: de kostprijs per uitgaand token beweegt vandaag nog niet.

Close-up van de Jalapeno-inferentiechip op een testbord van Broadcom (bron: OpenAI)
Close-up van de Jalapeno-inferentiechip op een testbord van Broadcom (bron: OpenAI)

Wat er precies gemeten is

OpenAI draaide Jalapeno op InferenceX, de publieke inferentiebenchmark van SemiAnalysis, met drie open modellen: GPT-OSS 120B, DeepSeek R1 670B en Kimi K2.5 1T. Alle scores zijn genormaliseerd op het opgegeven vermogen van de chips. Jalapeno staat op 700 watt, het vergeleken GB200-systeem op 1.200 en de GB300 op 1.400. Gemeten bleef Jalapeno onder de 550 watt.

Op GPT-OSS 120B haalde de chip 85.448 tegen 44.960 gemengde tokens per kilowatt ten opzichte van GB200, bij een antwoordtijd van 1,03 seconde tegen 1,80. Op DeepSeek R1 670B tegenover een GB300 loopt dat verschil in wachttijd op tot 1,65 tegen 5,99 seconde. Voor sterk interactieve werklasten, het profiel van een agent die stap na stap op het vorige antwoord wacht, meldt OpenAI 2,1 tot 4,1 keer meer prestatie. Houd je de decodeersnelheid gelijk aan het beste punt van het Nvidia-systeem, dan lopen de verhoudingen op tot 54 tot 104 keer de doorvoer per kilowatt, afhankelijk van het model.

Gemengde tokens per kilowatt op de InferenceX-benchmark, augustus 2026 (bron: OpenAI). GPT-OSS is vergeleken met een GB200-systeem, DeepSeek R1 en Kimi K2.5 met een GB300.

"De resultaten laten een zeer, zeer significante prestatiesprong zien ten opzichte van de stand van de techniek", zei Richard Ho, verantwoordelijk voor hardware bij OpenAI.

De kanttekeningen staan in de benchmark zelf

SemiAnalysis liet de runs in het lab van OpenAI voor zijn ogen draaien, maar tekent aan dat alle cijfers door OpenAI zelf zijn aangeleverd en dat de volledige suite niet is afgedraaid. Er zijn ook geen AgentX-resultaten, de test met lange context en meerdere beurten die het dichtst bij een productie-agent komt. De gebruikte werklast is 8.000 tokens invoer en 1.000 uitvoer, een profiel waar een chip relatief makkelijk op te tunen valt.

Voor wie inkoopt weegt een tweede kanttekening zwaarder. De vergelijking met Blackwell noemt SemiAnalysis onvolledig, omdat Jalapeno HBM4-geheugen gebruikt en daarmee tegenover Nvidia's Vera Rubin hoort, dat nu al bij klanten staat. Op kosten per uitgaand token ontlopen die twee elkaar nauwelijks. Jalapeno haalde dat resultaat wel zonder speculatief decoderen, een techniek die Rubin in zijn cijfers wel meeneemt en die de kosten per token verder omlaag kan brengen.

Wanneer dit je tokenprijs raakt

De uitrol begint eind dit jaar in zeer kleine volumes binnen OpenAI's eigen infrastructuur, waarna de productie pas in de loop van 2027 opschaalt. OpenAI schrijft er expliciet bij dat het versnellers van Nvidia en andere partners breed blijft inzetten. De onthulling van Jalapeno met Broadcom in juni, met een geplande uitrol op gigawattschaal aan het eind van dit jaar, bevatte nog geen enkel meetcijfer; dat gat is nu gedicht, de leverbaarheid niet.

Wat je vandaag wel kunt afnemen staat een dag eerder op dezelfde conferentie: Nvidia's decode-versneller Groq 3 LPX, die maandag in volle productie ging en bij het Amsterdamse Nebius te huur komt. Wie nu een latency-gevoelige agent draait, kiest daar tussen, niet tussen Jalapeno en Blackwell.

Waar de verschuiving zit

Jalapeno haalt deze cijfers op de A0-versie van het silicium, negen maanden na tapeout, met een B0-versie in de fabriek die ongeveer 25 procent beter presteert per watt. Dat tempo is het echte nieuws: een lab dat zelf een chip ontwerpt haalt in één generatie een gevestigde chipmaker bij op de as waar datacenters tegenaan lopen, namelijk werk per megawatt.

Voor wie op OpenAI bouwt verplaatst dat de vraag. Niet welke chip wint, maar wat er gebeurt als een aanbieder zijn eigen kostenbasis in handen krijgt. De prijs per miljoen tokens daalde al, en sinds midden juli zakte de index van Silicon Data met bijna een kwart omdat de labs hun prijslijsten aanpasten. Vanaf 2027 komt daar een tweede knop bij, die alleen OpenAI kan indrukken: goedkoper serveren op eigen silicium is winst die in de prijslijst kan landen of in de marge kan blijven zitten. Welke van de twee het wordt, is de enige vraag uit deze benchmark die op je eigen factuur terechtkomt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van tokenprijs naar werkend systeem

Wat een chip in een benchmark doet, merk je pas als AI echt in je proces zit. Ik denk mee over die keuze, ontwerp de opzet en bouw en automatiseer hem, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Nvidia en SK Group kondigen AI-plan van 500 miljard dollar aan
Nieuws
5 min

25 jul 04:10

Nvidia en SK Group kondigen AI-plan van 500 miljard dollar aan

Nvidia en SK Group presenteren een AI-plan van meer dan 500 miljard dollar, met ruim 2 gigawatt aan datacenters en een langjarige geheugendeal. Wat dat bedrag precies is, en wat het doet met de prijs van AI-capaciteit.

Nvidia zet Groq 3 LPX in volle productie, Nebius neemt hem als eerste af
Nieuws
4 min

24 aug 18:10

Nvidia zet Groq 3 LPX in volle productie, Nebius neemt hem als eerste af

Nvidia's Groq 3 LPX is in volle productie: 256 LPU's per rack en 3.400 tokens per seconde voor één gebruiker. Het Amsterdamse Nebius biedt de capaciteit als eerste aan, zonder migratie en zonder bekende prijs.

Anthropic haalt TPU-grondlegger Amir Salek binnen voor eigen chips
Nieuws
3 min

22 aug 12:25

Anthropic haalt TPU-grondlegger Amir Salek binnen voor eigen chips

Anthropic haalt Amir Salek binnen, de man die Googles TPU-programma opzette en zeven chipgeneraties afleverde. Hij versterkt het compute-team dat eigen silicium onder Claude moet leggen. Aan de Claude-factuur verandert vandaag niets.

CoreWeave verhoogt prijzen met 25 procent en is op korte termijn uitverkocht
Nieuws
5 min

13 aug 00:10

CoreWeave verhoogt prijzen met 25 procent en is op korte termijn uitverkocht

CoreWeave verhoogde in juli alle SKU-prijzen met ongeveer 25 procent en meldt dat de capaciteit voor de korte termijn uitverkocht is. Ook oudere GPU-generaties worden niet goedkoper meer.

IBM bouwt inferentiecluster van 240 miljoen dollar waarop Together AI open modellen draait
Nieuws
4 min

11 aug 20:38

IBM bouwt inferentiecluster van 240 miljoen dollar waarop Together AI open modellen draait

IBM bouwt voor Together AI een inferentiecluster van 240 miljoen dollar op IBM Cloud, met ongeveer 2.000 Nvidia Blackwell-chips in de Verenigde Staten. De capaciteit komt naar verwachting in het eerste kwartaal van 2027 beschikbaar.

OpenAI onthult met Broadcom zijn eerste eigen AI-chip: Jalapeno
Nieuws
5 min

24 jun 16:35

OpenAI onthult met Broadcom zijn eerste eigen AI-chip: Jalapeno

OpenAI en Broadcom onthulden Jalapeno, de eerste eigen AI-chip van OpenAI, speciaal gebouwd voor inferentie. De chip moet de kosten van AI omlaag brengen en de afhankelijkheid van Nvidia verkleinen.