AMD neemt de Canadese chipstartup Taalas over, die de gewichten van een AI-model rechtstreeks in het silicium etst in plaats van ze uit geheugen te halen, maakte de chipmaker donderdag bekend.
Inference is de rekenstap die je betaalt bij elke vraag die een klant aan je chatbot stelt en elk document dat je software laat samenvatten. Wat die stap kost, wordt bepaald door het silicium eronder, en dat silicium komt vandaag bijna altijd van Nvidia. Een tweede serieuze partij op die laag drukt op termijn de tokenprijs waarop je AI-functies draaien. Voorlopig staat er alleen nog niets op een prijslijst: de deal moet nog langs de toezichthouders.
Wat Taalas maakt
Taalas bouwt wat het bedrijf model-specific integrated circuits noemt: chips waarin precies één model vastligt. De modelgewichten zitten in een mask-ROM-laag op de chip zelf, niet in HBM-geheugen ernaast, en een SRAM-deel houdt de KV-cache en de fine-tuning-adapters vast. Daarmee verdwijnt de stap die bij een gewone GPU het meeste tijd en stroom kost: gewichten heen en weer slepen tussen geheugen en rekenkernen.
De demonstratiechip HC1 is een TSMC-ontwerp op 6 nanometer, 815 vierkante millimeter groot met 53 miljard transistors, in een server van 2,5 kilowatt. Daarop haalt Taalas naar eigen zeggen 17.000 tokens per seconde per gebruiker op Meta's Llama 3.1 8B. In diezelfde eigen vergelijking komt een Nvidia H200 op 230 tokens per seconde, een B200 op 353, Groq op 594, Sambanova op 932 en Cerebras op 1.981.

Dat zijn cijfers van de verkoper, gemeten op één klein model van 8 miljard parameters. Snelheid per gebruiker zegt bovendien nog niets over de kosten per token als er duizend mensen tegelijk vragen stellen. Maar de orde van grootte verklaart wel waarom AMD zijn chequeboek trekt voor een bedrijf van drie jaar oud.

De keerzijde: een chip die maar één model kent
Wat de chip snel maakt, maakt hem ook star. Zit een model eenmaal in het silicium, dan zit het er vast. Een wezenlijk ander model vraagt om een nieuwe gang naar de fabriek: alleen de bovenste twee metaallagen hoeven te veranderen, tekent The Register op, maar een fabricagecyclus blijft het. In een markt waarin modellen elk kwartaal worden vervangen, is dat een echt bezwaar. De opvolger HC2 mikt volgens hetzelfde vakblad op 20 miljard parameters per chip, waarbij vijftig versnellers samen een model van een biljoen parameters zouden moeten kunnen dragen.
Wat AMD ermee wil
AMD zegt de techniek in zijn versnellerroadmap op te nemen en er systemen omheen te bouwen met zijn Instinct-GPU's en het Helios-racksysteem dat sinds eind juli in volledige productie is en volgens AMD tot 30 procent meer inference-tokens per dollar levert dan de concurrentie. De voor de hand liggende werkverdeling: de GPU verwerkt de vraag, de Taalas-chip produceert de antwoordtokens.
Vamsi Boppana, hoofd van AMD's AI-groep, noemt de techniek en het team van Taalas een versterking van het portfolio met onderscheidende inferentieprestaties en efficiëntie. Een bedrag noemde AMD niet. Taalas werd in 2023 opgericht in Toronto; medeoprichter en topman Ljubisa Bajic zegt dat AMD de schaal en de engineeringcapaciteit brengt om de ontwikkeling te versnellen. De overname moet volgens The Register in het vierde kwartaal van 2026 rond zijn, na goedkeuring van toezichthouders.
Het model in de chip wordt een patroon
AMD is niet de eerste die deze route neemt. Google werkt aan een inference-chip die delen van Gemini in het silicium vastlegt en per verwerkt token zes tot tien keer zuiniger moet zijn dan zijn huidige AI-chips, al mikt dat ontwerp pas op 2028 en heeft Google het nooit bevestigd. Het verschil zit in de rol: Google bakt zijn eigen model in eigen silicium om zijn eigen rekening te drukken, AMD koopt de techniek juist in om hem door te verkopen.
Daar zit de betekenis voor wie AI inkoopt. De laag onder je AI splitst in tweeën: algemene GPU's voor werk dat blijft veranderen, vastgebakken silicium voor het model dat blijft staan. Draai je een model dat elk kwartaal wordt vervangen, dan heb je aan die tweede categorie niets. Draai je één vast, kleiner open model voor een afgebakende taak, zoals classificatie of samenvatten, dan is dat precies waar de kosten het hardst kunnen dalen. De prijs van AI wordt de komende jaren minder één marktprijs en meer een functie van welk soort chip onder jouw specifieke toepassing ligt.
Veelgestelde vragen
Van modelkeuze tot draaiende AI
Waar je AI draait en welk model je kiest, bepaalt je rekening meer dan welke chip er in het datacenter ligt. Ik denk met je mee over die keuze, ontwerp de oplossing en bouw en automatiseer hem van begin tot eind, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
