Macro-opname van een siliciumwafer waarop de afzonderlijke chips met hun microscopische circuits in regelmatige vierkanten zichtbaar zijn.
Nieuws7 augustus · 00:114 leestijd

AMD koopt chipstartup Taalas die AI-modellen in silicium etst

AMD koopt de Canadese chipstartup Taalas, die de gewichten van een AI-model rechtstreeks in het silicium etst. Wat die techniek belooft, waar ze vastloopt, en wat het betekent voor de prijs van je AI-functies.

AMD neemt de Canadese chipstartup Taalas over, die de gewichten van een AI-model rechtstreeks in het silicium etst in plaats van ze uit geheugen te halen, maakte de chipmaker donderdag bekend.

Inference is de rekenstap die je betaalt bij elke vraag die een klant aan je chatbot stelt en elk document dat je software laat samenvatten. Wat die stap kost, wordt bepaald door het silicium eronder, en dat silicium komt vandaag bijna altijd van Nvidia. Een tweede serieuze partij op die laag drukt op termijn de tokenprijs waarop je AI-functies draaien. Voorlopig staat er alleen nog niets op een prijslijst: de deal moet nog langs de toezichthouders.

Wat Taalas maakt

Taalas bouwt wat het bedrijf model-specific integrated circuits noemt: chips waarin precies één model vastligt. De modelgewichten zitten in een mask-ROM-laag op de chip zelf, niet in HBM-geheugen ernaast, en een SRAM-deel houdt de KV-cache en de fine-tuning-adapters vast. Daarmee verdwijnt de stap die bij een gewone GPU het meeste tijd en stroom kost: gewichten heen en weer slepen tussen geheugen en rekenkernen.

De demonstratiechip HC1 is een TSMC-ontwerp op 6 nanometer, 815 vierkante millimeter groot met 53 miljard transistors, in een server van 2,5 kilowatt. Daarop haalt Taalas naar eigen zeggen 17.000 tokens per seconde per gebruiker op Meta's Llama 3.1 8B. In diezelfde eigen vergelijking komt een Nvidia H200 op 230 tokens per seconde, een B200 op 353, Groq op 594, Sambanova op 932 en Cerebras op 1.981.

Staafdiagram met tokens per seconde per gebruiker: Nvidia H200 230, Nvidia B200 353, Groq 594, Sambanova 932, Cerebras 1.981 en Taalas HC1 16.960. Bron: Taalas
Staafdiagram met tokens per seconde per gebruiker: Nvidia H200 230, Nvidia B200 353, Groq 594, Sambanova 932, Cerebras 1.981 en Taalas HC1 16.960. Bron: Taalas

Dat zijn cijfers van de verkoper, gemeten op één klein model van 8 miljard parameters. Snelheid per gebruiker zegt bovendien nog niets over de kosten per token als er duizend mensen tegelijk vragen stellen. Maar de orde van grootte verklaart wel waarom AMD zijn chequeboek trekt voor een bedrijf van drie jaar oud.

Het HC1-versnellerbord van Taalas, een blauwe insteekkaart met in het midden een grote chip met het Taalas-logo. Bron: Taalas
Het HC1-versnellerbord van Taalas, een blauwe insteekkaart met in het midden een grote chip met het Taalas-logo. Bron: Taalas

De keerzijde: een chip die maar één model kent

Wat de chip snel maakt, maakt hem ook star. Zit een model eenmaal in het silicium, dan zit het er vast. Een wezenlijk ander model vraagt om een nieuwe gang naar de fabriek: alleen de bovenste twee metaallagen hoeven te veranderen, tekent The Register op, maar een fabricagecyclus blijft het. In een markt waarin modellen elk kwartaal worden vervangen, is dat een echt bezwaar. De opvolger HC2 mikt volgens hetzelfde vakblad op 20 miljard parameters per chip, waarbij vijftig versnellers samen een model van een biljoen parameters zouden moeten kunnen dragen.

Wat AMD ermee wil

AMD zegt de techniek in zijn versnellerroadmap op te nemen en er systemen omheen te bouwen met zijn Instinct-GPU's en het Helios-racksysteem dat sinds eind juli in volledige productie is en volgens AMD tot 30 procent meer inference-tokens per dollar levert dan de concurrentie. De voor de hand liggende werkverdeling: de GPU verwerkt de vraag, de Taalas-chip produceert de antwoordtokens.

Vamsi Boppana, hoofd van AMD's AI-groep, noemt de techniek en het team van Taalas een versterking van het portfolio met onderscheidende inferentieprestaties en efficiëntie. Een bedrag noemde AMD niet. Taalas werd in 2023 opgericht in Toronto; medeoprichter en topman Ljubisa Bajic zegt dat AMD de schaal en de engineeringcapaciteit brengt om de ontwikkeling te versnellen. De overname moet volgens The Register in het vierde kwartaal van 2026 rond zijn, na goedkeuring van toezichthouders.

Het model in de chip wordt een patroon

AMD is niet de eerste die deze route neemt. Google werkt aan een inference-chip die delen van Gemini in het silicium vastlegt en per verwerkt token zes tot tien keer zuiniger moet zijn dan zijn huidige AI-chips, al mikt dat ontwerp pas op 2028 en heeft Google het nooit bevestigd. Het verschil zit in de rol: Google bakt zijn eigen model in eigen silicium om zijn eigen rekening te drukken, AMD koopt de techniek juist in om hem door te verkopen.

Daar zit de betekenis voor wie AI inkoopt. De laag onder je AI splitst in tweeën: algemene GPU's voor werk dat blijft veranderen, vastgebakken silicium voor het model dat blijft staan. Draai je een model dat elk kwartaal wordt vervangen, dan heb je aan die tweede categorie niets. Draai je één vast, kleiner open model voor een afgebakende taak, zoals classificatie of samenvatten, dan is dat precies waar de kosten het hardst kunnen dalen. De prijs van AI wordt de komende jaren minder één marktprijs en meer een functie van welk soort chip onder jouw specifieke toepassing ligt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van modelkeuze tot draaiende AI

Waar je AI draait en welk model je kiest, bepaalt je rekening meer dan welke chip er in het datacenter ligt. Ik denk met je mee over die keuze, ontwerp de oplossing en bouw en automatiseer hem van begin tot eind, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

AMD investeert tot 5 miljard dollar in Anthropic en levert 2 gigawatt aan AI-chips
Nieuws
4 min

22 jul 16:10

AMD investeert tot 5 miljard dollar in Anthropic en levert 2 gigawatt aan AI-chips

AMD investeert tot 5 miljard dollar in Anthropic en levert de Claude-maker tot 2 gigawatt aan Instinct MI450-chips vanaf 2027. Anthropic spreidt zijn rekenkracht daarmee verder buiten Nvidia, Amazon en Google.

Google bouwt inference-chip Frozen v2 die Gemini in silicium bakt
Nieuws
4

20 jul 18:11

Google bouwt inference-chip Frozen v2 die Gemini in silicium bakt

Google werkt aan Frozen v2, een inference-chip die delen van Gemini in het silicium legt en per token zes tot tien keer zuiniger zou zijn dan zijn huidige AI-chips. Wat dat betekent voor wie AI op Google Cloud draait.

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer
Nieuws
4 min

20 jul 16:22

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer

AMD daagt Nvidia voor het eerst op systeemniveau uit met Helios, een rack-schaal AI-systeem van 72 versnellers, en strikt Microsoft als afnemer voor Azure. Hoe groot die afname is, maakten beide bedrijven niet bekend.

Meta start in september productie van eigen AI-chip Iris
Nieuws
4 min

10 jul 02:24

Meta start in september productie van eigen AI-chip Iris

Meta begint in september met de productie van zijn eigen AI-chip Iris en wil zijn rekencapaciteit in 2027 verdubbelen naar 14 gigawatt. Een intern memo dat Reuters inzag legt de compute-strategie onder je cloudrekening bloot.

OpenAI, Anthropic en Google ontbreken in Nvidia's AI-beveiligingsalliantie
Nieuws
3 min

28 jul 02:13

OpenAI, Anthropic en Google ontbreken in Nvidia's AI-beveiligingsalliantie

Nvidia's Open Secure AI Alliance telt 37 oprichters, maar OpenAI, Anthropic en Google staan er geen van drieën op. Andere AI-labs wel. Wat die afwezigheid betekent als je beveiliging op hun modellen leunt.

Open-weight-brief aan Washington verdubbelt naar 50 ondertekenaars
Nieuws
4 min

26 jul 16:09

Open-weight-brief aan Washington verdubbelt naar 50 ondertekenaars

De open-weight-brief aan Washington telt nu 50 ondertekenaars, dubbel zoveel als bij publicatie. Google staat er alsnog op. Alleen Anthropic, Amazon en xAI blijven weg, en dat verschuift het politieke risico voor open modellen.