Rijen servers in een donker datacenter met blauwe verlichting.
Nieuws20 juli · 18:114 leestijd

Google bouwt inference-chip Frozen v2 die Gemini in silicium bakt

Google werkt aan Frozen v2, een inference-chip die delen van Gemini in het silicium legt en per token zes tot tien keer zuiniger zou zijn dan zijn huidige AI-chips. Wat dat betekent voor wie AI op Google Cloud draait.

Google werkt aan een eigen inference-chip, Frozen v2, die delen van het Gemini-model rechtstreeks in het silicium legt en per verwerkt token naar verluidt zes tot tien keer zuiniger is dan Googles huidige eigen AI-chips, meldt vakblad The Information op basis van ingewijden.

Wie Gemini via Google Cloud of Vertex AI inzet, heeft geen chip nodig om de inzet te snappen: die zit in de rekenkosten. De prijs per token die je nu betaalt, wordt bepaald door het silicium eronder, en Google probeert zijn eigen model in maatwerk-hardware te bakken om die kostprijs structureel te drukken. Een prijsverlaging is het nog niet. De chip mikt op inzet vanaf 2028, en Google heeft de plannen zelf niet bevestigd.

Wat Frozen v2 precies is

Frozen v2 is bedoeld voor inference: de fase waarin een getraind model antwoorden genereert voor gebruikers, de stap die het meeste dagelijkse rekenwerk vraagt. Het bijzondere zit in de naam. De architectuur van Gemini wordt "bevroren" en deels in het silicium zelf vastgelegd, wat rekenstappen en dataverplaatsing scheelt. Ingenieurs kunnen het systeem daarna bijwerken met nieuwe modelgewichten, zonder de hardware opnieuw te ontwerpen.

De efficiëntiewinst is de kern van het verhaal, en meteen de claim om voorzichtig mee te zijn. De chip zou per verwerkt token zes tot tien keer zuiniger zijn dan Googles nieuwste eigen AI-chips, maar dat is een projectie en geen gemeten prestatie: ingenieurs sleutelen nog aan het ontwerp en aan de vraag hoeveel modelinformatie er precies in het silicium komt. Google zelf reageerde dat het regelmatig nieuwe manieren onderzoekt om AI efficiënter te maken, maar dat niet elk experiment een commercieel product wordt.

Een Google TPU v3-versnellerbord met vier chips, koperen koelblokken en vloeistofkoeling op een blauwe printplaat. Bron: Zinskauf, Wikimedia Commons, CC BY-SA 4.0
Een Google TPU v3-versnellerbord met vier chips, koperen koelblokken en vloeistofkoeling op een blauwe printplaat. Bron: Zinskauf, Wikimedia Commons, CC BY-SA 4.0

Belangrijk voor het juiste beeld: Frozen v2 vervangt de bestaande TPU's niet, maar komt ernaast als een gespecialiseerde optie voor Gemini-inference. Het is een interne datacenter-chip om Gemini goedkoper te bedienen op een moment dat Google zelf tegen een tekort aan AI-rekenkracht aanloopt, niet een kaart die je los koopt zoals een Nvidia-GPU. Of de chip later ook zakelijke Google Cloud-klanten gaat dienen, staat nog niet vast. Op het bericht stegen de Alphabet-aandelen maandag ruim een procent.

Een derde front tegen de rekenmarge

Op zichzelf is Frozen v2 een gerucht over één chip. Naast elkaar gelegd met de rest van deze zomer is het een patroon: de grote AI-spelers bouwen tegelijk uitwegen uit dezelfde afhankelijkheid. DeepSeek ontwikkelt een eigen chip voor inference om losser te komen van Nvidia en Huawei, en Amazon, Meta en Anthropic bouwen allemaal eigen silicium om niet langer aan Nvidia vast te zitten. Vanmiddag daagde AMD Nvidia op systeemniveau uit met het rack-schaal AI-systeem Helios, waarvoor Microsoft zich als Azure-afnemer meldde.

Google kiest binnen die beweging de meest verregaande route. Waar AMD een compleet systeem verkoopt en anderen algemene versnellers ontwerpen, giet Google zijn eigen model in de chip. Dat werkt alleen als je het model én de hardware in één hand hebt, en het bindt de winst rechtstreeks aan Gemini. De besparing landt eerst op Googles eigen rekening, niet op die van de klant.

Daar zit de betekenis voor wie AI inkoopt. De kostprijs van inference wordt steeds meer een functie van wiens maatwerk-silicium jouw model draait. Een model kiezen is dan niet alleen een keuze voor kwaliteit of prijs vandaag, maar voor een hardware-ecosysteem met eigen kosten, beschikbaarheid en leveranciersrisico. Frozen v2 is nog een belofte voor 2028, maar de richting is nu al af te lezen: de laag onder je AI verschuift van standaardonderdelen naar silicium dat op één model is gesneden.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Grip op je AI-kosten

Ik denk met je mee welk model en welke infrastructuur echt bij je passen, en bouw de koppelingen en automatisering eromheen, self-hosted waar dat kan, zodat je niet vastzit aan één leverancier of aan oplopende rekenkosten.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Microsoft wil zijn Maia 300-AI-chip mogelijk al in september onthullen
Nieuws
4 min

10 aug 20:34

Microsoft wil zijn Maia 300-AI-chip mogelijk al in september onthullen

Microsoft wil zijn AI-chip Maia 300 dit najaar onthullen, mogelijk al in september, en onderhandelt met TSMC over ruim 300.000 exemplaren voor 2027. Wat dat betekent voor Azure-klanten die nu rekenkracht inkopen.

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer
Nieuws
4 min

20 jul 16:22

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer

AMD daagt Nvidia voor het eerst op systeemniveau uit met Helios, een rack-schaal AI-systeem van 72 versnellers, en strikt Microsoft als afnemer voor Azure. Hoe groot die afname is, maakten beide bedrijven niet bekend.

Anthropic tekent in elf maanden voor 517 miljard dollar aan compute-contracten
Nieuws
4 min

7 sep 04:09

Anthropic tekent in elf maanden voor 517 miljard dollar aan compute-contracten

Anthropic legde in elf maanden voor 517 miljard dollar aan compute-contracten en minstens 14,8 gigawatt vast, telt The Information. Dat is bijna drie keer het bedrag dat het bedrijf zijn investeerders in december voorspiegelde.

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet
Nieuws
4 min

26 aug 22:35

Moonshot vraagt Microsoft, Amazon en Google tot 30 procent van de Kimi K3-omzet

Moonshot vraagt volgens Reuters tot 30 procent van de omzet die Microsoft, Amazon en Google met Kimi K3 zouden maken. De gesprekken bepalen of je het Chinese topmodel straks gewoon als clouddienst inkoopt.

Exportcontrole op AI klimt de stack op: van chip naar model naar jouw contract
Signaal
8 min

28 jul 00:44

Exportcontrole op AI klimt de stack op: van chip naar model naar jouw contract

In januari 2025 stond de regel er al: modelgewichten onder exportvergunning. Hij werd ingetrokken. Anderhalf jaar later doet Washington hetzelfde per brief, en Beijing bouwt het instrument na.

Open-weight-brief aan Washington verdubbelt naar 50 ondertekenaars
Nieuws
4 min

26 jul 16:09

Open-weight-brief aan Washington verdubbelt naar 50 ondertekenaars

De open-weight-brief aan Washington telt nu 50 ondertekenaars, dubbel zoveel als bij publicatie. Google staat er alsnog op. Alleen Anthropic, Amazon en xAI blijven weg, en dat verschuift het politieke risico voor open modellen.