Rijen servers in een donker datacenter met blauwe verlichting.
Nieuws20 juli · 18:114 leestijd

Google bouwt inference-chip Frozen v2 die Gemini in silicium bakt

Google werkt aan Frozen v2, een inference-chip die delen van Gemini in het silicium legt en per token zes tot tien keer zuiniger zou zijn dan zijn huidige AI-chips. Wat dat betekent voor wie AI op Google Cloud draait.

Google werkt aan een eigen inference-chip, Frozen v2, die delen van het Gemini-model rechtstreeks in het silicium legt en per verwerkt token naar verluidt zes tot tien keer zuiniger is dan Googles huidige eigen AI-chips, meldt vakblad The Information op basis van ingewijden.

Wie Gemini via Google Cloud of Vertex AI inzet, heeft geen chip nodig om de inzet te snappen: die zit in de rekenkosten. De prijs per token die je nu betaalt, wordt bepaald door het silicium eronder, en Google probeert zijn eigen model in maatwerk-hardware te bakken om die kostprijs structureel te drukken. Een prijsverlaging is het nog niet. De chip mikt op inzet vanaf 2028, en Google heeft de plannen zelf niet bevestigd.

Wat Frozen v2 precies is

Frozen v2 is bedoeld voor inference: de fase waarin een getraind model antwoorden genereert voor gebruikers, de stap die het meeste dagelijkse rekenwerk vraagt. Het bijzondere zit in de naam. De architectuur van Gemini wordt "bevroren" en deels in het silicium zelf vastgelegd, wat rekenstappen en dataverplaatsing scheelt. Ingenieurs kunnen het systeem daarna bijwerken met nieuwe modelgewichten, zonder de hardware opnieuw te ontwerpen.

De efficiëntiewinst is de kern van het verhaal, en meteen de claim om voorzichtig mee te zijn. De chip zou per verwerkt token zes tot tien keer zuiniger zijn dan Googles nieuwste eigen AI-chips, maar dat is een projectie en geen gemeten prestatie: ingenieurs sleutelen nog aan het ontwerp en aan de vraag hoeveel modelinformatie er precies in het silicium komt. Google zelf reageerde dat het regelmatig nieuwe manieren onderzoekt om AI efficiënter te maken, maar dat niet elk experiment een commercieel product wordt.

Een Google TPU v3-versnellerbord met vier chips, koperen koelblokken en vloeistofkoeling op een blauwe printplaat. Bron: Zinskauf, Wikimedia Commons, CC BY-SA 4.0
Een Google TPU v3-versnellerbord met vier chips, koperen koelblokken en vloeistofkoeling op een blauwe printplaat. Bron: Zinskauf, Wikimedia Commons, CC BY-SA 4.0

Belangrijk voor het juiste beeld: Frozen v2 vervangt de bestaande TPU's niet, maar komt ernaast als een gespecialiseerde optie voor Gemini-inference. Het is een interne datacenter-chip om Gemini goedkoper te bedienen op een moment dat Google zelf tegen een tekort aan AI-rekenkracht aanloopt, niet een kaart die je los koopt zoals een Nvidia-GPU. Of de chip later ook zakelijke Google Cloud-klanten gaat dienen, staat nog niet vast. Op het bericht stegen de Alphabet-aandelen maandag ruim een procent.

Een derde front tegen de rekenmarge

Op zichzelf is Frozen v2 een gerucht over één chip. Naast elkaar gelegd met de rest van deze zomer is het een patroon: de grote AI-spelers bouwen tegelijk uitwegen uit dezelfde afhankelijkheid. DeepSeek ontwikkelt een eigen chip voor inference om losser te komen van Nvidia en Huawei, en Amazon, Meta en Anthropic bouwen allemaal eigen silicium om niet langer aan Nvidia vast te zitten. Vanmiddag daagde AMD Nvidia op systeemniveau uit met het rack-schaal AI-systeem Helios, waarvoor Microsoft zich als Azure-afnemer meldde.

Google kiest binnen die beweging de meest verregaande route. Waar AMD een compleet systeem verkoopt en anderen algemene versnellers ontwerpen, giet Google zijn eigen model in de chip. Dat werkt alleen als je het model én de hardware in één hand hebt, en het bindt de winst rechtstreeks aan Gemini. De besparing landt eerst op Googles eigen rekening, niet op die van de klant.

Daar zit de betekenis voor wie AI inkoopt. De kostprijs van inference wordt steeds meer een functie van wiens maatwerk-silicium jouw model draait. Een model kiezen is dan niet alleen een keuze voor kwaliteit of prijs vandaag, maar voor een hardware-ecosysteem met eigen kosten, beschikbaarheid en leveranciersrisico. Frozen v2 is nog een belofte voor 2028, maar de richting is nu al af te lezen: de laag onder je AI verschuift van standaardonderdelen naar silicium dat op één model is gesneden.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Grip op je AI-kosten

Ik denk met je mee welk model en welke infrastructuur echt bij je passen, en bouw de koppelingen en automatisering eromheen, self-hosted waar dat kan, zodat je niet vastzit aan één leverancier of aan oplopende rekenkosten.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer
Nieuws
4 minBijgewerkt om 20:15

20 jul 16:22

AMD daagt Nvidia uit met AI-racksysteem Helios, Microsoft wordt afnemer

AMD daagt Nvidia voor het eerst op systeemniveau uit met Helios, een rack-schaal AI-systeem van 72 versnellers, en strikt Microsoft als afnemer voor Azure. Hoe groot die afname is, maakten beide bedrijven niet bekend.

Meta start in september productie van eigen AI-chip Iris
Nieuws
4 min

10 jul 02:24

Meta start in september productie van eigen AI-chip Iris

Meta begint in september met de productie van zijn eigen AI-chip Iris en wil zijn rekencapaciteit in 2027 verdubbelen naar 14 gigawatt. Een intern memo dat Reuters inzag legt de compute-strategie onder je cloudrekening bloot.

BIS waarschuwt: een AI-zeepbel bedreigt nu krediet en groei wereldwijd
Nieuws
6 min

28 jun 12:21

BIS waarschuwt: een AI-zeepbel bedreigt nu krediet en groei wereldwijd

De Bank for International Settlements zet een abrupt einde van de AI-investeringsgolf op één lijn met inflatie en schuld als toprisico. De zwakke schakel is krediet, en dat raakt elk bedrijf dat op AI-infrastructuur bouwt.

Google rantsoeneert Meta's Gemini-gebruik: zelfs een techreus botst op een compute-plafond
Nieuws
6 min

28 jun 08:16

Google rantsoeneert Meta's Gemini-gebruik: zelfs een techreus botst op een compute-plafond

Google zette een limiet op Meta's gebruik van zijn Gemini-modellen toen de vraag naar rekenkracht het aanbod oversteeg. Zelfs een techreus botst op een capaciteitsplafond, een directe les voor wie AI bij derden inkoopt.

Franse toezichthouder: drie bedrijven beheersen 84 procent van AI-agentenmarkt
Nieuws
4 min

18 jul 14:22

Franse toezichthouder: drie bedrijven beheersen 84 procent van AI-agentenmarkt

De Franse mededingingsautoriteit becijfert dat OpenAI, Google en Anthropic samen ruim 84 procent van de wereldwijde markt voor AI-agenten beheersen. Ze waarschuwt voor lock-in en beperkte overstapbaarheid, maar deelt geen boete uit.

Meta metselt zich in, en de open fakkel verhuist
Signaal
7 min

17 jul 16:01

Meta metselt zich in, en de open fakkel verhuist

Meta ruilde zijn open Llama in voor een gesloten Muse Spark en metselt er een eigen chip, cloud en app-laag omheen. Los is het bedrijfsnieuws, samen een beweging. En de open fakkel? Die verhuist gewoon.