Een NVIDIA GeForce RTX grafische kaart in close-up
Nieuws13 juni · 18:065 min leestijd

DiffusionGemma: Googles open model dat tekst in één keer genereert

Google DeepMind brengt DiffusionGemma uit, een open model dat tekst niet woord voor woord opbouwt maar in parallelle blokken. Het draait lokaal op één GPU en is vrij te downloaden onder Apache 2.0.

Google DeepMind heeft DiffusionGemma uitgebracht, een experimenteel open model dat op een fundamenteel andere manier tekst maakt. Waar vrijwel elk taalmodel tot nu toe woord voor woord van links naar rechts schrijft, gooit DiffusionGemma die volgorde overboord. Het begint met een soort ruis van willekeurige tokens en verfijnt die in een paar passes tot een complete passage, vergelijkbaar met hoe beeldgeneratoren een foto uit ruis tevoorschijn halen. Het resultaat is fors snellere tekstgeneratie, en, minstens zo belangrijk voor Nederlandse bedrijven, een model dat je gewoon zelf op je eigen hardware draait.

Wat is text diffusion, in gewone taal

Een gangbaar taalmodel voorspelt steeds het volgende woord op basis van wat ervoor staat. Dat is accuraat, maar inherent traag: elk woord moet wachten op het vorige. DiffusionGemma genereert in plaats daarvan 256 tokens tegelijk per stap en schaaft die over meerdere rondes bij, waarbij correcte tokens worden vastgezet. Volgens Google levert dat tot vier keer snellere inference op dan de klassieke token-voor-token aanpak.

Onder de motorkap zit het Gemma 4-fundament: een mixture-of-experts model van 26 miljard parameters waarvan er tijdens gebruik maar 3,8 miljard tegelijk actief zijn. Dat houdt het model licht genoeg voor één GPU. Gekwantiseerd past het in ongeveer 18GB videogeheugen, wat betekent dat een high-end consumentenkaart zoals een NVIDIA RTX 5090 het aankan.

Gebouwd voor lokaal draaien

Dit is geen cloud-only model. DiffusionGemma is nadrukkelijk geoptimaliseerd voor lokale, interactieve inzet op de NVIDIA-stack, van RTX en RTX PRO werkstations tot Hopper- en Blackwell-systemen. NVIDIA noemt tot 1.000 tokens per seconde op een enkele H100 en honderden per seconde op een desktopkaart.

Het model staat onder de Apache 2.0-licentie op Hugging Face, met kant-en-klare opties via NVIDIA NIM, vLLM en straks llama.cpp. Je downloadt het, draait het achter je eigen firewall en stuurt geen enkele prompt naar een externe API. Voor wie bezig is met privacy, AVG en het vermijden van vendor lock-in is dat precies het type bouwsteen dat telt. De afweging tussen self-hosted en cloud valt per project anders uit, en open-weight modellen zoals MiniMax M3, dat qua codeer- en agent-prestaties in de buurt komt van de grote betaalde modellen, maken die keuze steeds concreter.

De eerlijke kanttekening

Snelheid heeft een prijs. Google is open over de afweging: de kwaliteit van DiffusionGemma ligt lager dan die van het standaard Gemma 4-model. Voor zware redeneertaken raadt Google het reguliere model aan. DiffusionGemma blinkt uit in snelle, interactieve werkstromen: code aanvullen tijdens het typen, tekst ter plekke herschrijven, snel itereren, real-time toepassingen. Het is geen vervanging van je beste model, maar een gereedschap voor taken waar tempo zwaarder weegt dan het laatste procentje kwaliteit.

Wat betekent dit voor jouw bedrijf

De trend is duidelijker dan dit ene model. Capabele AI verschuift van uitsluitend dure cloud-API's naar modellen die je zelf bezit en lokaal draait. Dat geeft je drie dingen tegelijk: je data blijft binnen je eigen muren, je bent niet afhankelijk van de prijszetting van één leverancier, en je betaalt geen kosten per verzoek voor routinetaken.

Voor de meeste organisaties is de winst niet om alles te self-hosten, maar om bewust te kiezen: het zware werk eventueel in de cloud, de snelle en privacygevoelige taken op eigen hardware. Voor de meeste organisaties is de winst niet om alles te self-hosten, maar om bewust te kiezen: het zware werk eventueel in de cloud, de snelle en privacygevoelige taken op eigen hardware.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Lokale AI draaien op eigen hardware

Ik beoordeel per gebruik of een lokaal open-weight model de juiste keuze is, richt de infrastructuur in en integreer het end-to-end in je bestaande processen, zonder maandelijkse API-rekening en zonder dat je data het pand verlaat.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Hugging Face verkent verkoop van minstens 13 miljard dollar
Nieuws
4 min

23 aug 22:21

Hugging Face verkent verkoop van minstens 13 miljard dollar

Business Insider meldt dat Hugging Face een verkoop verkent van minstens 13 miljard dollar. Het bedrijf bevestigt niets. Voor teams die modellen, datasets en inferentie van de hub halen, telt vooral de eigenaarsvraag.

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma
Nieuws
5 min

15 aug 12:35

Qwen passeert 3 miljard downloads en verdringt Llama en Gemma

Alibaba's open Qwen-modellen zijn in zes maanden 3 miljard keer gedownload en gaan Meta en Google voorbij. Het cijfer komt van Alibaba zelf, terwijl Hugging Face op de eigen Hub ruim 2 miljard telt.

Meta geeft agentmodel Muse Glimmer vrij onder Apache 2.0
Nieuws
6 min

10 aug 14:09

Meta geeft agentmodel Muse Glimmer vrij onder Apache 2.0

Meta zet de gewichten van agentmodel Muse Glimmer onder Apache 2.0 op Hugging Face. Het model van 30 miljard parameters draait op één consumenten-GPU en keert de gesloten koers van juni om.

Alibaba verkoopt voor 10,2 miljard dollar aandelen om zijn AI-stack te betalen
Nieuws
3

23 aug 12:10

Alibaba verkoopt voor 10,2 miljard dollar aandelen om zijn AI-stack te betalen

Alibaba verkoopt 710 miljoen nieuwe aandelen in Hongkong voor 10,2 miljard dollar en investeert de volledige opbrengst in chips, AI-infrastructuur en de ontwikkeling van modellen. Wat dat betekent voor teams die op Qwen en Alibaba Cloud draaien.

Google’s Gemma-modellen passeren een miljard downloads
Nieuws
5 min

21 aug 06:20

Google’s Gemma-modellen passeren een miljard downloads

Google telt een miljard downloads voor zijn open Gemma-modellen en ruim honderdduizend afgeleide varianten. Belangrijker dan het cijfer is de licentie: Gemma 4 staat onder een kale Apache 2.0-tekst.

AT&T verlaagt kosten van AI-taken met 56 procent via open modellen
Nieuws
4 min

21 aug 04:09

AT&T verlaagt kosten van AI-taken met 56 procent via open modellen

AT&T stuurt vragen van medewerkers via een LiteLLM-router naar open modellen en verlaagde de kosten van codeer- en andere AI-taken met tot 56 procent, bij 2 procent kwaliteitsverlies. De uitgaven aan Anthropic en OpenAI blijven bevroren.