Klassieke telefoonhoorn op een lichte achtergrond
Nieuws15 september · 22:504 min leestijd

Google lanceert Gemini 3.8 Live voor realtime spraakagenten

Google brengt Gemini 3.8 Live en Live Extended Thinking naar de Gemini API. De modellen combineren realtime spraak, visuele context en achtergrondtaken, met audio-invoer voor $0,005 per minuut en uitvoer voor $0,018.

Gemini 3.8 Live brengt realtime spraakagenten met visuele context en toolaanroepen op de achtergrond naar de Gemini API, AI Studio en Search Live, meldt Google op 15 september.

Voor een Nederlandse ondernemer verschuift de bouwsteen voor klantcontact van een transcriptieketen naar een directe spraakinterface. Een agent kan een telefoongesprek voeren, een scherm of ander beeld meenemen en ondertussen een API-aanroep uitvoeren. Triage, telefonie en onboarding komen daardoor dichter bij één realtime workflow, met audio, visuele context en toolrechten als nieuwe onderdelen van het ontwerp.

Twee modellen voor twee soorten werk

Google lanceert tegelijk Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking. De gewone Live-variant is bedoeld voor lage vertraging en schaalbare gesprekken. Extended Thinking spreekt door terwijl het op de achtergrond redeneert en asynchrone functies aanroept voor meerstapswerk. Een klantenservice-agent kan daardoor tijdens een gesprek gegevens ophalen of een reservering laten uitvoeren zonder stil te vallen. Volgens Google schakelt Live automatisch tussen 97 ondersteunde talen.

Voor ontwikkelteams is het verschil ook zichtbaar in de sessielogica. Bij de gewone variant betekent turnComplete dat een beurt klaar is. Bij Extended Thinking kan het signaal turnComplete al komen terwijl de sessie IN_PROGRESS blijft tot IDLE.

De prijs is concreet

De Gemini API rekent voor deze Live-modellen $0,005 per minuut audio-invoer en $0,018 per minuut audio-uitvoer. Wie beide audiostromen een uur lang actief houdt, komt rekenkundig uit op $1,38 per uur, vóór teksttokens, visuele input en toolgebruik.

Dat maakt de prijs relevant voor telefonie en klantcontact, waar een gesprek per minuut wordt afgerekend in plaats van per gebruiker. Het bedrag is geen vaste gespreksprijs: een agent die beelden meestuurt, extra tekst verwerkt of meerdere tools aanroept, verbruikt meer dan deze eenvoudige rekensom laat zien.

Nederland staat op de regiolijst

Voor Nederlandse ontwikkelaars is de toegang niet alleen een aankondiging. Nederland staat op de lijst van landen waar Google AI Studio en de Gemini API beschikbaar zijn, en de modelpagina voert gemini-3.8-live als stabiele modelnaam in de API-documentatie.

Google rolt de modellen uit naar ontwikkelaars via de Gemini API en AI Studio. Voor enterprise-gebruikers begint de uitrol in een private preview van Gemini Enterprise. De gewone Live-variant komt ook naar Search Live. Extended Thinking komt ook naar Gemini Live en geselecteerde Google Workspace-functies, terwijl de zakelijke Workspace-uitrol nog volgt.

De benchmark vraagt om context

De onafhankelijke Speech to Speech-pagina van Artificial Analysis zet Gemini 3.8 Live Extended Thinking op 82,6 in zijn samengestelde index. Die index combineert spraakredenering, agentische prestaties, voorkeur in een arena en taakvoltooiing. Op afzonderlijke onderdelen staat Extended Thinking op 68,6 procent voor agentische prestaties en 97,7 procent op Big Bench Audio. De gewone Gemini 3.8 Live staat op 76,0 in dezelfde index en op 96,1 procent voor conversatiedynamiek.

Dat zijn nuttige vergelijkingspunten, geen garantie voor een Nederlands klantgesprek. De index is samengesteld uit verschillende tests en de uitkomst hangt af van taal, interrupties, beleid, toolkoppelingen en de kwaliteit van je eigen gegevens. Een model dat in een benchmark hoog scoort, heeft daarmee nog niet bewezen dat het jouw retourproces of telefonische triage goed afhandelt.

De inzet zit in de koppeling

De release staat niet los van Googles API-koers. Nieuwe agentfuncties die Google alleen nog in de Interactions API uitbrengt laten zien hoe het platform zijn eigen interfaces stap voor stap uitbreidt, terwijl generateContent blijft werken. Live loopt via een aparte Live API, waardoor een team dat gewone agents en spraakagents bouwt verschillende integratie-oppervlakken moet beheren.

De praktische verschuiving zit niet in het praten zelf. De stem wordt een ingang naar bedrijfsacties, terwijl beelden en asynchrone tools de context leveren. Voor klantcontact en telefonie bepaalt de rechtenlaag rond die acties uiteindelijk hoeveel autonomie verantwoord inzetbaar is.

De relevante vraag wordt daarmee niet meer of een spraakagent natuurlijk klinkt, maar welke gegevens hij tijdens een gesprek mag zien en welke actie hij zelfstandig mag starten. Daar komt de grens tussen een demo en bedrijfssoftware te liggen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van stem naar werkende agent

Ik denk mee over waar een spraakagent echt werk overneemt, ontwerp de koppeling met je systemen en bouw het geheel end-to-end, self-hosted waar dat kan. Van eerste idee tot live automatisering blijf ik je partner.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API
Nieuws
5 min

27 aug 00:35

Google lanceert Gemini 3.5 Transcribe met Nederlands in de API

Google brengt Gemini 3.5 Transcribe uit, een spraak-naar-tekstmodel dat vulwoorden weghaalt en tekst opmaakt. Nederlands werkt via de API, de consumentenkanalen blijven voorlopig Engels. Kosten: ongeveer 30 dollarcent per uur audio.

Google maakt de Interactions API de standaard voor Gemini: zo raakt dat ontwikkelaars
Nieuws
4 min

23 jun 00:31

Google maakt de Interactions API de standaard voor Gemini: zo raakt dat ontwikkelaars

Google zet de Interactions API neer als nieuwe standaardinterface voor al zijn Gemini-modellen en agenten. Het oude generateContent blijft werken, maar nieuwe agent-functies komen er niet meer in. Wat dit betekent als je op Gemini bouwt.

Google zet spraakbediening aan in Gmail, Docs en Keep, nog niet zakelijk
Nieuws
4 min

3 sep 20:32

Google zet spraakbediening aan in Gmail, Docs en Keep, nog niet zakelijk

Google brengt Gmail Live, Docs Live en Keep Live uit voor abonnees van Google AI Plus, Pro en Ultra. Zakelijke Workspace-klanten volgen later, en alles werkt voorlopig alleen in het Engels op mobiel.

Google zet ontwerptool Pics aan in Workspace vanaf Business Standard
Nieuws
4 min

1 sep 20:21

Google zet ontwerptool Pics aan in Workspace vanaf Business Standard

Google Pics is sinds 1 september algemeen beschikbaar in Workspace vanaf Business Standard, inclusief Nederlands. De tool maakt en bewerkt beeld in Docs en Slides, maar levert geen sjablonen, merkkit of advertentiepublicatie.

Google lanceert Gemini Omni 1.1 Flash, maar eigen video bewerken kan niet in de EER
Nieuws
5 min

28 aug 04:14

Google lanceert Gemini Omni 1.1 Flash, maar eigen video bewerken kan niet in de EER

Gemini Omni 1.1 Flash is algemeen beschikbaar via de Gemini API, met scenes tot veertig seconden, 4K en tarieven van 0,03 tot 0,30 dollar per seconde. Het bewerken van eigen geuploade video blijft in de EER uitgeschakeld.

Google hernoemt NotebookLM tot Gemini Notebook en laat elke notitie code draaien
Nieuws
3

16 jul 20:25

Google hernoemt NotebookLM tot Gemini Notebook en laat elke notitie code draaien

Google hernoemt NotebookLM tot Gemini Notebook en geeft elk notitieblok een cloudcomputer die code schrijft en draait. De researchtool doet nu echte data-analyse op je eigen bronnen, al blijft die upgrade voorlopig voor betalende AI Ultra- en Workspace-klanten.