Gemini 3.8 Live brengt realtime spraakagenten met visuele context en toolaanroepen op de achtergrond naar de Gemini API, AI Studio en Search Live, meldt Google op 15 september.
Voor een Nederlandse ondernemer verschuift de bouwsteen voor klantcontact van een transcriptieketen naar een directe spraakinterface. Een agent kan een telefoongesprek voeren, een scherm of ander beeld meenemen en ondertussen een API-aanroep uitvoeren. Triage, telefonie en onboarding komen daardoor dichter bij één realtime workflow, met audio, visuele context en toolrechten als nieuwe onderdelen van het ontwerp.
Twee modellen voor twee soorten werk
Google lanceert tegelijk Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking. De gewone Live-variant is bedoeld voor lage vertraging en schaalbare gesprekken. Extended Thinking spreekt door terwijl het op de achtergrond redeneert en asynchrone functies aanroept voor meerstapswerk. Een klantenservice-agent kan daardoor tijdens een gesprek gegevens ophalen of een reservering laten uitvoeren zonder stil te vallen. Volgens Google schakelt Live automatisch tussen 97 ondersteunde talen.
Voor ontwikkelteams is het verschil ook zichtbaar in de sessielogica. Bij de gewone variant betekent turnComplete dat een beurt klaar is. Bij Extended Thinking kan het signaal turnComplete al komen terwijl de sessie IN_PROGRESS blijft tot IDLE.
De prijs is concreet
De Gemini API rekent voor deze Live-modellen $0,005 per minuut audio-invoer en $0,018 per minuut audio-uitvoer. Wie beide audiostromen een uur lang actief houdt, komt rekenkundig uit op $1,38 per uur, vóór teksttokens, visuele input en toolgebruik.
Dat maakt de prijs relevant voor telefonie en klantcontact, waar een gesprek per minuut wordt afgerekend in plaats van per gebruiker. Het bedrag is geen vaste gespreksprijs: een agent die beelden meestuurt, extra tekst verwerkt of meerdere tools aanroept, verbruikt meer dan deze eenvoudige rekensom laat zien.
Nederland staat op de regiolijst
Voor Nederlandse ontwikkelaars is de toegang niet alleen een aankondiging. Nederland staat op de lijst van landen waar Google AI Studio en de Gemini API beschikbaar zijn, en de modelpagina voert gemini-3.8-live als stabiele modelnaam in de API-documentatie.
Google rolt de modellen uit naar ontwikkelaars via de Gemini API en AI Studio. Voor enterprise-gebruikers begint de uitrol in een private preview van Gemini Enterprise. De gewone Live-variant komt ook naar Search Live. Extended Thinking komt ook naar Gemini Live en geselecteerde Google Workspace-functies, terwijl de zakelijke Workspace-uitrol nog volgt.
De benchmark vraagt om context
De onafhankelijke Speech to Speech-pagina van Artificial Analysis zet Gemini 3.8 Live Extended Thinking op 82,6 in zijn samengestelde index. Die index combineert spraakredenering, agentische prestaties, voorkeur in een arena en taakvoltooiing. Op afzonderlijke onderdelen staat Extended Thinking op 68,6 procent voor agentische prestaties en 97,7 procent op Big Bench Audio. De gewone Gemini 3.8 Live staat op 76,0 in dezelfde index en op 96,1 procent voor conversatiedynamiek.
Dat zijn nuttige vergelijkingspunten, geen garantie voor een Nederlands klantgesprek. De index is samengesteld uit verschillende tests en de uitkomst hangt af van taal, interrupties, beleid, toolkoppelingen en de kwaliteit van je eigen gegevens. Een model dat in een benchmark hoog scoort, heeft daarmee nog niet bewezen dat het jouw retourproces of telefonische triage goed afhandelt.
De inzet zit in de koppeling
De release staat niet los van Googles API-koers. Nieuwe agentfuncties die Google alleen nog in de Interactions API uitbrengt laten zien hoe het platform zijn eigen interfaces stap voor stap uitbreidt, terwijl generateContent blijft werken. Live loopt via een aparte Live API, waardoor een team dat gewone agents en spraakagents bouwt verschillende integratie-oppervlakken moet beheren.
De praktische verschuiving zit niet in het praten zelf. De stem wordt een ingang naar bedrijfsacties, terwijl beelden en asynchrone tools de context leveren. Voor klantcontact en telefonie bepaalt de rechtenlaag rond die acties uiteindelijk hoeveel autonomie verantwoord inzetbaar is.
De relevante vraag wordt daarmee niet meer of een spraakagent natuurlijk klinkt, maar welke gegevens hij tijdens een gesprek mag zien en welke actie hij zelfstandig mag starten. Daar komt de grens tussen een demo en bedrijfssoftware te liggen.
Veelgestelde vragen
Van stem naar werkende agent
Ik denk mee over waar een spraakagent echt werk overneemt, ontwerp de koppeling met je systemen en bouw het geheel end-to-end, self-hosted waar dat kan. Van eerste idee tot live automatisering blijf ik je partner.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
