OpenAI brengt GPT-Live-1 op 10 september naar zijn API, meldt het bedrijf, zodat ontwikkelaars full-duplex spraakagents kunnen bouwen die tegelijk luisteren en spreken voor klantcontact en telefonie.
Voor een Nederlandse ondernemer verschuift daarmee de technische keuze. Wie reserveringen, afspraken of support via telefoon automatiseert, krijgt een gespreklaag die minder afhankelijk is van korte stiltes en vaste beurten. De prijs ligt op $0,05 per minuut voor de stemlaag; het achterliggende model en gebruikte tools komen daar nog bij.
Het verschil met de consumentenlancering is praktisch. De julirelease liet GPT-Live in ChatGPT al tegelijk luisteren en spreken; deze release maakt die architectuur beschikbaar voor eigen software, telefoonkoppelingen en workflows.
Eén model voor het gesprek
Veel voice agents koppelen spraakherkenning, een taalmodel en tekst-naar-spraak. Elke overdracht kan vertraging, timing of context kosten, vooral wanneer iemand zichzelf onderbreekt of midden in een antwoord van richting verandert. GPT-Live-1 verwerkt de inkomende en uitgaande audio in één model en kan daardoor blijven luisteren terwijl het spreekt.
OpenAI rapporteert in zijn eigen Full Duplex Bench een verbetering van 30 procentpunten tegenover GPT-Realtime-2.1. In een vroege evaluatie van taalapp Speak kwamen onderbrekingen bijna 80 procent minder vaak voor dan bij eerdere systemen die in vaste beurten werkten. Dat zijn leveranciersmetingen, maar ze raken precies het probleem dat een telefonische assistent in de praktijk maakt of breekt.

Achter de stem blijft werk draaien
In de API-bouwinstructies beschrijft OpenAI hoe GPT-Live een gesprek laat doorgaan terwijl een backendagent informatie zoekt, hulpmiddelen gebruikt en taken afrondt. De ontwikkelaar kiest dat achterliggende model, die agent of een eigen dienst los van de stemlaag. GPT-Live levert ook transcripties en antwoordtekst, ondersteunt turn detection en kan met WebRTC, WebSockets en telefonie via SIP worden verbonden.
Die scheiding bepaalt ook de verantwoordelijkheid. De eigen applicatie houdt de rechten, bevestigingen, privéfuncties en duurzame taakstatus in handen. Een onderbreking van het gesprek annuleert werk dat al bij de backend loopt niet automatisch. Voor een klantcontactproces betekent dat dat een assistent kan blijven praten, terwijl een orderstatus of planning op de achtergrond wordt opgehaald.
Twee kostenlagen
De prijspagina rekent GPT-Live-sessies per seconde af, zonder een lopende minuut naar boven af te ronden. Het tarief is $0,05 per minuut voor de front-end stemlaag. Een gesprek van twintig minuten komt daarmee rekenkundig uit op 1 dollar voor de stem, exclusief het backendmodel en eventuele tools.
De totale rekening hangt dus niet alleen af van het gekozen taalmodel. Ook de gespreksduur, wachttijd en de vraag welke taken naar de backend gaan, tellen mee. Dat maakt de indeling van een workflow onderdeel van de kostenberekening.
Van consumentenfunctie naar bouwsteen
OpenAI noemt telefonische reserveringen, bestellingen en klantenservice als toepassingsgebieden. Yelp gebruikt GPT-Live-1 in Host voor telefoongesprekken; Speak gebruikt het in live taallessen. De stap is daarmee groter dan een natuurlijker klinkende stem in een app: de gespreklaag wordt een inzetbare voorkant voor software die achter de schermen informatie ophaalt en acties uitvoert.
Voor Nederlandse organisaties ligt de betekenis in die combinatie. Een telefoonbot, een webgesprek en een interne assistent hoeven niet langer drie losse experimenten te zijn wanneer dezelfde gespreklaag aan verschillende backends kan worden gekoppeld. Spraak schuift daarmee op van interface naar workflowlaag, met de grens tussen praten, zoeken en handelen expliciet in het ontwerp.
Veelgestelde vragen
Van stem naar workflow
Ik denk mee over de juiste gespreklaag, ontwerp de workflow en bouw het geheel end-to-end, van eerste idee tot live product. Waar het kan lever ik self-hosted, zodat je controle houdt over je data en koppelingen.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
