Studiomicrofoon en koptelefoon naast een scherm met audiogolven
Nieuws10 september · 22:294 min leestijd

OpenAI brengt GPT-Live-1 naar de API

OpenAI maakt GPT-Live-1 beschikbaar via de API. Ontwikkelaars kunnen nu full-duplex spraakagents bouwen voor klantcontact en telefonie, met een stemlaag van $0,05 per minuut en een backend die los kan redeneren en tools gebruiken.

OpenAI brengt GPT-Live-1 op 10 september naar zijn API, meldt het bedrijf, zodat ontwikkelaars full-duplex spraakagents kunnen bouwen die tegelijk luisteren en spreken voor klantcontact en telefonie.

Voor een Nederlandse ondernemer verschuift daarmee de technische keuze. Wie reserveringen, afspraken of support via telefoon automatiseert, krijgt een gespreklaag die minder afhankelijk is van korte stiltes en vaste beurten. De prijs ligt op $0,05 per minuut voor de stemlaag; het achterliggende model en gebruikte tools komen daar nog bij.

Het verschil met de consumentenlancering is praktisch. De julirelease liet GPT-Live in ChatGPT al tegelijk luisteren en spreken; deze release maakt die architectuur beschikbaar voor eigen software, telefoonkoppelingen en workflows.

Eén model voor het gesprek

Veel voice agents koppelen spraakherkenning, een taalmodel en tekst-naar-spraak. Elke overdracht kan vertraging, timing of context kosten, vooral wanneer iemand zichzelf onderbreekt of midden in een antwoord van richting verandert. GPT-Live-1 verwerkt de inkomende en uitgaande audio in één model en kan daardoor blijven luisteren terwijl het spreekt.

OpenAI rapporteert in zijn eigen Full Duplex Bench een verbetering van 30 procentpunten tegenover GPT-Realtime-2.1. In een vroege evaluatie van taalapp Speak kwamen onderbrekingen bijna 80 procent minder vaak voor dan bij eerdere systemen die in vaste beurten werkten. Dat zijn leveranciersmetingen, maar ze raken precies het probleem dat een telefonische assistent in de praktijk maakt of breekt.

Yelp Host toont een gesproken restaurantreservering, bron van OpenAI en Yelp
Yelp Host toont een gesproken restaurantreservering, bron van OpenAI en Yelp

Achter de stem blijft werk draaien

In de API-bouwinstructies beschrijft OpenAI hoe GPT-Live een gesprek laat doorgaan terwijl een backendagent informatie zoekt, hulpmiddelen gebruikt en taken afrondt. De ontwikkelaar kiest dat achterliggende model, die agent of een eigen dienst los van de stemlaag. GPT-Live levert ook transcripties en antwoordtekst, ondersteunt turn detection en kan met WebRTC, WebSockets en telefonie via SIP worden verbonden.

Die scheiding bepaalt ook de verantwoordelijkheid. De eigen applicatie houdt de rechten, bevestigingen, privéfuncties en duurzame taakstatus in handen. Een onderbreking van het gesprek annuleert werk dat al bij de backend loopt niet automatisch. Voor een klantcontactproces betekent dat dat een assistent kan blijven praten, terwijl een orderstatus of planning op de achtergrond wordt opgehaald.

Twee kostenlagen

De prijspagina rekent GPT-Live-sessies per seconde af, zonder een lopende minuut naar boven af te ronden. Het tarief is $0,05 per minuut voor de front-end stemlaag. Een gesprek van twintig minuten komt daarmee rekenkundig uit op 1 dollar voor de stem, exclusief het backendmodel en eventuele tools.

De totale rekening hangt dus niet alleen af van het gekozen taalmodel. Ook de gespreksduur, wachttijd en de vraag welke taken naar de backend gaan, tellen mee. Dat maakt de indeling van een workflow onderdeel van de kostenberekening.

Van consumentenfunctie naar bouwsteen

OpenAI noemt telefonische reserveringen, bestellingen en klantenservice als toepassingsgebieden. Yelp gebruikt GPT-Live-1 in Host voor telefoongesprekken; Speak gebruikt het in live taallessen. De stap is daarmee groter dan een natuurlijker klinkende stem in een app: de gespreklaag wordt een inzetbare voorkant voor software die achter de schermen informatie ophaalt en acties uitvoert.

Voor Nederlandse organisaties ligt de betekenis in die combinatie. Een telefoonbot, een webgesprek en een interne assistent hoeven niet langer drie losse experimenten te zijn wanneer dezelfde gespreklaag aan verschillende backends kan worden gekoppeld. Spraak schuift daarmee op van interface naar workflowlaag, met de grens tussen praten, zoeken en handelen expliciet in het ontwerp.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van stem naar workflow

Ik denk mee over de juiste gespreklaag, ontwerp de workflow en bouw het geheel end-to-end, van eerste idee tot live product. Waar het kan lever ik self-hosted, zodat je controle houdt over je data en koppelingen.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Verken verder

In dit artikel

Concepten

API-integratieKostenstructuurSpraakherkenningKostenberekeningBackendintegratieFull-duplex audioverwerkingFull-duplex spraakagentsWorkflowlaag

Gerelateerde artikelen

OpenAI brengt spraakbediening naar Codex in de ChatGPT-desktopapp
Nieuws
4 min

24 jul 00:22

OpenAI brengt spraakbediening naar Codex in de ChatGPT-desktopapp

OpenAI brengt ChatGPT Voice naar de desktop-app voor macOS en Windows. Ontwikkelaars sturen Codex en ChatGPT Work nu handsfree met hun stem aan: taken starten, agents checken en vervolgopdrachten geven. De functie is algemeen beschikbaar, niet langer preview.

OpenAI lanceert GPT-Live: spraakmodel dat tegelijk praat en luistert
Nieuws
4 min

8 jul 20:25

OpenAI lanceert GPT-Live: spraakmodel dat tegelijk praat en luistert

OpenAI rolt GPT-Live wereldwijd uit, een spraakmodel dat tegelijk luistert en praat. Voor bedrijven die AI inzetten voor telefonisch klantcontact of live vertaling verdwijnt de stroeve wachtbeurt, al komt de API voor eigen systemen pas binnenkort.

Hassabis steunt Amodei’s koers voor tragere frontier-AI
Nieuws
4 minBijgewerkt om 14:39

13 sep 08:10

Hassabis steunt Amodei’s koers voor tragere frontier-AI

Google DeepMind-topman Demis Hassabis steunt de richting van Amodei’s voorstel om frontier-AI af te remmen. Zijn steun verbreedt de leveranciers- en governancecontext voor Nederlandse organisaties die op frontier-modellen bouwen.

OpenAI brengt Data Agent naar ChatGPT Work voor bedrijfsdata
Nieuws
4 min

11 sep 18:20

OpenAI brengt Data Agent naar ChatGPT Work voor bedrijfsdata

OpenAI brengt Data Agent naar ChatGPT Work. De plugin analyseert bedrijfsdata, maakt interactieve dashboards en voert goedgekeurde acties uit. Connectoren, bedrijfsdefinities en toegangsrechten bepalen hoe bruikbaar de uitkomst wordt voor Nederlandse teams.

OpenAI lanceert ChatGPT for Financial Services
Nieuws
4 min

10 sep 20:27

OpenAI lanceert ChatGPT for Financial Services

OpenAI koppelt GPT-6 Astra aan ingebouwde financiële data, bronverwijzingen en sjablonen voor research, modellen en pitchbooks. De toegang blijft voorlopig beperkt tot in aanmerking komende financiële instellingen.

Amazon brengt ChatGPT Ads naar zijn DSP
Nieuws
3 min

10 sep 16:15

Amazon brengt ChatGPT Ads naar zijn DSP

Amazon koppelt zijn DSP aan ChatGPT Ads. De pilot laat geselecteerde Amerikaanse merken campagnes inkopen via Amazon, terwijl OpenAI bepaalt welke advertenties onder ChatGPT-antwoorden verschijnen. Voor Nederlandse adverteerders is dit vooral een nieuwe distributielaag.