Qwen breidt Audio 3.1 uit tot vijf modellen en noemt maximaal 95 procent korting op ASR, met opties voor transcriptie, spraaksynthese en realtimegesprekken, meldt het bedrijf op 23 september.
Voor Nederlandse teams die gesprekken uitwerken, klantcontact automatiseren of audio produceren, verandert het aanbod aan API-bouwstenen en aangekondigde tarieven. De zakelijke rekensom hangt af van de taak, de factuurmethode en de regio waar het model draait.

Drie spraakfuncties, vijf modellen
Qwen vernieuwt drie bestaande onderdelen: automatische spraakherkenning (ASR), tekst-naar-spraak (TTS) en realtime spraak. Twee varianten zijn nieuw, ASR-Next en TTS-Next. De gewone ASR haalt vulwoorden en herhalingen uit transcripties. ASR-Next kan sprekers uit elkaar houden, tijdcodes toevoegen en emoties, omgevingsgeluid en machinegeluid herkennen. Dat geeft teams extra context bij het uitwerken van klantgesprekken, vergaderingen en geluidsarchieven.
Bij TTS kan een tekstinstructie de uitspraak, emotie en snelheid sturen; Qwen zegt ook stemoverdracht tussen talen te ondersteunen. TTS-Next maakt in één aanvraag spraak, geluidseffecten en achtergrondgeluid. De productdocumentatie noemt Chinees en Engels en maximaal vier minuten podcastaudio per aanvraag, dus Nederlandse stemuitvoer is voor deze variant nog niet bevestigd.
De realtimevariant kan tegelijk luisteren en spreken, is tussentijds te onderbreken en past volgens Qwen het tempo aan wanneer het model een lage stemming herkent. De releasepagina zet Realtime Plus onder de internationale Singapore-regio.
Audio 3.1 is een specialistische spraaklijn naast andere Qwen-diensten. Qwen3.8-Omni-Flash verwerkt tekst, beeld, audio en video in één API met een contextvenster van één miljoen tokens en richt zich op bredere multimodale analyse. Voor gesproken vertaling is er Qwen3.8-LiveTranslate, dat volgens Qwen 60 talen begrijpt en 29 talen kan uitspreken, met 2,3 seconden gemiddelde achterstand. Audio 3.1 bundelt transcriptie, spraakgeneratie en realtimegesprekken.
De korting kent geen vaste rekensom
Qwen noemt prijsdalingen van ongeveer 70 procent voor TTS, 85 procent voor realtime en maximaal 95 procent voor ASR. De aankondiging geeft geen vergelijkbare prijs vóór en na de wijziging. De internationale ASR 3.1-tarieven staan op 0,15 dollar per miljoen invoertokens en 0,47 dollar per miljoen uitvoertokens.
De oudere ASR 3.0-prijslijst voor Singapore rekende per seconde audio: 0,000035 dollar voor bestandstranscriptie en 0,00009 dollar voor streaming, volgens de tarieftabel van Model Studio. Omdat de nieuwe en oude eenheden verschillen, valt de korting van maximaal 95 procent niet rechtstreeks om te zetten naar de maandrekening van ieder bedrijf. Daarvoor tellen onder meer de tokenomzetting en het gekozen model mee.
De volledige lijn is niet in Frankfurt bevestigd
De geraadpleegde modelpagina's bevestigen geen Frankfurt-regio voor de volledige Audio 3.1-lijn. De ASR-pagina toont prijsregio's in Beijing en Singapore; de releasepagina zet Realtime Plus in Singapore voor internationale aanroepen. De TTS-Next-pagina toont tarieven voor Beijing. Daarmee staat nog niet vast dat alle vijf modellen vanuit Frankfurt kunnen worden aangeroepen of dat verwerking in de EU plaatsvindt.
Zonder een gelijke prijsgrondslag en een bevestigde Europese regio blijft de korting voor Nederlandse bedrijven een aankondiging, geen begrotingspost.
Veelgestelde vragen
Van stemmodel naar toepassing
Ik help je spraak-AI van eerste ontwerp tot werkende toepassing te brengen, met koppelingen en automatisering waar dat past. Waar het kan, draait de oplossing self-hosted.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
