Twee ontwikkelaars werken aan laptops en een groot computerscherm in een kantoor
Nieuws19 september · 18:214 min leestijd

Qwen3.8-Omni-Flash maakt audio- en video-agents goedkoper

Qwen3.8-Omni-Flash brengt audio en video samen met een miljoen-tokencontext, toolgebruik en een goedkope API. De release maakt multimodale agents voor Nederlandse teams toegankelijker, maar benchmarkcijfers komen uit leveranciersmetingen.

Qwen3.8-Omni-Flash maakt audio- en video-agents goedkoper en direct via een API inzetbaar, met een contextvenster van één miljoen tokens en prestaties dicht bij Gemini 3.8 Flash, meldt The Decoder.

Voor een Nederlands team dat audio, video of lange dossiers in een agentworkflow wil verwerken, verandert de rekensom: multimodale invoer hoeft niet meer langs losse transcriptie-, beeld- en videostappen voordat een model ermee kan werken. Eén API kan de bron analyseren, een antwoord formuleren en via functieaanroepen een vervolgstap starten.

Eén model voor audio en video

Alibaba Cloud beschrijft Qwen3.8-Omni-Flash als een model voor tekst, afbeeldingen, audio en video met tekst als uitvoer. De officiële Model Studio-documentatie noemt een contextlengte van één miljoen tokens, Chat Completions en Responses, functieaanroepen en web search. Het model is beschikbaar in onder meer Frankfurt, zodat een Europees team de API vanuit een Europese regio kan aanroepen.

De release is gericht op audio- en videobegrip, vergadersamenvattingen en contentanalyse. Alibaba noemt ook ondersteuning voor 113 talen en dialecten bij audio-invoer. Voor video accepteert het model bestanden tot twee uur en maximaal 64 bestanden per aanvraag via openbare URL's. Dat maakt een opname, productvideo of verzameling klantgesprekken geschikt als invoer voor dezelfde modelaanroep, zonder dat de applicatie voor elk medium een ander model hoeft te kiezen.

De prijs verschilt per regio

De prijstabel van Alibaba Cloud vermeldt voor de internationale tabel in Singapore 0,15 dollar per miljoen invoertokens en 0,47 dollar per miljoen uitvoertokens. De tabel voor Duitsland, met Frankfurt als regio, noemt 0,113 dollar voor invoer en 0,382 dollar voor uitvoer. Gecachete invoer staat daar op 0,014 dollar per miljoen tokens.

The Decoder noemt ook Qwens schatting dat een uur audio minder dan 0,01 dollar aan invoer kost. Een video van 720p met audio en één beeldframe per seconde komt volgens die vergelijking uit op ongeveer 0,20 dollar aan invoer, exclusief de respons. Dat zijn geen vaste kosten per bestand: de uiteindelijke rekening hangt af van de tokenomrekening per medium en van de hoeveelheid tekst die het model terugstuurt.

Dicht bij Gemini, maar niet overal

De onafhankelijke vergelijking van The Decoder zet de cijfers uit Qwens eigen benchmarkgrafiek naast Gemini 3.8 Flash. Qwen staat op WildClawBench-MM op 71,0 tegenover 58,9 voor Gemini, en op UniClawBench op 69,6 tegenover 69,0. Op OmniVideoBench ligt Gemini met 65,2 boven Qwen met 63,4, terwijl Qwen op LongAudioSpan met 82,7 boven Gemini met 79,3 uitkomt. De grafiek is dus geen onafhankelijke herhaling van alle tests, maar wel een concretere vergelijking dan de claim dat modellen simpelweg gelijk presteren.

Aan de prijszijde is het verschil groter. Google vraagt voor Gemini 3.8 Flash voorlopig 0,75 dollar per miljoen invoertokens en 3,75 dollar per miljoen uitvoertokens. Die introductieprijs vervalt op 31 december 2026; vanaf 1 januari 2027 worden dat 1,50 en 7,50 dollar, zoals Google in de eigen aankondiging vastlegt. De tarieven zijn niet volledig één-op-één vergelijkbaar, omdat audio en video bij elk platform anders in tokens worden omgerekend.

Geen nieuwe open-weightsrelease

Deze release is ook iets anders dan Qwen3.8-Flash-Next, waarvan Alibaba eind augustus de gewichten vrijgaf. Flash-Next was een open model voor wie zelf infrastructuur wil beheren; Omni-Flash wordt hier gedocumenteerd als een multimodale API-dienst voor analyse en agenttaken. Dat verschil bepaalt de keuze: het eerste model brengt hardware en licentievoorwaarden mee, het tweede vooral een verbruikstarief en afhankelijkheid van de API.

Qwen3.8-Omni-Flash brengt daardoor drie beslissingen bij elkaar: welke media een agent moet begrijpen, hoeveel context een taak nodig heeft en welke prijs per verwerking past. De benchmarkcijfers blijven leverancierscijfers, maar de combinatie van één miljoen tokens, gereedschapsgebruik en een prijs onder Gemini maakt multimodale modelkeuze concreter voor teams die audio en video nu nog als aparte verwerkingsketens behandelen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Multimodale AI inzetten

Ik denk mee over de juiste modelkeuze, ontwerp de koppeling en bouw de hele workflow van idee tot live product. Waar dat kan houd ik de oplossing self-hosted en automatiseer ik het werk end-to-end.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Alibaba scherpt Qwen3.8-Max aan voor code en houdt de prijs gelijk
Nieuws
4

3 sep 04:34

Alibaba scherpt Qwen3.8-Max aan voor code en houdt de prijs gelijk

Alibaba brengt Qwen3.8-Max-0902 uit, een codeversie van zijn topmodel tegen ongewijzigde tarieven van 2 en 6 dollar per miljoen tokens. De geclaimde eerste plek op Arena hield precies één dag stand.

Alibaba lanceert videomodel Wan3.0 zonder open gewichten
Nieuws
3 min

24 aug 16:24

Alibaba lanceert videomodel Wan3.0 zonder open gewichten

Alibaba bracht Wan3.0 uit, een videomodel dat clips van dertig seconden maakt uit documenten en presentaties. De prijs begint bij vijf dollarcent per seconde, maar de gewichten blijven dicht en de API draait alleen in Singapore en Peking.

Gesanctioneerd Inspur blijft Nvidia-topchips krijgen via Amerikaanse dochter
Nieuws
4

6 sep 12:07

Gesanctioneerd Inspur blijft Nvidia-topchips krijgen via Amerikaanse dochter

Inspur staat sinds maart 2023 op de Amerikaanse Entity List en bleef via zijn Amerikaanse dochter Aivres Nvidia-topchips ontvangen. De regel die dat gat moest dichten ligt stil tot 10 november 2026.

G42 overweegt Amerikaans meerderheidsbelang om AI-chips te blijven kopen
Nieuws
4

4 sep 16:21

G42 overweegt Amerikaans meerderheidsbelang om AI-chips te blijven kopen

G42 voerde verkennende gesprekken over een Amerikaanse meerderheidsaandeelhouder. Reden: de Amerikaanse machtiging om zonder vergunning AI-chips te kopen loopt op 6 april 2027 af, terwijl acht Amerikaanse AI-bedrijven wel onbeperkt op dezelfde lijst staan.

Google lanceert Gemini 3.8 Flash tegen dezelfde tokenprijs
Nieuws
5 min

2 sep 20:08

Google lanceert Gemini 3.8 Flash tegen dezelfde tokenprijs

Google brengt Gemini 3.8 Flash uit tegen exact dezelfde tokenprijs als 3.7 Flash. Het model scoort hoger op vrijwel elke benchmark, maar verbruikt meer tokens per taak, waardoor de rekening per opdracht juist oploopt.

Google laat Gemini zelf door video zoeken en bespaart tot 88 procent tokens
Nieuws
4 min

2 sep 12:19

Google laat Gemini zelf door video zoeken en bespaart tot 88 procent tokens

Gemini 3.7 Flash, 3.6 Flash en 3.5 Flash-Lite kiezen voortaan zelf welke videofragmenten ze bekijken. Google meet tot 88 procent minder tokens en tot 66 procent lagere analysekosten per vraag.