Qwen3.8-Omni-Flash maakt audio- en video-agents goedkoper en direct via een API inzetbaar, met een contextvenster van één miljoen tokens en prestaties dicht bij Gemini 3.8 Flash, meldt The Decoder.
Voor een Nederlands team dat audio, video of lange dossiers in een agentworkflow wil verwerken, verandert de rekensom: multimodale invoer hoeft niet meer langs losse transcriptie-, beeld- en videostappen voordat een model ermee kan werken. Eén API kan de bron analyseren, een antwoord formuleren en via functieaanroepen een vervolgstap starten.
Eén model voor audio en video
Alibaba Cloud beschrijft Qwen3.8-Omni-Flash als een model voor tekst, afbeeldingen, audio en video met tekst als uitvoer. De officiële Model Studio-documentatie noemt een contextlengte van één miljoen tokens, Chat Completions en Responses, functieaanroepen en web search. Het model is beschikbaar in onder meer Frankfurt, zodat een Europees team de API vanuit een Europese regio kan aanroepen.
De release is gericht op audio- en videobegrip, vergadersamenvattingen en contentanalyse. Alibaba noemt ook ondersteuning voor 113 talen en dialecten bij audio-invoer. Voor video accepteert het model bestanden tot twee uur en maximaal 64 bestanden per aanvraag via openbare URL's. Dat maakt een opname, productvideo of verzameling klantgesprekken geschikt als invoer voor dezelfde modelaanroep, zonder dat de applicatie voor elk medium een ander model hoeft te kiezen.
De prijs verschilt per regio
De prijstabel van Alibaba Cloud vermeldt voor de internationale tabel in Singapore 0,15 dollar per miljoen invoertokens en 0,47 dollar per miljoen uitvoertokens. De tabel voor Duitsland, met Frankfurt als regio, noemt 0,113 dollar voor invoer en 0,382 dollar voor uitvoer. Gecachete invoer staat daar op 0,014 dollar per miljoen tokens.
The Decoder noemt ook Qwens schatting dat een uur audio minder dan 0,01 dollar aan invoer kost. Een video van 720p met audio en één beeldframe per seconde komt volgens die vergelijking uit op ongeveer 0,20 dollar aan invoer, exclusief de respons. Dat zijn geen vaste kosten per bestand: de uiteindelijke rekening hangt af van de tokenomrekening per medium en van de hoeveelheid tekst die het model terugstuurt.
Dicht bij Gemini, maar niet overal
De onafhankelijke vergelijking van The Decoder zet de cijfers uit Qwens eigen benchmarkgrafiek naast Gemini 3.8 Flash. Qwen staat op WildClawBench-MM op 71,0 tegenover 58,9 voor Gemini, en op UniClawBench op 69,6 tegenover 69,0. Op OmniVideoBench ligt Gemini met 65,2 boven Qwen met 63,4, terwijl Qwen op LongAudioSpan met 82,7 boven Gemini met 79,3 uitkomt. De grafiek is dus geen onafhankelijke herhaling van alle tests, maar wel een concretere vergelijking dan de claim dat modellen simpelweg gelijk presteren.
Aan de prijszijde is het verschil groter. Google vraagt voor Gemini 3.8 Flash voorlopig 0,75 dollar per miljoen invoertokens en 3,75 dollar per miljoen uitvoertokens. Die introductieprijs vervalt op 31 december 2026; vanaf 1 januari 2027 worden dat 1,50 en 7,50 dollar, zoals Google in de eigen aankondiging vastlegt. De tarieven zijn niet volledig één-op-één vergelijkbaar, omdat audio en video bij elk platform anders in tokens worden omgerekend.
Geen nieuwe open-weightsrelease
Deze release is ook iets anders dan Qwen3.8-Flash-Next, waarvan Alibaba eind augustus de gewichten vrijgaf. Flash-Next was een open model voor wie zelf infrastructuur wil beheren; Omni-Flash wordt hier gedocumenteerd als een multimodale API-dienst voor analyse en agenttaken. Dat verschil bepaalt de keuze: het eerste model brengt hardware en licentievoorwaarden mee, het tweede vooral een verbruikstarief en afhankelijkheid van de API.
Qwen3.8-Omni-Flash brengt daardoor drie beslissingen bij elkaar: welke media een agent moet begrijpen, hoeveel context een taak nodig heeft en welke prijs per verwerking past. De benchmarkcijfers blijven leverancierscijfers, maar de combinatie van één miljoen tokens, gereedschapsgebruik en een prijs onder Gemini maakt multimodale modelkeuze concreter voor teams die audio en video nu nog als aparte verwerkingsketens behandelen.
Veelgestelde vragen
Multimodale AI inzetten
Ik denk mee over de juiste modelkeuze, ontwerp de koppeling en bouw de hele workflow van idee tot live product. Waar dat kan houd ik de oplossing self-hosted en automatiseer ik het werk end-to-end.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
