Alibaba heeft videomodel Wan3.0 maandag officieel uitgebracht, een model dat clips van dertig seconden maakt uit documenten, spreadsheets, presentaties en webpagina's, meldt Reuters. Het draait alleen via de API van Alibaba Cloud; de gewichten publiceert het bedrijf niet.
Voor een marketing- of contentteam dat AI-video inkoopt verschuift daarmee de rekensom, niet de afhankelijkheid. Alibaba rekent 0,05 dollar per seconde voor 480p, 0,10 dollar voor 720p en 0,20 dollar voor 1080p. Dertig seconden in 1080p kost dus ongeveer zes dollar. Bij Google kost diezelfde halve minuut op Veo 3.1 Standard 0,40 dollar per seconde, twaalf dollar in totaal. Het lichtste model van diezelfde familie, Veo 3.1 Lite, zit op 0,08 dollar per seconde in 1080p en duikt er juist weer onder. Goedkoper dan het topmodel van Google, duurder dan de instapvariant.
Van vijftien naar dertig seconden
Voorganger Wan2.7-Video kwam niet verder dan clips van vijftien seconden. Wan3.0 verdubbelt dat binnen één generatie, stelt zelf een lengte voor op basis van je prompt en kan een bestaande clip verlengen. Bewerken hoeft niet meer via een volledige hergeneratie: beeld, verhaallijn en dialoog zijn achteraf aan te passen.
Het echte verschil zit aan de invoerkant. Naast tekst, beeld, geluid en video leest het model nu doc, xls, ppt, pdf, txt en md, plus de Apple-formaten key, pages en numbers. De limiet is één bestand of link per aanvraag, maximaal 100 MB en 50 pagina's. Een productpresentatie wordt zo een merkfilm, een trainingsdeck een videocursus en een tabel een geanimeerde grafiek.
Alibaba zegt dat het model sinds de publieke bèta van 6 augustus is ingezet voor korte drama's en filmproductie, reclame en marketing, toerismepromotie en videoclips. Alle uitspraken over kwaliteit komen uit die eigen aankondiging. Onafhankelijke benchmarkcijfers voor Wan3.0 zijn er nog niet.

De gewichten blijven dicht
Op Hugging Face staat in de organisatie van het Wan-team geen enkel Wan3.0-model. Het nieuwste dat daar gepubliceerd is, is Wan2.2-Animate-2-14B van 6 augustus. De GitHub-organisatie Wan-Video heeft evenmin een Wan3.0-repository. De laatste open generatie van de lijn blijft Wan2.2, dat onder Apache 2.0 te downloaden is.
Bij de taalmodellen doet Alibaba precies het omgekeerde. Qwen3.8-27B verscheen deze maand onder een onveranderde Apache 2.0-licentie zonder omzetdrempel, in het formaat dat op één videokaart past. Tekst open, video dicht. Voor wie zelf wil hosten is dat het onderscheid dat telt.
Waar je bestanden landen
De API-documentatie noemt twee endpoints voor wan3.0-video: Singapore en Peking. Model Studio heeft daarnaast een regio Frankfurt waar de inferentie binnen de EU blijft, maar het videomodel staat daar niet bij, en een aanroep die regio's kruist mislukt volgens diezelfde documentatie.
Daarmee wordt de invoerkant meteen een afweging. Een merkpresentatie of een klantrapport als bron betekent dat dit bestand naar een server in Singapore of China gaat. Voor promotiemateriaal is dat zelden een probleem. Voor een deck met omzetcijfers, offertes of persoonsgegevens is het een vraag die je vooraf beantwoordt.
Een prijs met een tijdvenster
Van 24 augustus tot 23 september geldt op Alibaba's eigen platforms een tijdelijke korting van 30 procent op de API-prijs. Wie nu een proefproductie doet, meet dus een prijs die over een maand weer omhoog gaat. Reken de kosten van een reeks clips door op het volle tarief voordat je een werkstroom eromheen bouwt.
De andere videolijn van het concern staat hier los van. Happy Horse 1.1 kwam in juni via fal.ai uit op 0,14 tot 0,18 dollar per videoseconde en komt uit een ander lab binnen Alibaba. Wan3.0 is een nieuwer en volledig ander model.
Twee lijnen, één rekensom
De lancering kwam een dag na de plaatsing van 710 miljoen nieuwe aandelen voor 10,2 miljard dollar, waarvan de volledige opbrengst naar de AI-stack gaat. Capaciteit die met extern kapitaal is gebouwd moet ergens een teller vinden, en een videomodel dat per seconde afrekent telt directer dan een gratis download op Hugging Face.
De sprong naar dertig seconden is daarbij geen unicum. ByteDance liet in juni al Seedance 2.5 een clip van dertig seconden in één take genereren. Wat Wan3.0 toevoegt zit aan de voorkant: het materiaal dat al in je mappen staat wordt de bron van de video. En juist dat maakt de vraag waar dat materiaal naartoe reist de belangrijkste die je over dit model stelt.
Veelgestelde vragen
Van je eigen bestanden naar video
Een videomodel dat presentaties en rapporten inleest is pas nuttig als het aan je bronmateriaal hangt en iemand heeft nagedacht over waar die bestanden landen. Ik denk mee over die keuze, ontwerp de werkstroom en bouw hem ook, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
