Een presentator draagt een koptelefoon en gebruikt een microfoon naast een laptop in een studio
Nieuws9 oktober · 22:224 min leestijd

Cloudflare brengt Clef-omni uit voor audio en video

Cloudflare brengt Clef-omni uit als open-weight beslismodel voor tekst, beeld, audio en video. Dezelfde release verlaagt de prijs van Clef-flash en versnelt Clef, met duidelijke grenzen aan context en benchmarkbewijs.

Cloudflare brengt op 9 oktober via AI Gateway Clef-omni uit als open-weight beslismodel dat tekst, beeld, audio en video in één aanvraag verwerkt, en versnelt Clef en verlaagt de prijs van Clef-flash.

Voor teams die supportcalls, inspectiefoto’s en video-opnamen automatisch moeten beoordelen, kan één modelaanroep transcriptie- en beeldstappen bundelen. Bij honderd miljoen invoertokens per maand zakt de Clef-flash-rekening van $9 naar $3,80, terwijl de gehoste contextlimiet daalt van 64.000 naar 24.576 tokens.

Clef-omni geeft vaste beslissingen terug

Clef-omni scoort vooraf bepaalde opties en geeft per veld een waarschijnlijkheid terug. Vrije tekst genereert het niet. In Cloudflares onderhoudsvoorbeeld beoordeelt één aanvraag een apparaatfoto, geluidsopname en video op drie punten: is het typeplaatje zichtbaar, klinkt de machine normaal en draait de ventilator? Zo hoeven audio en videobeelden niet eerst apart te worden verwerkt.

Cloudflare toont het Clef-model met pictogrammen voor microfoon, beeld, video en tekst. Afbeelding: Cloudflare
Cloudflare toont het Clef-model met pictogrammen voor microfoon, beeld, video en tekst. Afbeelding: Cloudflare

Cloudflare meldt medianen van ongeveer 130 milliseconden voor tekst, 150 milliseconden voor beeld, enkele honderden milliseconden voor audio en 1,5 seconde voor een video van 21 seconden met geluid. De cijfers zeggen niets over de juistheid van de beslissing.

Clef-flash wordt goedkoper en Clef sneller

De prijsdaling van Clef-flash komt neer op bijna 58 procent. De gewone Clef kost $0,24 per miljoen invoertokens en Clef-omni $0,15. Ook de gewone Clef wordt sneller: bij 800, 3.400 en 16.000 invoertokens dalen de medianen van 262 naar 152, 616 naar 305 en 2.721 naar 1.635 milliseconden. De wachttijd op het 95e percentiel daalt van 438 naar 351, 777 naar 531 en 3.250 naar 1.805 milliseconden. De snellere afhandeling gebruikt SGLang in de serverinfrastructuur, zonder nieuwe modelgewichten.

De gehoste Clef-flash-variant heeft nu een venster van 24.576 tokens, tegenover 64.000 tokens die Cloudflare eerder voor deze variant noemde. De gewichten op Hugging Face zijn niet aangepast en zijn volgens het bedrijf getraind voor een context van 256.000 tokens wanneer een team de variant zelf host. Cloudflare meldt dat 0,24 procent van zijn verzoeken boven de nieuwe gehoste limiet uitkomt; teams met langere invoer kunnen de gewone Clef gebruiken, met een context van 64.000 tokens.

Bij Clef-omni tellen ook media mee in de invoerprijs. Cloudflares documentatie rekent audio op ongeveer 780 tokens per minuut en video op maximaal 15.400 tokens per minuut bij de hoogste resolutie, met extra tokens voor geluid. De dienst rekent geen uitvoertokens, omdat het model vaste beslissingen en kansen teruggeeft in plaats van een lang antwoord te schrijven. Clef-omni is beschikbaar via Workers AI voor $0,15 per miljoen invoertokens en met een contextvenster van 64.000 tokens; de model-ID is @cf/cloudflare/clef-omni. Een minuut videomateriaal kan daardoor veel zwaarder meetellen dan een tekstregel.

De release bouwt voort op de eerste Clef-modellen

Op 1 oktober publiceerde Cloudflare Clef en Clef-flash als open beslismodellen met gewichten en modelcode onder Apache 2.0. Clef richtte zich toen op tekst en beeld; de nieuwe variant voegt audio en video toe. Clef-omni gebruikt een Qwen3-Omni-basis met 30 miljard parameters, waarvan er volgens de modeldocumentatie 3 miljard per token actief zijn. De variant voegt een extra laag toe die opties voor vooraf bepaalde vragen scoort.

De modelkaart publiceert de Clef-omni-gewichten en bijbehorende code onder Apache 2.0. Die open licentie maakt eigen hosting mogelijk, maar verlaagt de hardware-eis niet: Cloudflare noemt ongeveer 64 gigabyte GPU-geheugen in bfloat16 en een H200 als de configuratie waarop het model is getest. De kaart zegt bovendien dat de oorspronkelijke Qwen-spraakuitvoergewichten wel in de bestanden zitten, maar niet worden gebruikt.

Dat verschilt van het bredere Qwen3-Omni-model, dat tekst, beeld, audio en video kan verwerken en tekst of spraak kan teruggeven. Cloudflare gebruikt dezelfde multimodale basis voor een smaller doel: een gestructureerde beslissing die software meteen kan verwerken, zonder gesproken antwoord.

Alibaba Cloud brengt Qwen3.8-Omni-Flash uit met een contextvenster van één miljoen tokens voor audiovisuele agenttaken. De Qwen-API biedt ook Europese beschikbaarheid en regiogebonden tarieven. De vergelijking laat vooral zien dat de modellen verschillende beperkingen oplossen: Cloudflare zet in op vaste beslisvelden en korte reactietijd, terwijl Qwen ruimte biedt voor veel langere invoer.

De benchmarks verschillen per taak

Naast reactietijdcijfers publiceert Cloudflare ook benchmarkresultaten. Op de factuurtaak haalt Clef-omni 60,2 procent op exact passende acties, tegenover 64,7 procent voor Clef en 61,8 procent voor Jev. Bij klantenservice komt Clef-flash op 77 procent, Clef-omni op 71,6 en Jev op 76 procent. De scores op de workflowtaken gebruiken volgens de modelkaart dezelfde datasetversie en casusgroep, met consensuslabels als referentie.

Dezelfde kaart noemt de bredere Decision Index een interne evaluatie. De referentielabels zijn gemiddelden van antwoorden van GPT-6.1 Astra en Claude Fable 5.1, beide op hoge redeneermodus, volgens TypeSafe. Dat maakt de scores vergelijkingen met een modelconsensus; de publicatie geeft geen aparte nauwkeurigheidsscores voor Nederlandse audio of afwijkende opnamen. Voor een team dat gesprekken of inspectievideo’s wil verwerken, blijft juist dat bewijs relevant: herkent het model de juiste signalen en houdt het fouten zichtbaar genoeg voor menselijke controle?

De keuze hangt af van invoer en gewenste uitkomst. Qwen biedt meer ruimte voor lange audiovisuele bronnen; Clef-omni geeft vaste beslissingen. Voor Nederlandse calls ontbreken scores over spraakherkenning, achtergrondgeluid en uitzonderingen. Die bepalen hoeveel transcriptie- en routeringsstappen een workflow kan schrappen.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Van invoer naar beslissing

Ik denk mee over waar een model in je proces past, ontwerp de route en realiseer die van integratie tot automatisering. Waar het kan bouw ik de oplossing self-hosted.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

Cloudflare publiceert Clef-modellen voor agentbesluiten
Nieuws
3 min

1 okt 18:38

Cloudflare publiceert Clef-modellen voor agentbesluiten

Clef en Clef-flash geven agenten gestructureerde classificaties met kansen. Cloudflare publiceert de modelgewichten en modelcode onder Apache 2.0, terwijl de RL-finetuning voorlopig een begeleide dienst is.

TypeSafe brengt Jev uit voor softwarebeslissingen
Nieuws
4 min

16 sep 13:03

TypeSafe brengt Jev uit voor softwarebeslissingen

TypeSafe lanceert Jev, een model dat software direct typed beslissingen geeft in plaats van tekst. De release belooft lagere kosten en milliseconde-latentie, maar is nog early access en steunt op eigen evaluaties.

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld
Inzicht
7 min

15 aug 17:00

Het gratis AI-model met een drempel is een prijskaartje dat later wordt ingevuld

Qwen, Kimi, Llama en Gemma zetten voorwaarden op je omzet, je gebruikersaantal en je merknaam. Een gratis model met een drempel is geen open source, maar een inkoopbeslissing die je vooruitschuift naar het moment dat je niet meer weg kunt.

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba
Nieuws
4 min

31 jul 16:38

Kimi K3 draait op 20.000 gehuurde Nvidia-chips van Alibaba

Moonshot draait Kimi K3 op ongeveer 20.000 Nvidia-chips die het huurt via Alibaba, meldt Bloomberg. De rekenkracht achter het goedkope open model is geleend, bij een partij die tegelijk aandeelhouder en concurrent is.

OpenAI opent Decisions API in publieke bèta
Nieuws
5 min

7 okt 18:13

OpenAI opent Decisions API in publieke bèta

OpenAI stelt de Decisions API open voor ontwikkelaars. De vaste antwoorden geven kansen, categorieën of scores; invoer kost $0,10 per miljoen tokens. De snelheidsclaim van ongeveer tien keer heeft geen gepubliceerde testopzet.

Aleph Alpha publiceert Kolibri met downloadbare gewichten
Nieuws
2 min

3 okt 18:45

Aleph Alpha publiceert Kolibri met downloadbare gewichten

Kolibri biedt een Europese route naar zelfhosting, maar vraagt 78 GB geheugen en minimaal twee A100-kaarten van 80 GB. De modelkaart noemt alleen Duits en Engels; Apache 2.0 dekt alleen gewichten en configuratie.