DeepSeek heeft V4-Flash-Vision-Exp live gezet, een experimenteel model dat afbeeldingen leest voor exact het tarief van V4-Flash, en claimt dat het op multimodale agenttaken dicht bij Claude Opus 4.8 komt.
Voor een bedrijf dat facturen, bonnen, formulieren of schermafbeeldingen door een model haalt, verandert vooral de rekensom. Elke afbeelding kost maximaal 384 invoertokens, en invoer staat buiten de piekuren op 0,22 dollar per miljoen tokens bij een cachemisser. Tienduizend gescande pagina's komen daarmee op ongeveer 85 dollarcent aan beeldtokens, plus wat je prompt en het antwoord kosten. Dat invoertarief ligt ruim twintig keer onder de 5 dollar per miljoen invoertokens die Anthropic voor Opus 4.8 rekent, het model waar DeepSeek zich mee vergelijkt.
Wat 384 tokens per afbeelding wel en niet aankan
Die bovengrens is geen prijsafspraak maar een verwerkingsregel. Voor de inferentie wordt elke afbeelding herschaald: alles onder ongeveer 384 bij 384 pixels gaat omhoog, alles daarboven terug naar ongeveer het pixelaantal van een afbeelding van 800 bij 800. Een scan van 2000 bij 2000 en een van 5000 bij 5000 kosten daardoor precies evenveel, en leveren precies evenveel detail. Op een dichtbedrukte pakbon, een A4 met kleine lettertjes of een tabel met zes decimalen is dat de plek waar het misgaat.
De rest van de limieten is ruim. Er mogen 600 afbeeldingen mee in één verzoek, tot 8192 pixels per zijde, wat zakt naar 4096 zodra je er vijftien of meer meestuurt. De tegelijk gelanceerde Files API is gratis: je uploadt een afbeelding één keer en verwijst daarna naar het file_id, zodat dezelfde scan niet bij elke vervolgvraag opnieuw over de lijn gaat.
Een generiek visiemodel vertelt je alleen niet hoe zeker het ergens van is. Mistral OCR 4 geeft per pagina en per woord een betrouwbaarheidsscore, waarmee je hoge zekerheid automatisch doorzet en twijfelgevallen naar een mens routeert. Dat signaal levert een vision-endpoint niet, dus wie hierop een factuur-inbox bouwt die zichzelf uitleest moet de controlelaag zelf blijven bouwen.
De vergelijking met Opus komt van DeepSeek zelf

Op de eigen tabel scoort V4-Flash-Vision-Exp 36,5 op ApexBench (pass@1) tegen 39,4 voor Opus-4.8, 27,3 tegen 25,7 op Agents' Last Exam, 64,3 tegen 65,0 op Chartography en 35,0 tegen 34,0 op ZeroBench (pass@5). Op tekst blijft het in de buurt van het gewone V4-Flash, met 83,9 op Terminal Bench 2.1 tegen 82,7, maar tegen Opus zakt het weg op de zwaarste taken: 57,7 tegen 69,7 op NL2Repo en 63,6 tegen 71,7 op DSBench-Hard.
Twee voetnoten onder die tabel bepalen hoeveel de cijfers waard zijn. De DeepSeek-modellen draaiden op de tekstbenchmarks in DeepSeeks eigen harnas, in minimal mode met top_p 0,95 en temperature 1,0, en bij de Opus-kolom staat die vermelding niet. En op ApexBench en Agents' Last Exam negeert het tekstmodel V4-Flash de multimodale onderdelen, wat de sprong van 26,2 naar 36,5 deels verklaart. Een onafhankelijke meting van dit model is er nog niet.
Alleen via de API, en dus alleen bij DeepSeek
Wat er niet bij zit, weegt net zo zwaar. Er staan geen gewichten van dit visiemodel onder deepseek-ai op Hugging Face; de nieuwste uploads daar zijn de tekstmodellen V4-Pro-0813 en V4-Flash-0731. Open documentherkenning publiceert DeepSeek wel, DeepSeek-OCR-2 staat er sinds eind januari en is ruim 1,3 miljoen keer opgehaald, maar dat is een ander model met een andere taak. Wie dit model wil gebruiken, stuurt zijn afbeeldingen naar een Chinese API. Bij loonstroken, paspoortkopieën of medische formulieren is dat een verwerkersvraag die je vóór de proefopstelling beantwoordt, niet erna.
De koppeling met eigen gereedschap is wel geregeld: het model werkt op Chat Completions, Messages en Responses, en DeepSeek Harness 0.1.1 ondersteunt het meteen. Dat agentharnas dat DeepSeek in augustus 2026 onder de MIT-licentie op GitHub zette draait op je eigen machine en laat je een eigen basis-URL invullen, maar zonder gewichten komt de vision-aanroep hoe dan ook bij DeepSeek zelf uit.
En dan is er de klok. Het piekvenster dat DeepSeek eind juli aankondigde staat inmiddels gewoon op de prijspagina: piekuren zijn 01:00 tot 04:00 en 06:00 tot 10:00 UTC, oftewel 03:00 tot 06:00 en 08:00 tot 12:00 Nederlandse zomertijd. In dat tweede blok verdubbelt alles, ook je beeldtokens. Een stapel scans die 's nachts wordt verwerkt kost de helft van dezelfde stapel om tien uur 's ochtends.
De release komt terwijl DeepSeek zich voorbereidt op een beursgang op het Chinese vasteland, met een beoogde aanvraag in 2026 en een notering in 2027. Dat verklaart het tempo, en het verklaart ook waarom een model met de status "experimenteel" gewoon in productie wordt gezet.
De keuze die hiermee verschuift, is niet welk model het beste kijkt. Vorig jaar liep de scheidslijn tussen een duur westers model dat afbeeldingen begrijpt en een goedkoop Chinees model dat alleen tekst leest. Nu kijken ze allebei, scheelt het invoertarief een factor twintig, en zit het verschil vooral in waar je documenten terechtkomen en of iemand anders de scores ooit heeft nagemeten. Daarmee wordt de vraag welk deel van je documentstroom gevoelig is en welk deel niet, de duurste beslissing in de hele keten.
Veelgestelde vragen
Documentstroom slim inrichten
Een goedkoop visiemodel is pas winst als de route eromheen klopt: welke documenten waarheen, welke controle waar, en wat je binnenshuis houdt. Ik denk mee over die keuze, ontwerp de stroom en bouw en automatiseer hem tot en met de koppeling met je boekhouding, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
