DeepSeek heeft zijn V4-Flash-API in publieke beta gezet, met fors hogere scores op agent-taken, en meldt op dezelfde dag dat de tarieven tijdens piekuren binnenkort verdubbelen.
Dat tweede deel raakt je maandrekening harder dan het eerste. Een agentproces dat 50 miljoen invoer- en 10 miljoen uitvoertokens per maand verstookt, kost op V4-Flash 9,80 dollar. Datzelfde proces kost op GPT-5.6 Luna 22 dollar, op Terra 220 dollar en op Claude Opus 4.8 rond de 500 dollar. Maar de piekuren die DeepSeek noemt lopen dagelijks van 9:00 tot 12:00 en van 14:00 tot 18:00 Pekingtijd, en dat tweede blok valt in de Nederlandse zomertijd precies tussen 8:00 en 12:00 's ochtends. Je drukste werkuren worden je duurste.
Piektarief in je ochtend
Op de eigen prijspagina staat dat de API "binnenkort" overgaat op piek- en daltarieven, waarbij in de piekuren het dubbele geldt voor alle facturabele onderdelen. De ingangsdatum hangt nog van een officiële aankondiging af, dus vandaag betaal je nog het gewone tarief: 0,14 dollar per miljoen invoertokens bij een cachemisser en 0,28 dollar per miljoen uitvoertokens. Bij een cachetreffer zakt de invoer naar 0,0028 dollar, vijftig keer minder. Wie zijn systeemprompt en context stabiel houdt, drukt de rekening dus veel harder dan wie op de kale tokenprijs let.
Voor een Nederlands team betekent het aangekondigde piekvenster iets heel praktisch. Batchwerk dat geen haast heeft, nachtelijke verrijking, het bijwerken van een index, het doorrekenen van een archief, verhuist beter naar de middag of de avond. Interactief werk in de ochtend wordt straks twee keer zo duur, en dat is precies het verkeer dat je niet kunt uitstellen.

De sprong zit in agent-taken
De nieuwe versie heet DeepSeek-V4-Flash-0731 en houdt dezelfde architectuur en omvang als de preview. Alleen de natraining is opnieuw gedaan. Dat levert volgens DeepSeek 82,7 op Terminal Bench 2.1, 76,7 op Cybergym, 70,3 op Toolathlon verified, 54,4 op DeepSWE en 54,2 op NL2Repo. Twee interne testsets, DSBench-FullStack en DSBench-Hard, komen uit op 68,7 en 59,6.
Bij die cijfers hoort een voorbehoud dat DeepSeek er zelf bij zet. De code-agent-tests draaiden op een eigen harnas, DeepSeek Harness minimal mode, dat nog niet is uitgebracht, op de hoogste inspanningsstand met temperature 1,0. Een score uit een eigen harnas laat zich niet zomaar naast een score uit een publiek harnas leggen.
Even belangrijk is waar DeepSeek de vergelijking níet mee maakt. In de release zet het bedrijf de scores af tegen zijn eigen V4-Pro-Preview, niet tegen Claude Opus 4.8 of een ander westers topmodel. De vergelijking met Opus komt van buiten, niet van DeepSeek zelf. Op de onafhankelijke Intelligence Index van Artificial Analysis staat V4-Flash op 50 tegen 56 voor Claude Opus 4.8, bij een gemengde prijs van 0,06 tegen 3,85 dollar per miljoen tokens. Dicht in de buurt, niet gelijk, en een fractie van de prijs.
Technisch is er nog iets dat telt als je met agents werkt: V4-Flash ondersteunt nu native het Responses API-formaat en is aangepast voor Codex. Je kunt je bestaande agent-gereedschap er dus op richten zonder de aanroepen te herschrijven. V4-Pro krijgt die ondersteuning pas begin augustus. De limiet op gelijktijdige verzoeken ligt bij Flash op 2.500 tegen 500 bij Pro, wat het lichtere model juist voor parallelle agentwerkstromen aantrekkelijk maakt.
Naast de tarieven van OpenAI en Anthropic
De timing is opvallend. Eén dag eerder verlaagde OpenAI de API-prijs van GPT-5.6 Luna met 80 procent en die van Terra met 20 procent, waarmee Luna op 0,20 dollar invoer en 1,20 dollar uitvoer kwam. Anthropic rekent voor Claude Opus 4.8 onveranderd 5 dollar invoer en 25 dollar uitvoer, en het dubbele in fast mode.
Nikkei Asia plaatst de release in een wereldwijde prijsoorlog rond topmodellen die hierdoor verder oploopt. Die oorlog voert DeepSeek al langer op efficiëntie in plaats van op korting: eerder deze zomer gaf het bedrijf DSpark vrij, de open techniek die V4 tot 85 procent sneller laat antwoorden zonder kwaliteitsverlies. De piektarieven passen in datzelfde plaatje: niet de prijs verlagen, maar de vraag over de dag spreiden zodat de bestaande capaciteit verder reikt.
Eén ding hoort er wel bij. Wie zijn productie op een Chinees model zet, koopt naast een lage prijs ook regelgevende onzekerheid in, en die weegt in de modelkeuze mee naast de tokenprijs.
Waar de vergelijking kantelt
De interessante verschuiving zit niet in het cijfer op Terminal Bench, maar in wat er straks op je factuur staat. Zolang aanbieders één vast tarief per miljoen tokens hanteerden, was een modelvergelijking een simpele som. Met piek- en daltarieven, cachetreffers die vijftig keer schelen en fast modes tegen het dubbele tarief hangt de prijs van een taak ineens af van het uur waarop je hem draait en hoe je hem hebt opgebouwd.
Daarmee wordt het advies om modellen te vergelijken op kosten per taak in plaats van per token harder dan het was. Twee teams die exact hetzelfde model gebruiken kunnen straks een factor vier verschillen, puur door caching en planning. Dat is geen inkoopvraag meer, maar een ontwerpvraag.
Veelgestelde vragen
Kosten die je kunt sturen
Een tokenprijs die per uur verschilt maakt van modelkeuze een ontwerpvraag. Ik denk met je mee over de opzet, bouw de agents en koppelingen en richt caching en planning zo in dat je rekening voorspelbaar blijft, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
