DeepSeek-V4-Flash is op 31 juli 2026 officieel uitgebracht. Het model combineert een contextvenster van 1 miljoen tokens met een architectuur die per token slechts 13 miljard parameters activeert, terwijl de totale omvang 284 miljard parameters bedraagt. Daardoor krijg je een model dat op veel taken meedraait met de grotere DeepSeek-V4-Pro, maar met kortere reactietijden en aanzienlijk lagere kosten. In dit artikel lees je wat de architectuur zo efficiënt maakt, hoe het model scoort in benchmarks, wat de API kost en hoe je migreert of zelf host.
Wat is DeepSeek-V4-Flash precies
DeepSeek-V4-Flash is het snelle en economische lid van de V4-familie, naast de zwaardere DeepSeek-V4-Pro met 1,6 biljoen parameters waarvan 49 miljard actief. Beide modellen gebruiken een Mixture-of-Experts-architectuur, waarbij het model per token alleen de meest relevante experts activeert. Bij Flash blijft dat beperkt tot 13 miljard actieve parameters, wat de inferentie flink versnelt zonder dat de kwaliteit veel slechter wordt.
Het contextvenster van 1 miljoen tokens komt overeen met ongeveer 1500 pagina’s tekst. Dat maakt het model geschikt voor het analyseren van complete codebases, lange contracten of uitgebreide documentatiesets in één request. De contextlengte van 1 miljoen tokens is inmiddels de standaard voor alle officiële DeepSeek-diensten. Het model verwerkt uitsluitend tekst, zowel als input als output, en is niet multimodaal.
De gewichten zijn openbaar beschikbaar onder de MIT-licentie, wat commercieel gebruik en self-hosting toestaat. Je gebruikt het model via de chat-interface in de Instant Mode of via de API onder de naam deepseek-v4-flash.
De efficiënte architectuur achter het contextvenster
Het bijzondere van de V4-serie zit in de hybride aandachtslaag. DeepSeek combineert Compressed Sparse Attention met Heavily Compressed Attention om lange contexten bruikbaar te maken. In een setting met 1 miljoen tokens heeft DeepSeek-V4-Pro nog maar 27 procent van de rekenkracht per token nodig en 10 procent van het KV-cachegeheugen vergeleken met DeepSeek-V3.2. Diezelfde efficiëntiewinst geldt voor de Flash-variant.
Daarnaast introduceert de serie Manifold-Constrained-Hyper-Connections, een techniek die de klassieke residuale verbindingen versterkt. De signaaloverdracht tussen lagen wordt stabieler zonder dat de expressiviteit van het model afneemt. Voor de training gebruikte DeepSeek de Muon-optimizer, die zorgt voor snellere convergentie en een stabieler trainingsproces.
Beide modellen zijn getraind op meer dan 32 biljard tokens. De post-training volgt een tweestapsaanpak. Eerst worden domeinspecifieke experts onafhankelijk getraind via supervised fine-tuning en reinforcement learning met GRPO. Daarna worden al die expertisegebieden via on-policy distillatie samengevoegd tot één coherent model. Het resultaat is een model dat zowel kan coderen als redeneren en agents kan aansturen.
Benchmarks en redeneervermogen van DeepSeek-V4-Flash
Op de Artificial Analysis Intelligence Index scoort de reasoning-versie van DeepSeek-V4-Flash een 50, terwijl de mediaan van vergelijkbare open-weight modellen op 25 ligt. Het model is daarmee ruim bovengemiddeld intelligent voor zijn klasse. Wel valt op dat het model erg breedsprakig is: tijdens de evaluatie genereerde het 210 miljoen tokens, tegenover een mediaan van 100 miljoen. Die uitgebreide redeneerketens leveren betere antwoorden op, maar tellen ook mee in je tokenverbruik.
Op individuele benchmarks presteert het model sterk, met onder meer 79 procent op SWE-bench Verified, 88,1 op GPQA Diamond en 86,4 op MMLU-Pro. De grootste sprong maakt de officiële 0731-release op agentic taken. Waar de preview nog 61,8 scoorde op Terminal Bench 2.1 en 7,3 op DeepSWE, komt de definitieve versie uit op 82,7 en 54,4. Op elke agentic benchmark die DeepSeek publiceerde verslaat Flash zelfs de grotere V4-Pro uit de previewfase, ondanks het veel kleinere aantal actieve parameters.
Met een ruim redeneerbudget nadert Flash-Max het redeneervermogen van de Pro-versie. Op pure kennistaken en de meest complexe agentic workflows blijft de kleinere parameterschaal wel merkbaar. In de praktijk werkt het model naadloos samen met AI-agents zoals Claude Code, OpenClaw en OpenCode. DeepSeek zet het zelf al in voor eigen agentic coding.
Drie redeneermodi voor elke workload
DeepSeek-V4-Flash ondersteunt drie redeneerniveaus. De officiële release noemt ze low, high en max. De lage modus geeft snelle, intuïtieve antwoorden voor dagelijkse taken en beslissingen met weinig risico. De hoge modus schakelt expliciete chain-of-thought in voor logische analyse en planning. De maximale modus duwt het redeneervermogen tot het uiterste en is bedoeld voor problemen aan de grens van wat het model kan.
Voor de maximale modus adviseert DeepSeek een contextvenster van minimaal 384.000 tokens, anders loop je kans dat redeneerketens worden afgekapt. Als samplingparameters geldt temperature 1,0 als uitgangspunt, met top_p op 1,0 voor algemeen gebruik en 0,95 voor agentic scenario’s. Op de high en max niveaus moet je rekening houden met lange outputs van mogelijk honderdduizenden tokens.
API-prijzen en de verplichte migratie
De prijsstelling maakt DeepSeek-V4-Flash extra aantrekkelijk. Input kost 0,14 dollar per miljoen tokens en output 0,28 dollar, terwijl de medianen voor vergelijkbare modellen respectievelijk rond de 0,43 en 1,20 dollar liggen. Bij een gemengde workload met veel cache-hits komt de effectieve prijs uit rond de 0,06 dollar per miljoen tokens.
Wie de API al gebruikt, moet wel opletten. Sinds 24 juli 2026 zijn de oude modelnamen deepseek-chat en deepseek-reasoner definitief uitgeschakeld. Requests naar die aliassen leveren nu HTTP-fouten op. De migratie is gelukkig eenvoudig: de base URL blijft gelijk en je past alleen de modelparameter aan naar deepseek-v4-flash of deepseek-v4-pro. De API blijft compatibel met zowel de OpenAI ChatCompletions-structuur als de Anthropic API. Kies Flash voor chat, extractie, classificatie en andere volumewerkzaamheden, en reserveer Pro voor zware redeneertaken en langere contexten waar de kwaliteit de meerprijs rechtvaardigt.
DeepSeek heeft een piektarief aangekondigd dat gekoppeld zou worden aan kantooruren in Beijing, maar dat tarief is op dit moment niet actief. Er is geen percentage en geen startdatum gepubliceerd en de officiële tariefkaart kent nog één vaste prijs per model. Je hoeft batchtaken dus nog niet te verplaatsen. Het is wel verstandig om per request de timestamp, het model en het aantal tokens te loggen, zodat je kosten direct kunt uitsplitsen zodra een piektarief alsnog wordt ingevoerd.
Zelf hosten met vLLM en DSpark
Voor self-hosting zijn er vier checkpoints beschikbaar. De officiële 0731-release is de standaardkeuze. Daarnaast bestaan de originele preview-gewichten, een NVFP4-variant die Nvidia heeft geherkwantiseerd voor Blackwell-GPU’s en een DSpark-variant met een geïntegreerde module voor speculative decoding. De checkpoints met draftmodule nemen circa 167 GB in beslag, de rest ongeveer 160 GB.
Serving vereist vLLM 0.25.0 of nieuwer; voor DSpark op ROCm-hardware heb je versie 0.26.0 nodig. Eén aandachtspunt: de repositories bevatten geen Jinja-chattemplate. DeepSeek levert in plaats daarvan een encoding-map met Python-scripts, en vLLM kan via de tokenizer-mode deepseek_v4 de ingebouwde codering toepassen zodat het OpenAI-compatibele endpoint gewoon werkt.
Qua hardware past een replica exact op een GB200 NVL4-tray, terwijl je op H200- of B200-nodes met vier GPU’s per replica werkt. Op een DGX Station draait het model zelfs op één GPU, al is dan alleen een context van 4000 tokens geverifieerd en is de maximale redeneermodus niet beschikbaar.
Een nieuwe standaard voor prijs en prestatie
DeepSeek-V4-Flash laat zien dat de concurrentie in AI zich verplaatst van pure parameters naar efficiëntie. Met 13 miljard actieve parameters, een tiende van het vroegere KV-cacheverbruik en prijzen die een fractie zijn van de marktmedianen, lever je met dit model vrijwel geen kwaliteit in op dagelijkse en agentic workloads. De les voor teams die modellen kiezen is daarbij breder dan dit model alleen: kijk niet alleen naar de prijs per token, maar ook naar hoe breedsprakig een reasoning-model is. Een model dat tweemaal zoveel tokens genereert per taak kan ondanks een lage tariefprijs alsnog duurder uitvallen dan je verwacht.