Op 13 augustus 2026 heeft DeepSeek de algemene release van DeepSeek-V4-Pro aangekondigd. Het krachtigste model uit de V4-reeks draait nu volledig in de app en op het web via de Expert Mode, en is ook beschikbaar via de API. De release notes beloven flinke verbeteringen voor agentworkflows, instelbare redeneerinspanningen en native ondersteuning voor de OpenAI Responses API. Tegelijk kondigt DeepSeek een nieuw prijsmodel aan met piek- en daltarieven.

Wat is er nieuw in DeepSeek V4-Pro

De zwaarste upgrades zitten in het agentic gedrag. Volgens DeepSeek levert V4-Pro duidelijke winst in echte productieomgevingen, waar modellen meerdere stappen achter elkaar moeten plannen en uitvoeren.

Er is nu native ondersteuning voor de OpenAI Responses API.  Dezeis geoptimaliseerd voor Codex en laat zich met één klik instellen, zodat je het model zonder aanpassingen in bestaande OpenAI-tooling kan gebruikten.

Wie de API al gebruikt, hoeft niets aan te passen. De modelnamen blijven ongewijzigd en de bestaande setup werkt gewoon door. In de app en op het web activeer je V4-Pro via de Expert Mode.

Drie standen voor reasoning effort

V4-Pro en V4-Flash krijgen allebei een instelbare reasoning effort. Je bepaalt daarmee hoe diep het model nadenkt voordat het antwoordt:

  • Low voor eenvoudige taken en snelle, intuïtieve antwoorden.
  • High voor dagelijkse agentworkflows en routinematige beslissingen met weinig risico.
  • Max voor complexe problemen, planning en taken waarbij je de grenzen van het redeneervermogen verkent.

De max-stand werkt met een speciale systeemprompt en levert een samenvatting van het denkproces. OpenRouter noemt die hoogste stand xhigh en mapt die direct op de maximale redeneermodus.

Die keuze heeft invloed op kosten en wachttijd. Meer denkwerk betekent meer gegenereerde tokens. Tijdens de Intelligence Index-evaluatie van Artificial Analysis produceerde V4-Pro in max-stand ongeveer 130 miljoen outputtokens, terwijl de mediaan voor vergelijkbare modellen op 100 miljoen ligt. Het model denkt dus relatief uitvoerig na. Voor simpele vragen is de lage stand vrijwel altijd de verstandige keuze. De maximale stand reserveer je voor complexe problemen.

De architectuur achter V4-Pro

V4-Pro is een mixture of experts-model met 1,6 biljoen parameters, waarvan er per token 49 miljard actief zijn. Dat actieve deel bepaalt de snelheid en de kosten per verzoek, terwijl het volledige gewicht van 1,6 biljoen parameters zorgt voor de kennisdichtheid.

De grootste efficiëntieslag zit in de aandachtslaag. DeepSeek combineert Compressed Sparse Attention met Heavily Compressed Attention in één hybride systeem. Bij een context van 1 miljoen tokens verbruikt V4-Pro daardoor slechts 27 procent van de rekenkracht per token en 10 procent van de KV cache in vergelijking met DeepSeek-V3.2. Die cache is bij lange documenten en RAG-workflows normaal gesproken de duurste component, dus deze reductie maakt contexten van een miljoen tokens praktisch inzetbaar.

Daarnaast versterken Manifold-Constrained Hyper-Connections de residuverbindingen tussen lagen, wat het signaal stabieler houdt zonder aan expressiviteit in te boeten. De training gebruikte de Muon-optimizer voor snellere convergentie. Beide V4-modellen zijn getraind op meer dan 32 biljoen tokens. De post-training volgde twee fasen: eerst werden domeinspecifieke experts afzonderlijk ontwikkeld met supervised fine-tuning en reinforcement learning via GRPO, waarna on-policy distillation al die vaardigheden samenbracht in één geconsolideerd model.

Benchmarks en snelheid

Op de Intelligence Index van Artificial Analysis scoort V4-Pro in max-stand 53 punten, ruim boven de mediaan van 27 voor open modellen van vergelijkbare omvang. Op de eigen modelkaart meldt DeepSeek onder andere:

  • 90,1 procent op GPQA Diamond
  • 80,6 procent op SWE-bench Verified
  • 55,4 procent op SWE-bench Pro
  • 92,6 procent op GSM8K

Volgens DeepSeek is V4-Pro-Max daarmee het sterkste model met open gewichten van dit moment. Vooral op coding presteert het op topniveau, terwijl de kloof met gesloten modellen op redeneer- en agenttaken flink kleiner wordt.

Ook de snelheid valt positief uit. Via de eigen API genereert het model 80,8 tokens per seconde, tegen een mediaan van 66 in zijn klasse. De tijd tot het eerste token bedraagt 1,85 seconden. Het context window van 1 miljoen tokens komt overeen met ongeveer 1500 pagina’s tekst. Het model werkt volledig met tekst, zowel aan de invoer- als aan de uitvoerkant.

Nieuwe API-prijzen met piek- en daltarief

Samen met de V4-reeks voert DeepSeek tijdsafhankelijke tarieven in. Buiten de piekuren betaal je 50 procent minder dan tijdens de piek. De nieuwe prijzen gaan in op 16 augustus 2026 om 16:00 UTC.

De huidige tarieven voor V4-Pro liggen op 1,32 dollar per miljoen inputtokens en 3,96 dollar per miljoen outputtokens. Voor open modellen van deze omvang is dat aan de hoge kant. De medianen liggen op 0,57 en 2,20 dollar. Je betaalt dus meer, maar krijgt volgens de Intelligence Index ook aantoonbaar meer intelligentie per verzoek. Met een gemengde verhouding van cache hits, input en output komt de effectieve prijs uit op ongeveer 0,69 dollar per miljoen tokens.

Het daltarief beloont wie plant. Zware batchtaken zoals het analyseren van complete codebases of het synthetiseren van grote documenthoeveelheden kun je in de daluren draaien voor de halve prijs. Juist die workloads profiteren ook het meest van het enorme context window.

DeepSeek V4-Flash als lichter alternatief

Naast de Pro verschijnt V4-Flash, met 284 miljard parameters waarvan 13 miljard actief. Het model deelt de hybride aandachtsarchitectuur en de drie redeneerstanden met de Pro-versie. Met een ruim denkbudget haalt Flash volgens DeepSeek vergelijkbare redeneerprestaties. Door de kleinere omvang blijft het iets achter bij pure kennistaken en de meest veeleisende agentworkflows. Voor veel dagelijkse toepassingen is Flash daarmee de efficiëntere keuze.

Open gewichten en zelf hosten

Beide modellen verschijnen onder de MIT-licentie met publiek downloadbare gewichten, dus commercieel gebruik en self-hosting zijn toegestaan. Voor lokale deployment adviseert DeepSeek een temperatuur van 1.0 en een top_p van 1.0. Draai je de maximale redeneermodus, dan is een context window van minstens 384K tokens aan te raden. Een klassiek Jinja chat template zit er niet bij. De encoding-map in de repository bevat Python-scripts en testcases die laten zien hoe je berichten in OpenAI-formaat voor het model codeert en de tekstoutput weer ontleedt.

Het tijdstip telt

V4-Pro is een forse update, maar het prijsmodel is de grote verrassing. Tijdsafhankelijke tarieven kennen we van energiecontracten en spotinstances in de cloud. Nu dus ook voor een taalmodel op frontierniveau. Daarmee worden na redeneerinspanning, tijdstip een nieuwe parameters als je prompt. Wie batchwerk in de daluren plant en de redeneerstand afstemt op de taak, haalt uit eenzelfde budget meer denkwerk en output.