Mistral Large 4 is het grootste model dat Mistral AI ooit trainde, en het eerste waarmee een Europees lab opnieuw meedoet in de bovenste regionen van open weights AI. Het Franse bedrijf lanceerde een public preview via de API in Mistral Studio. De weights volgen eind oktober. Intern heet het model ML4, of met een knipoog le Chonk. Wat dit model interessant maakt, zijn vooral de keuzes rond cybersecurity, soevereine infrastructuur en controle over je eigen AI, naast de benchmarkcijfers zelf.
Wat zit er onder de motorkap van Mistral Large 4?
Mistral Large 4 is een mixture of experts model met 1 biljoen parameters, waarvan er per token 49 miljard actief zijn. Ter vergelijking: Mistral Large 3 telde 675 miljard parameters met 41 miljard actieve. Het model combineert instruction following, reasoning en agentic capabilities in één systeem. Een apart reasoning model naast een chatmodel is dus overbodig.
- Multimodaal: tekst en afbeeldingen als input, tekst als output.
- Context window: 512K tokens, met maximaal 256K output tokens.
- Tool calling en structured outputs worden standaard ondersteund.
- Meertalig: een groot deel van de trainingsdata besloeg meer dan 160 talen, inclusief alle officiële talen van de Europese Unie.
- Afbeeldingen per request: de API accepteert er nu 100, tegenover 8 bij eerdere Mistral modellen.
Mistral trainde het model volledig opnieuw op 3.800 NVIDIA Grace Blackwell GPU’s in eigen datacenters in Europa. De preview draait op diezelfde infrastructuur. Voor organisaties die waarde hechten aan juridische controle over hun data biedt Mistral een Europese deployment die het bedrijf zelf beheert, onafhankelijk van andere digitale dienstverleners en onder Europees recht.
Cybersecurity als speerpunt
Op geen enkel domein legt Mistral zoveel nadruk als op cybersecurity. Op de Artificial Analysis Cyber Index, een onafhankelijke test die meet hoe goed modellen beveiligingslekken in echte software vinden en dichten, scoort de preview 50. Daarmee staat het gelijk met GLM-5.3-Flash en achter MiMo-V2.6-Pro, dat 56 haalt. Volgens Mistral hoort ML4 daarmee bij de vijf beste modellen wereldwijd en leidt het met ruime voorsprong onder open weights modellen van buiten China.
Het opvallendste resultaat komt van CyberGym, waar een model een bestaande kwetsbaarheid in open source software moet vinden en daarna patchen. ML4 haalt daar 82 procent, de hoogste score van alle geteste modellen. Daarnaast lost het 93 procent op van Cybench, een reeks van 40 opdrachten uit securitycompetities.
Waarom refusals een veiligheidsrisico kunnen zijn
Mistral wijst op een opmerkelijk detail. Claude Opus 5.5 en GPT-6 Astra scoren bijna nul op diezelfde CyberGym test, omdat ze weigeren de taak uit te voeren. Wie software verdedigt, moet vaak eerst aantonen dat een lek echt bestaat. Safety filters blokkeren precies dat soort werk, terwijl aanvallers diezelfde gesloten modellen steeds vaker jailbreaken. Een security team dat midden in een incident de toegang tot een tool verliest, loopt bovendien een extra risico.
Met open weights en self deployment kun je het model op een private cloud of op eigen servers draaien, volgens je eigen beleid. In interne tests bleek ML4 ook bruikbaar voor taken waarop het niet expliciet getraind werd, zoals malware analyseren, kwetsbaarheden prioriteren en detectieregels schrijven.
Opvallend is dat het model tegelijk vaker kwaadaardige cybervragen weigert dan elk ander open source model, gemeten over JailbreakBench, StrongREJECT en AgentHarm. Op Lakera’s B3 AI Security Benchmark weerstaat het 93,3 procent van de aanvallen via indirect prompt injection. Op de KORA Benchmark voor verantwoord gedrag tegenover gebruikers haalt het 1,691 op een maximum van 2.
Voor het vrijgeven van de weights test Mistral het model nog via red teaming in de praktijk, samen met cybersecurity experten, geselecteerde partners en overheidsinstanties. Zij krijgen toegang tot een versie met minder moderatie en uitgebreidere cyberfuncties.
Coding en agents in de praktijk
Voor developers zijn de coding resultaten degelijk zonder de absolute top te halen. ML4 scoort 61,7 procent op DeepSWE v1.1, 59,4 procent op SWE-Atlas-QnA en 28,3 procent op Terminal-Bench 4. De gecombineerde Coding Agent Index komt uit op 49,8 procent, net boven DeepSeek V4 Pro en Qwen3.8 Max.
Interessanter is een blinde evaluatie met Surge AI, waarin professionele annotators code beoordeelden zonder te weten welk model ze voor zich hadden. ML4 eindigde tweede van vijf met 3,74 op 5, voor Kimi K3 en GLM-5.3. Alleen Claude Opus 5 deed met 4,22 duidelijk beter.
Voor agents die zelfstandig workflows afwerken, behaalt ML4 59,9 procent op AutomationBench. Die test bevat 657 zakelijke workflows in tools als Gmail, Google Sheets, Slack en Salesforce. Op AA-Briefcase, dat langlopend kenniswerk met spreadsheets, slides en PDF’s meet, haalt het een Elo van 1.393.
Vision, wetenschap en professioneel werk
Op het vlak van beeldbegrip zet Mistral een grote stap. Het model redeneert over complexe documenten, grafieken en foto’s en combineert visual grounding met agentic gedrag. Concreet kan het inzoomen op gigapixel satellietbeelden om rampenbestrijders sneller te laten handelen, of technische tekeningen controleren tot een onderdeel exact klopt. Op Dense 200 scoort het 42 procent, net boven GPT-6 Astra met 41 procent. Op GDP.pdf haalt het 19 procent, een verbetering van 18 punten tegenover Mistral Large 3.
Voor onderzoekers is ML4 de beste open weights optie op SciCode-Verified, een benchmark voor wetenschappelijke workflows in code. Mistral demonstreert hoe het model in één keer een volledige Hartree-Fock simulatie genereert, een chemische berekening die uit een reeks geavanceerde stappen bestaat.
In de juridische en financiële sector presteert het eveneens sterk. Externe evaluaties door vals.ai tonen dat ML4 GPT-6 Astra overtreft op representatieve juridische en financiële taken. Op Harvey’s Legal Agent Benchmark verslaat het alle open source modellen.
Wat kost Mistral Large 4?
Hier zit het belangrijkste minpunt. De standaardprijs bedraagt $1,36 per miljoen input tokens en $4,18 per miljoen output tokens, met $0,14 voor cached input. De eerste twee weken geldt een lanceringskorting van 50 procent.
Artificial Analysis rekende uit dat één taak uit de Intelligence Index $1,13 kost. Met korting zakt dat naar $0,57, nog altijd meer dan het dubbele van GLM-5.3-Flash met $0,25 en DeepSeek V4.1 Flash met $0,27. Die modellen leveren vergelijkbare intelligentie. Op de Intelligence Index haalt ML4 38, op het niveau van GPT-6 Luna en net onder DeepSeek V4.1 Flash met 39. Dat maakt Mistral Large 4 het slimste model van buiten de VS en China, voor landen als Zuid-Korea en de Verenigde Arabische Emiraten.
Wie puur op prijs per taak selecteert, vindt dus goedkopere alternatieven. Maar die goedkopere alternatieven bieden geen juridische controle en Europese hosting.
Reinforcement learning op schaal
Mistral benadrukt dat de preview nog in volle training zit. Het bedrijf gebruikt reinforcement learning, waarbij het model leert van de uitkomsten van zijn eigen pogingen en de taken moeilijker worden naarmate het sterker wordt. Eén trainingsrun op ongeveer 3.000 GPU’s produceert zo’n 33 miljard tokens per dag, waarvan na filtering ongeveer 16 miljard bruikbaar zijn voor training.
De RL library combineert in één run uiteenlopende taken, van eenvoudige chat en wetenschappelijke problemen tot safety alignment en langlopend toolgebruik. Volgens Mistral vertoont het model nog geen tekenen van verzadiging. Dezelfde trainingsomgeving biedt het bedrijf aan klanten aan via Mistral Forge.
ML4 is de eerste mijlpaal van de roadmap die gefinancierd wordt met een Series D van 3 miljard euro, de grootste kapitaalronde ooit voor een Europees technologiebedrijf. Dat geld gaat grotendeels naar extra rekenkracht in eigen Europese datacenters. Het model wordt ook de basis voor een nieuwe generatie gespecialiseerde Mistral modellen.
Een preview om in de gaten te houden
Mistral Large 4 sluit de kloof met de beste Chinese open weights modellen nog niet volledig, en de prijs per taak ligt voorlopig hoog. Toch ligt de echte test eind oktober, wanneer de weights vrijkomen. Pas dan kan de community het model zelf hosten, quantizen en finetunen, en zal blijken of de kostprijs op eigen hardware concurrentieel is. Wij zijn vooral benieuwd of het model beter schrijft in het Nederlands.