Grok 4.6 is uit en de focus ligt volledig op langlopende agents. Het nieuwste model van SpaceXAI, het vroegere xAI, blijft werken aan complexe taken over tientallen stappen. Denk aan een onbekend domein onderzoeken, een codebase doorgronden of een productidee omzetten in een werkende applicatie. Waar eerdere generaties vooral scoorden op losse antwoorden, zijn Grok 4.6 agents getraind om vol te houden. Een taak oppakken, eigen werk onderweg controleren en pas stoppen als het resultaat er staat. De resultaten zijn meetbaar en de prijsstelling maakt het aantrekkelijk voor ontwikkelaars en teams om het model serieus te testen.
Wat Grok 4.6 agents anders maakt
SpaceXAI gaf Grok 4.6 een langere aanvullende trainingsronde dan Grok 4.5. De data bevatte zorgvuldig geselecteerd, door het model zelf gegenereerd materiaal voor redeneren en geavanceerde technische concepten, aangevuld met hoogwaardige engineeringdata. Ook de optimizer en het trainingsrecept kregen een update. Dat leverde een sterkere basis op voor de fasen met supervised fine-tuning en reinforcement learning die daarna volgden.
Voor die fine-tuning gebruikte SpaceXAI Grok 4.5 om trainingstrajecten opnieuw te genereren over verschillende redeneerniveaus, agent harnesses en domeinen zoals STEM, software engineering en kenniswerk. Problematische trajecten werden eruit gefilterd met modelgebaseerde controles. De reinforcement learning draaide vervolgens om agentische omgevingen voor algemene coding, kerneloptimalisatie en webontwikkeling.
Het model werd beloond voor het afronden van de grotere taak. Een stukje code dat halverwege crasht leverde geen beloning op. Die aanpak zie je terug in het gedrag. Volgens SpaceXAI begon Grok 4.6 tijdens langere trajecten vaker te pauzeren om eigen werk te verifiëren voordat het doorging. Voor agents die urenlang zelfstandig draaien is dat cruciaal. Een model dat zijn output zelf toetst voorkomt dat kleine fouten opstapelen en resulteren in een onbruikbaar eindresultaat.
Ook visueel en interactieve taken werden beter.
Zo presteren Grok 4.6 agents op benchmarks
Op de Artificial Analysis Intelligence Index scoort Grok 4.6 een 61. Dat is vijf punten boven Grok 4.5 en exact gelijk aan GPT-5.6 Sol Max. Alleen Claude Opus 5 en Claude Fable 5 van Anthropic scoren hoger. De sterkste resultaten zitten in agentisch werk.
- GDPval-AA v2 meet realistisch agentisch kenniswerk. Grok 4.6 haalt een Elo van 1753, achter Claude Opus 5 en statistisch gelijk aan Fable 5 en Qwen3.8 Max.
- τ³-Banking test klantgesprekken over meerdere beurten met toolgebruik. Met 50.7% zit Grok 4.6 in de top twee, naast Qwen3.8 Max met 51.3%.
- Terminal-Bench v2.1 komt uit op 88.4%, gelijk aan de leidende modellen op terminaltaken.
- CursorBench v3.2 steeg van 66.7% naar 69.9%. Daarmee ligt Grok 4.6 voor op GPT-5.6 Sol Max met 67.2%, terwijl Fable 5 Max met 70.5% leidt.
- DeepSWE v1.1 sprong van 54% naar 65.9%. Sol Max en Fable 5 Max blijven met 73% en 70% voorop.
- APEX-Agents steeg met 10.4 punten naar 57.5%, net boven Sol Max met 56.7% en net onder Fable 5 Max met 59.2%.
- Harvey LAB bereikte 15.8%, tegen 12.9% voor Grok 4.5 en 2.5% voor GPT-5.6 Sol Max.
Waar de concurrentie nog voorligt
Terminal-Bench v3.0 blijft een lastige test voor Grok. De score verbeterde van 15.7% naar 26%, maar GPT-5.6 Sol Max en Fable 5 Max zitten op 34.6% en 34.1%. Ook op APEX-SWE behoudt Fable 5 Max met 58.8% een voorsprong op de 56.4% van Grok 4.6.
De sprong ten opzichte van Grok 4.5 is groot en consistent. De claim dat Grok 4.6 nu overal het beste codingmodel is, gaat verder dan wat de benchmarks tonen. Per test wisselt de winnaar en de verschillen hangen vaak samen met de meetomgeving. CursorBench draait bijvoorbeeld binnen een omgeving van Cursor, een partij die betrokken was bij de training van Grok. SpaceXAI merkt zelf op dat de scores van concurrenten uit eigen rapportages of publieke leaderboards komen, wat geen perfect gecontroleerde vergelijking oplevert.
Wat kost een agenttaak met Grok 4.6
De tokenprijzen van Grok 4.6 zijn ongewijzigd ten opzichte van Grok 4.5. Je betaalt $2 per miljoen input tokens en $6 per miljoen output tokens. Voor een snellere variant betaal je het dubbele. Cache hits kosten $0.50 per miljoen tokens. Let op bij lange prompts. Het context window telt 500.000 tokens, maar zodra een prompt de grens van 200.000 tokens bereikt, stijgen de tarieven naar $4, $1 en $12 voor alle tokens in dat verzoek.
Voor langlopende agents vormen tokenprijzen maar een beperkt deel van het verhaal. Een model met een lage tokenprijs kan duur uitvallen als het voortdurend tools aanroept, bestanden opnieuw inleest of taken herstart. De kost per afgeronde taak is de maatstaf die telt. Daar scoort Grok 4.6 sterk. Artificial Analysis plaatst het model op frontier niveau voor intelligentie tegenover kost per taak, met $0.84 per taak. De kosten liggen ruim 60% onder die van Claude Opus 5 en GPT-5.6 Sol.
Het efficiëntieprofiel is nog sterker. Op AA-Briefcase, een private benchmark voor langdurig professioneel kenniswerk, rondde Grok 4.6 taken af in gemiddeld 53 turns met ongeveer 0.5 miljard input tokens. Claude Opus 5 Max had voor vergelijkbaar werk 103 turns en 2 miljard input tokens nodig. Een model dat een gelijkwaardig antwoord bereikt in de helft van de turns en een kwart van de tokens heeft een kostenvoordeel.
Waar je Grok 4.6 agents inzet
Grok 4.6 is beschikbaar via de SpaceXAI API en via partners als OpenRouter, Vercel en Cloudflare. Voor direct gebruik zit het model in Grok Build, het SpaceXAI-antwoord op Claude Code en Codex, dat deel uitmaakt van het SuperGrok abonnement van $30 per maand. Ook Cursor, de codingomgeving die SpaceX onlangs overnam, draait op Grok 4.6. Tijdens de eerste week krijg je in beide tools twee keer zoveel gebruik.
De API ondersteunt function calling, structured outputs en reasoning, met tekst en beeld als input en tekst als output. De rate limits liggen op 150 requests per seconde en 50 miljoen tokens per minuut, met beschikbaarheid in us-east-1 en us-west-2.
Een dag voor deze release lanceerde SpaceXAI Grok Bot, een systeem waarmee je doorlopende taken toewijst aan persistente agents die als virtuele medewerkers functioneren. Samen met Grok Build en de Cursor-integratie wordt duidelijk waar SpaceXAI heen wil. Het bedrijf bouwt de infrastructuur die langlopende agents in productie nodig hebben, met Grok 4.6 als motor en de tools eromheen om die agents te laten draaien.
Aandachtspunten voor zakelijk gebruik
Het Grok-merk heeft een zichtbare geschiedenis van veiligheidsincidenten, van ongepaste output in 2025 tot lopende onderzoeken van Britse en Europese toezichthouders naar beeldgeneratie op X. Er zijn geen aanwijzingen dat Grok 4.6 die incidenten herhaalt. Toch beoordelen procurementteams een model zelden los van de leverancier. Voor gereguleerde sectoren tellen governance, auditbaarheid en reputatierisico mee in de keuze.
SpaceXAI stelt dat de safeguards van Grok 4.6 verbeterd en gekalibreerd zijn op de capaciteiten van het model, met de breedste reeks tests voorafgaand aan uitrol tot nu toe en uitgebreide tests door derden daarna. Of dat voldoende is voor jouw organisatie hangt af van je compliance-eisen en van hoe klantgericht de toepassing is.
Ook de efficiëntiecijfers vragen nuance. De turns en tokens uit gecontroleerde benchmarks bewijzen nog niets voor jouw productieomgeving. Agentkosten hangen sterk af van harness design, prompts, tool calls, caching en retries. De echte test is hoe Grok 4.6 presteert op jouw eigen workflows.
De factuur wordt de echte benchmark
Grok 4.6 levert frontier intelligentie voor langlopende agents tegen een agressieve prijs, met de grootste winst op precies de langere taken waar agents het vaakst laten afweten. De leaderboardpositie is een handig startpunt voor je shortlist. Het oordeel dat telt komt uit je eigen cijfers. Meet turns, tokens en doorlooptijd per afgeronde taak in jouw eigen omgeving en vergelijk die met je huidige model.