Google heeft op 30 september Gemini 4 Argon voorgesteld, het eerste frontier model van het bedrijf in meer dan zeven maanden. Argon is gebouwd voor lange, complexe taken in software engineering, juridisch en financieel kenniswerk en cybersecurity. Voorlopig kun je het model zelf nog niet gebruiken. Google geeft het eerst aan een selecte groep cyber defenders via het Fairwind Program.

Wat is Gemini 4 Argon?

Gemini 4 Argon is de opvolger van Gemini 3.1 Pro en de 3.8 Flash modellen. Google slaat daarbij de eerder aangekondigde Gemini 3.5 volledig over. Het model accepteert tekst, beeld, video en audio als input en geeft tekst terug. De context window bedraagt 1 miljoen tokens.

De opvallendste technische wijziging zit aan de outputkant. Waar de vorige generatie stopte bij 64.000 output tokens, kan Argon tot 1 miljoen tokens genereren in één antwoord. Dat is ongeveer vijftien keer meer. Volgens Google krijgt het model zo de ruimte om honderdduizenden tokens lang te redeneren en een moeilijk probleem in één keer op te lossen. Om time-outs te vermijden voegt Google de functie Long Decode Continuation toe aan de Gemini API. Die pauzeert lange antwoorden en laat ze verdergaan via vervolgverzoeken.

Hoe Google Argon intern al inzet

De meest concrete voorbeelden komen uit Google zelf, waar duizenden medewerkers het model al gebruiken. Vier projecten springen eruit.

  • Quantum computing: Argon optimaliseerde subroutines die belangrijke quantumtoepassingen afremmen en verbeterde de gepubliceerde baseline binnen enkele minuten met 40%.
  • Geheugen in datacenters: een team van Argon agents analyseerde profiling telemetrie en paste zelfstandig optimalisaties toe. Na uitrol komt zo meer dan 300 TiB geheugen vrij, met een geschatte totale besparing tussen 500 TiB en 1 PiB.
  • Migratie naar Rust: agents herschrijven C en C++ codebases naar Rust, van bibliotheken zoals re2 tot meer dan 800.000 regels voor de Fuchsia Zircon kernel. Die code wordt nog uitgebreid geaudit en draait niet in productie.
  • Videodecoder libgav1: Argon verving 32.000 regels SIMD code door veilige Rust die de compiler automatisch vectoriseert. De decoder draait 2,7 keer sneller dan de bestaande Rust port, met identieke output.

Deze resultaten zijn indrukwekkend, maar ze zijn ook allemaal door Google zelf gerapporteerd. Welke baseline bij het quantumproject hoort en of die 300 TiB al effectief vrijgekomen is, vermeldt de aankondiging niet.

Benchmarks van Gemini 4 Argon, sterk in kenniswerk

Google vergelijkt Argon met GPT-6 Astra, Claude Fable 5.1 en Claude Opus 5.5 op achttien benchmarks. Argon wint er twaalf, deelt op één de eerste plaats en verliest er vijf. Een kritische analyse van analist PK Sharma wijst erop dat Google negen van die achttien scores zelf berekende en dat de aankondiging enkel de rijen vermeldt waar Argon wint.

Waar Argon uitblinkt

  • DeepSWE v1.1: 77,9% op lange software engineering taken, 3,7 punten voor Opus 5.5.
  • Vals Index: 68,9% en de eerste plaats op deze index die economische impact meet in financiën, code, recht en belastingen. Het eerste Gemini model ooit aan de top, al is de voorsprong op Claude Sonnet 5.5 slechts 1,9 punten.
  • Harvey’s Legal Agent Benchmark: 19,6% tegenover 6,7%, de grootste voorsprong in de tabel.
  • AutomationBench van Zapier: eerste plaats met 51,3%.
  • LVBench voor het begrijpen van lange video’s: 91,7%.

Waar Argon achterblijft

Op FrontierSWE v2 en Terminal-Bench Science moet Argon telkens 10,5 punten toegeven, op Terminal-bench 4.0 is dat 9 punten. Voor taken waarbij een model zelfstandig in een terminal werkt, blijven Anthropic en OpenAI dus voorlopig sterker.

Onafhankelijke metingen bevestigen dat beeld. Artificial Analysis geeft Argon 53 punten op de Intelligence Index, gelijk met GPT-6 Astra en Claude Fable 5.1. Claude Opus 5.5 leidt met 58 punten. Ten opzichte van Gemini 3.1 Pro is de sprong wel groot, namelijk 23 punten. Opvallend is de lage hallucinatiegraad van 15% op AA-Omniscience, tegenover 51% voor GPT-6 Astra. Argon geeft dus vaker toe dat het een antwoord niet weet. Op Arena.ai, waar mensen antwoorden blind vergelijken, staat Argon bovenaan de Text Arena met 1.525 punten. Voor schrijfwerk is het daarmee een sterke kandidaat.

Cybersecurity zonder guardrails voor vertrouwde partners

Google heeft Argon specifiek getraind op cyberdefensie. Het model kan volgens Google zelfstandig kwetsbaarheden vinden, valideren en patchen. Opmerkelijk is dat Google het model voor de eigen teams en voor de partners in het Fairwind Program uitbrengt zonder cyber guardrails. Dat programma telt meer dan 650 partners en stelt voorwaarden zoals phishing resistente MFA, gebruik door interne securityteams en een verbod op doorverkoop. Hoeveel partners Argon effectief krijgen, is niet bekend.

Op CWE-bench v1, dat test of een model kwetsbaarheden kan herstellen, deelt Argon de eerste plaats met 68%. Het leaderboard van Collinear AI toont dat het om een gedeelde plaats gaat met Grok 4.7 en GPT-6 Astra, terwijl Opus 5.5 op 67% staat. Twee details ontbreken in de grafiek van Google. Argon kost gemiddeld $6,63 per poging, tegenover $0,79 voor Opus 5.5. En een panel van AI judges, dat ook controleert of varianten van een aanval gedicht zijn, geeft Argon 62%. Een patch die de test haalt, lost het onderliggende lek dus niet altijd volledig op.

Google vermeldt ook dat Wiz met Argon een kritiek lek vond in ziekenhuissoftware dat eerdere modellen misten. Op de Scan for Good pagina van Wiz, een bedrijf dat eigendom is van Google, wordt Argon niet genoemd en is het lek niet gespecificeerd.

Veiligheid eerst, voor brede beschikbaarheid

Google versterkt de safeguards op vier vlakken voor een bredere release:

  • misbruik voor cyberaanvallen of CBRN dreigingen weigeren, met monitoring van de interne activaties van het model;
  • weerstand tegen indirecte prompt injection. Argon haalt op de Gray Swan benchmark nu een aanvalssucces van 0,7% haalt tegenover 1,0% voor de Claude modellen;
  • de chain of thought en acties van het model monitoren wanneer Argon buiten de bedoeling van de gebruiker treedt en stoppen de uitvoering op dat moment
  • sandboxes isoleren en afsluiten voor risicovolle training of evaluaties.

Google roept de sector ook op om redeneringen van modellen transparant te houden, zodat misalignment opspoorbaar blijft. Wat voorlopig ontbreekt, is een model card en een uitspraak over of Argon een kritiek capaciteitsniveau voor cyber bereikte binnen het eigen Frontier Safety Framework. OpenAI publiceerde zo’n beoordeling wel voor GPT-6 Astra.

Wat kost Gemini 4 Argon?

De introductieprijs bedraagt $2 per miljoen input tokens en $10 per miljoen output tokens. Cached input krijgt 95% korting, wat neerkomt op ongeveer $0,10 per miljoen tokens. Een voetnoot vermeldt dat de prijs na de introductieperiode verdubbelt naar $4 en $20. Wanneer die periode afloopt, staat nergens.

De prijs per token zegt weinig over de prijs per taak. Argon denkt lang en gebruikt bij Artificial Analysis gemiddeld 62.000 output tokens per taak, tegenover 27.000 voor GPT-6 Astra. Aan introductieprijs kost een taak $1,99, goedkoper dan Astra. Aan de reguliere prijs wordt dat $3,98, ongeveer 20% duurder. Op de Vals Index is Argon dan weer goedkoper dan de Claude modellen, terwijl het op CWE-bench de duurste van de koplopers is. Hoeveel je betaalt, hangt dus sterk af van het soort werk.

Wanneer kun je Argon gebruiken?

Google neemt deel aan het vrijwillige programma van de Amerikaanse overheid dat pre-release toegang geeft tot nieuwe modellen. Na de feedback van de eerste testers volgen klanten van de betaalde API en abonnees van Google AI Ultra, daarna ontwikkelaars, bedrijven en consumenten. Een datum geeft Google niet, enkel de belofte dat het “as soon as possible” gebeurt. Via Gemini Enterprise ondersteunt Argon zero data retention, een belangrijk punt voor organisaties die met persoonsgegevens werken.

De echte test komt op jouw eigen werk

Gemini 4 Argon brengt Google duidelijk terug bij de top van de AI labs, met uitschieters in juridisch werk, lange video’s en schrijfkwaliteit. Wil je straks beslissen of Argon past bij jouw team, neem dan een handvol taken die je al opgelost hebt, laat elk model ze in dezelfde omgeving uitvoeren en noteer de kost per taak samen met het aantal gegenereerde tokens. Die oefening vertelt je meer dan eender welke ranglijst.