Gemini 3.7 Flash is officieel gelanceerd. Drie weken na de lancering van Gemini 3.6 Flash presenteert Google een opvolger, gebouwd op feedback van developers en algoritmische innovaties die later ook in toekomstige modellen terechtkomen. Google noemt 3.7 Flash zijn slimste werkpaardmodel voor coding en agents. De introductieprijs ligt bovendien op de helft van wat 3.6 Flash oorspronkelijk kostte per miljoen tokens. De verbeteringen concentreren zich op software engineering, webdevelopment en kenniswerk.
Hogere benchmarkscores voor coding en kenniswerk
Voor codetaken laat 3.7 Flash forse winst zien bij debugging en het oplossen van gemelde issues. Code is vaker al bij de eerste poging correct en vaker direct klaar voor productie. Op FrontierCode 1.1 Main, een benchmark die de kwaliteit van productiecode meet, stijgt de score van 34,4 naar 43,6 procent. DeepSWE v1.1, dat software engineering over langere trajecten test, gaat van 49,0 naar 65,3 procent.
Webdevelopment profiteert eveneens. Het model genereert functionelere layouts en apps met completere functionaliteit in minder prompts. Bij het bouwen van interfaces blijft het trouw aan het aangeleverde ontwerp, of dat nu een screenshot is, een losse afbeelding of een volledig designsysteem. Op de WebDev Arena van Arena.ai noteert 3.7 Flash een Elo van 1588, waar 3.6 Flash op 1538 bleef steken.
Kennisintensieve domeinen zoals finance, legal en de biowetenschappen krijgen betere redenering en hogere accuraatheid. Op GDP.pdf, een benchmark die het verwerken van complexe documenten test, verspringt de score van 22,0 naar 34,0 procent. AutomationBench, dat bedrijfsworkflows nabootst, stijgt van 17,0 naar 30,4 procent.
De verbeteringen reiken verder dan tekst en code. Google publiceerde resultaten op een brede reeks evaluaties, waaronder Terminal-bench voor agentisch werken in de terminal, OSWorld voor het aansturen van een computer, LVBench voor het begrijpen van lange video’s en CharXiv voor het redeneren over complexe grafieken. Verder rapporteert Google scores op HLE-Verified, een test voor multidisciplinair redeneren op expertniveau, en op Agent’s Last Exam, dat multimodale taken op desktop en besturingssysteem bundelt. Ook op tests voor lange context en op biologische onderzoekstaken zoals BioMysteryBench en LABBench2 boekt het model vooruitgang.
Een betrouwbaardere developer experience
Volgens Google herstelt 3.7 Flash zich beter van obstakels onderweg, vraagt het om verduidelijking als jouw intentie onduidelijk is en volgt het instructies strikter op. Het model investeert meer moeite in planning over meerdere stappen en in het aanroepen van tools. Die gedisciplineerde uitvoering vertaalt zich in minder handmatig toezicht en minder retries in engineeringworkflows. Voor agents die langere tijd zelfstandig draaien, maakt precies dat het verschil.
Van prompt tot speelbare game en interactieve jaarverslagen
Google illustreert de mogelijkheden met vier voorbeelden. Vanuit één tekstprompt ontstaat een volledig speelbare game in 3D, waarbij Gemini 3.7 Flash samenwerkt met Nano Banana om personages, items en texturen in realtime te genereren. In een tweede voorbeeld orkestreert het model subagents om een interactieve landingspagina in één keer te bouwen, met Gemini Omni voor vloeiende parallaxcomponenten.
Een derde demo laat zien hoe een robotmodel sneller leert wanneer het multimodale begrip van 3.7 Flash wordt gekoppeld aan een trainingsloop van drie agents. Het laatste voorbeeld tovert een statisch jaarverslag om tot een interactieve datastory met live grafieken en samengevatte inzichten, rechtstreeks vanuit een pdf.
Wat vroege klanten in de praktijk meten
Partners die het model al testten, delen concrete cijfers en observaties:
- Browser Use berekende dat de agent op basis van 3.7 Flash 35 procent goedkoper draaide dan met 3.6 Flash, met 8 procent meer cachetreffers op prompts en minder fouten in toolgebruik.
- Harvey, actief in juridische AI, mat een stijging van 2,6 punten op Legal Agent Bench in het aantal zaken waarin alle criteria werden gehaald, met winst over vrijwel alle praktijkgebieden.
- Box zag het model accurater en aanzienlijk sneller werken op echt bedrijfskenniswerk, met de grootste sprongen op de lastigste analytische taken.
- Nunu.ai vergeleek 3.7 Flash met middelgrote modellen zoals GPT-5.6-Terra en mat gelijkwaardige prestaties tegen ongeveer de helft van de kosten.
- LangChain zag het model in dezelfde band scoren als de sterkste geteste modellen op agenttaken in meerdere stappen. Op enkele taken boekte 3.7 Flash als enige vooruitgang.
- Hebbia noteerde groundingprestaties die het niveau van Opus benaderen, met een recall die bijna gelijk blijft en een hogere precisie.
De overige reacties belichten vooral de multimodale kant. Cartwheel loofde het begrip van beweging over tijd in video, en Pydantic AI ondersteunde het model vanaf dag één, mede vanwege het efficiënt delen van video met agents. OpenCode zette ontwerpen uit Figma om in code en roemde de visuele gelijkenis met het origineel, terwijl Emergent designinspiratie en merkrichtlijnen accuraat zag vertalen naar complete applicaties voor web en mobiel. Databricks wijst op de dalende kost van complexe vragen over bedrijfsdata, zoals omzetvoorspellingen of het bepalen van investeringsprioriteiten. Een onderzoeker van Stanford testte het model op een experimenteel plan rond een neurodegeneratieve ziekte en vond het antwoord opvallend consistent met de nieuwste laboratoriumdata.
Prijs en beschikbaarheid van Gemini 3.7 Flash
Tot en met 31 december 2026 geldt een introductietarief van 0,75 dollar per miljoen inputtokens en 3,75 dollar per miljoen outputtokens. Daarna stijgen de tarieven naar 1,50 en 7,50 dollar per miljoen tokens. Google presenteert die combinatie van lagere kost en hogere prestaties als een manier om agents in productie betaalbaar te schalen.
Developers starten via de Gemini API in Google AI Studio of Android Studio, of verkennen workflows rond agents in Google Antigravity. Organisaties vinden 3.7 Flash in het Gemini Enterprise Agent Platform en de Gemini Enterprise app.
Gemini Spark draait nu op 3.7 Flash
Gemini Spark, de persoonlijke agent in de Gemini-app die dag en nacht taken uitvoert onder jouw regie, schakelt vandaag over op 3.7 Flash. Spark is beschikbaar voor abonnees van Google AI Pro en Ultra in meer dan 160 landen. Met het nieuwe model werkt Spark efficiënter voor kenniswerk en gebruikt het de tools van Google Workspace beter. Bestanden consolideren, e-mails opstellen en statusdocumenten bijwerken gebeurt met hogere accuratesse en betere outputkwaliteit.
Veiligheid als vast onderdeel van de release
3.7 Flash wordt geleverd met meer guardrails voor chemische, biologische, radiologische en nucleaire risico’s en cyberaanvallen. Volgens Google blijven nuttige toepassingen daarbij mogelijk, in lijn met de eigen aanpak rond bioresilience en het cyberprogramma. De volledige details staan in de modelkaart van 3.7 Flash.
Intelligentie per dollar wordt de nieuwe maatstaf
Google gebruikt de Flash-serie als bewijs van zijn iteratiesnelheid, hoeveel intelligentie je krijgt per dollar en hoe betrouwbaar een agent je werk uitvoert met minimaal toezicht. Met 3.7 Flash daalt de prijs per eenheid redeneervermogen fors, terwijl de betrouwbaarheid stijgt. Wie dit najaar de kosten van agents in productie doorrekent, komt met dit model vrijwel zeker op andere getallen uit dan een maand geleden.