Google heeft Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking gelanceerd. Volgens het Gemini Audio Team zijn dit de meest geavanceerde live dialogue models van het bedrijf tot nu toe. De modellen combineren complexe redeneringen met visuele context in vrijwel real-time en voeren taken op de achtergrond uit terwijl het gesprek gewoon doorloopt. Je gebruikt ze vanaf nu via de Gemini API, Google AI Studio, de Gemini app, Google Workspace en Search Live.

Praten met AI moet aanvoelen als samenwerken met iemand die meedenkt, onderbrekingen verwerkt en ondertussen gewoon verder werkt aan je verzoek. Daarvoor introduceert Google twee modellen met elk een eigen rol.

Twee modellen, twee rollen

Google positioneert Gemini 3.8 Live en Extended Thinking als twee varianten van dezelfde aanpak voor near real-time reasoning.

  • Gemini 3.8 Live is gebouwd voor schaal en kostenefficiëntie. Het model combineert conversationele intelligentie met vloeiende dialogen en visual grounding. In de documentatie voor developers staat het model omschreven als de standaardkeuze voor voice agents met lage latency en real-time gesprekken zonder vertraging door redeneerprocessen. De input limiet ligt op 131.072 tokens en de output limiet op 65.536 tokens.
  • Gemini 3.8 Live Extended Thinking is bedoeld voor taken met hoge complexiteit. Het model levert meer intelligentie en multi-step reasoning, en blijft daarbij het gesprek voeren zonder pauzes.

Voor developers en bedrijven leveren beide modellen volgens Google de bouwstenen voor betrouwbare, productierijpe voice agents. Voor gewone gebruikers moeten gesprekken met Gemini in de app, Workspace en Search vloeiender en natuurlijker worden.

Natuurlijker praten met visuele context en 97 talen

Gemini 3.8 Live verwerkt visuele input in bijna real-time en gebruikt die context om antwoorden relevanter te maken. Google demonstreert dit met twee voorbeelden. Het model volgt een schaakpartij via de camera en praat live mee over de stellingen, en het begeleidt de onboarding van nieuwe medewerkers door mee te kijken en direct vragen te beantwoorden.

De taalondersteuning valt op. Het model detecteert automatisch welke van de 97 ondersteunde talen je spreekt en schakelt midden in een gesprek over zodra je van taal wisselt. Je hoeft daarvoor geen instelling aan te passen.

Het opvallendste onderdeel zit in de achtergrondverwerking. Het model voert tools en API calls uit terwijl het gesprek doorgaat. Vraag je om een taak, dan bevestigt het model je verzoek, praat het verder met je en laat het de taak op de achtergrond afronden. Daarmee verdwijnt de stiltemomenten die vroegere spraakmodellen kenmerkten.

Extended Thinking redeneert hardop

Voor taken die meer redeneerwerk vragen, denkt Extended Thinking letterlijk hardop. Het model redeneert en spreekt tegelijkertijd. Het erkent je vraag met vroege verbale signalen zoals “Let me check that…” en vertelt vervolgens live waar het in het proces staat. Die live progress narration loodst je stap voor stap door meerstaps taken die op de achtergrond draaien.

Google laat in demo’s zien wat dat oplevert:

  • ruwe schetsen en gesproken feedback omzetten in werkende React components
  • boekingen met meerdere stappen coördineren via asynchrone function calls, terwijl het gesprek gewoon doorgaat
  • complete business plannen en marketing toolkits op maat maken via natuurlijke spraak

Zo scoren de modellen in benchmarks

Gemini 3.8 Live Extended Thinking staat volgens Google op de eerste plaats van de Speech to Speech Quality Index van Artificial Analysis met een score van 82.6. Op het gebied van agentic task completion haalt het model 68.6% op τ-Voice en 35.1% op de τ-Voice-banking benchmark van Sierra. De redeneercapaciteiten komen naar voren met 97.7% op Big Bench Audio. Google stelt dat het model deze prestaties levert tegen een concurrerende prijs vergeleken met andere frontier modellen.

Het reguliere Gemini 3.8 Live scoort sterk bij gebruikers. Het model eindigde op de tweede plaats in de Speech Agent Arena en blijft tegelijk kostenefficiënt voor developers en bedrijven die op schaal willen werken.

Op EVA-Bench, de benchmark van ServiceNow voor voice agents, verleggen beide modellen volgens Google de Pareto Frontier voor complexe workflows. Ze balanceren daarbij nauwkeurigheid met gesprekskwaliteit. Deze test draaide op de Live API binnen het Gemini Enterprise Agent Platform.

Waar je Gemini 3.8 Live nu al tegenkomt

Search Live in de Google app draait vanaf vandaag op Gemini 3.8 Live. Rajan Patel, VP Engineering voor Search bij Google, bevestigde de uitrol met de woorden “New Gemini audio models just dropped – 3.8 Live is now powering real-time conversations in Search Live.”

Dat levert in de praktijk drie verbeteringen op:

  • behulpzamere antwoorden met weblinks om dieper in te gaan op een onderwerp
  • vloeiende meertalige ondersteuning, inclusief taalwissels midden in het gesprek
  • natuurlijkere, vrijere interacties

Je opent Search Live via het nieuwe Live-icoon in de Google app en stelt je vraag hardop. Je hoort een gesproken antwoord en stelt direct vervolgvragen. Op het scherm verschijnen links om verder te lezen, en via de transcript-knop bekijk je het gesprek als tekst en typ je eventueel verder. Eerdere gesprekken pak je weer op via je AI Mode geschiedenis.

In Google Workspace komt Extended Thinking naar Docs Live, Gmail Live en Keep Live. Abonnees op Google AI Pro en Ultra krijgen de functie in Docs, en alle Google AI abonnees krijgen toegang via Gmail en Keep. In de Gemini app rolt Gemini Live de nieuwe modellen eveneens uit.

Wat developers moeten weten

Beide modellen zijn vanaf vandaag beschikbaar in de Gemini API en Google AI Studio onder de stabiele model string gemini-3.8-live. Platforms als Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel en Vision Agents bouwen op de Live API en regelen de complexe real-time media streaming infrastructuur, zodat developers zich volledig op de gebruikerservaring richten. Salesforce, Genspark en Lumeris werken al met de modellen en wijzen op de indrukwekkende latency, vloeiendheid en tool calling mogelijkheden.

Wie migreert vanaf gemini-3.1-flash-live-preview moet op een aantal wijzigingen letten:

  • asynchrone function calling is nu standaard met NON_BLOCKING gedrag; synchrone blocking modus blijft beschikbaar voor backward compatibiliteit
  • thinking_level wordt niet ondersteund en valt weg uit de sessieconfiguratie
  • proactive audio staat permanent aan; de uitschakeloptie geeft een foutmelding
  • affective dialogue is volledig verwijderd uit de API
  • client content updates werken gedurende de hele sessie, waarbij turn_complete=true actieve generatie onvoorwaardelijk onderbreekt
  • turn coverage stuurt standaard videoframes mee, dus stuur alleen frames wanneer nodig om context en kosten te beheersen

Voor bedrijven draaien beide modellen in private preview in Gemini Enterprise. Uitrol naar Gemini Enterprise for Customer Experience en Workspace business klanten volgt binnenkort.

SynthID houdt AI-audio herkenbaar

Alle audio die de AI-producten van Google genereren krijgt een SynthID-watermerk. Dit onhoorbare watermerk zit direct in de audio output geweven en houdt AI-gegenereerde content detecteerbaar. Zo wil Google misinformatie tegengaan. De aanpak voor veiligheid en verantwoordelijkheid staat beschreven in de model card.

Spraak groeit uit tot een volwaardige interface

Met Gemini 3.8 Live schuift de rol van spraak in AI op. Tot nu toe was een voice agent vooral een spraaklaag bovenop een chatbot. Achtergrondtaken, parallel redeneren en visuele context maken van spraak een interface waarin meerdere processen tegelijk lopen terwijl jij gewoon doorpraat. Blijft de latency laag bij schaal, en overleeft de tool calling rommelige gesprekken in de echte wereld?