Met Gemini 3.8 Live with Live Avatar krijgt de conversational AI van Google een gezicht. Je praat met een geanimeerde persoon die luistert, meekijkt via je camera en antwoordt met gesynchroniseerde lippen en gezichtsuitdrukkingen. Sinds 24 september 2026 is de functie algemeen beschikbaar in Gemini Enterprise, een week na de lancering van het onderliggende model Gemini 3.8 Live. De technologie werd eerder al getoond op Google Cloud Next 2026.
Kan een pratend gezicht echt iets toevoegen aan een voice agent?
Wat Gemini 3.8 Live with Live Avatar doet
Live Avatar verandert een gesproken gesprek in een videogesprek met een synthetische gesprekspartner. Het model neemt spraak en beeld als input en levert spraak en video als output. Het gezicht dat je ziet, wordt gelijktijdig met de stem gegenereerd. Geen aparte lipsync zoals bij veel bestaande avatartools.
Google omschrijft het als een ervaring die luistert, kijkt en spreekt met een dynamische visuele persona. De kernpunten:
- Precieze lipsync en natuurlijke expressies die meebewegen met de gegenereerde spraak.
- Vloeiende turn-taking, zodat je de avatar midden in een zin kunt onderbreken zonder dat de context verloren gaat.
- Visueel begrip van live camerabeelden en schermdelingen.
- 97 talen met automatische taaldetectie en mogelijkheid tot wisselen van taal tijdens het gesprek.
- SynthID watermarks in alle gegenereerde audio en video.
De techniek onder de motorkap
Voor developers zit de waarde in Gemini Live API. Het model draait over bidirectionele WebSockets en verwerkt spraak, camerabeelden en schermdelingen met een latency van minder dan een seconde. De output bestaat uit audio van 24 kHz en een videostream van 24 FPS in MP4, rechtstreeks gegenereerd door het model. Je hebt geen externe rendering pipeline nodig.
Inkomende video verwerkt het model als JPEG frames aan 1 FPS, met een optimale resolutie van 768 bij 768 pixels. Via de instelling media_resolution kies je tussen laag, medium en hoog. Zo bepaal je zelf of je meer visueel detail wilt of minder tokens per frame verbruikt.
Affective dialogue en proactive audio staan standaard aan
Gemini 3.8 Live luistert naar intonatie, pauzes en emotionele signalen in je stem en past daar zijn toon, empathie en gespreksritme op aan. Die affective dialogue staat standaard ingeschakeld. Hetzelfde geldt voor proactive audio: het model filtert omgevingsgeluid en achtergrondgesprekken weg en reageert enkel wanneer je het rechtstreeks aanspreekt. Dit is belangrijk voor een avatar in een drukke winkel of op een interactieve kiosk.
Asynchrone tool calling zonder stiltes
Een avatar die stil valt terwijl hij data ophaalt, voelt meteen kunstmatig aan. Daarom voert Live Avatar tool calls en API calls op de achtergrond uit terwijl het gesprek doorloopt. De agent kan zeggen dat hij je gegevens erbij neemt en ondertussen vervolgvragen beantwoorden.
Google demonstreert dat met een hotelreceptionist die een gast incheckt. Twee technische verfijningen maken de ervaring beter:
- Auto canceling blocking calls: bij een blokkerende functie wacht het model op het antwoord, maar als jij intussen iets nieuws vraagt, annuleert de server de lopende call automatisch.
- Polite interruption: oudere modellen konden door de gebruiker heen praten zodra een tool een resultaat terugstuurde. Gemini 3.8 Live wacht nu tot je pauzeert.
Via custom vocabulary kan je vaktermen, productcodes of merknamen meegeven. Dit verbetert de herkenning van een specifieke woordenschat.
97 talen
Volgens Google wisselt Live Avatar tussen de 97 ondersteunde talen zonder dat de videokwaliteit achteruitgaat of er visuele drift ontstaat. In een demo schakelt de avatar van Engels naar Japans, waarbij de mondbewegingen in beide talen blijven kloppen. Voor bedrijven die markten bedienen waar ze geen moedertaalsprekers in dienst hebben, is dat een van de meest concrete toepassingen.
Equal AI toont wat meertaligheid op schaal betekent. Het bedrijf verwerkt dagelijks meer dan een miljoen live gesprekken in negen Indiase talen. CEO Akhilesh Damaraju zegt dat Gemini 3.8 Live de afhandeling van onderbrekingen, meertalige gesprekken en de betrouwbaarheid verbeterde.
Preset avatars of je eigen gezicht
Elke klant van Gemini Enterprise kan kiezen uit een bibliotheek van kant-en-klare avatars, elk met een eigen uiterlijk, stem en expressie. Een avatar op maat bouw je op basis van één referentiefoto en een audiosample, aangevuld met system instructions. Het resultaat is een volledig geanimeerde avatar die lijkt op de foto, huisstijl of karakteridentiteit.
Toepassingen die al draaien
De meest uitgewerkte demo toont een intake agent voor verzekeringsclaims. Je beschrijft de schade en toont die voor de camera, terwijl het claimdossier zichzelf invult. Op de achtergrond controleert een team van agents, gebouwd met de Agent Development Kit, de polis, past het de intakeregels toe en stelt het het dossier voor de schade-expert samen. De code daarvan is open source.
Cox Automotive bouwde voor Autotrader een shopping assistant die autokopers via gesprek begeleidt bij zoeken, vergelijken en financieren, met live markeringen op het scherm. Marianne Johnson, Chief Product Officer bij Cox Automotive, verwoordt het zo: “Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus.”
Wat het kost
Volgens de prijspagina van Gemini Enterprise betaal je 1 dollar per miljoen video output tokens, bovenop de audio die je al betaalt. Per seconde spraak genereert de avatar ongeveer 6.192 videotokens tegenover 25 audiotokens. Video verbruikt dus zo’n 250 keer meer tokens dan audio.
Omgerekend kost een minuut spreektijd ongeveer 0,39 dollar. Een begeleide sessie van tien minuten komt zo rond vier dollar uit. Video wordt enkel aangerekend wanneer de avatar spreekt, luistertijd is gratis. Deze introductietarieven lopen tot 31 december 2026. Vanaf 1 januari 2027 gelden hogere standaardtarieven.
Die vier dollar is goedkoper dan een medewerker maar veel duurder dan een chatbot.
Wat is near real time?
Google spreekt over near real-time, maar publiceert geen cijfers over latency. Voor een video agent is de time to first frame wat bepaalt of de ervaring aanvoelt als een gesprek of als een diavoorstelling.
Google maakt het genereren van avatars makkelijk. Je gebruikt hetzelfde product als voor het generen van voice. Spelers als Synthesia, HeyGen en D-ID koppelen een avatar aan een model.