Gemini 3.8 Live
Gemini 3.8 Live er Googles native speech-to-speech-model, som Google DeepMind lancerede den 15. september 2026 sammen med søstermodellen Gemini 3.8 Live Extended Thinking. Native betyder, at den samme model lytter til lyd og svarer med lyd. Den klassiske stemmeløsning kæder i stedet 3 systemer sammen: talegenkendelse, en tekstbaseret sprogmodel og talesyntese. Modellerne afløser Gemini 3.1 Flash Live i Google Gemini-modelfamilien og er bygget til stemmeagenter, der løser opgaver under samtalen. De kalder værktøjer og API'er i baggrunden, skifter automatisk mellem 97 sprog og kan se med gennem et kamera.
Tag et konkret opkald. En kunde ringer til en dansk grossist og spørger, om ordre 48213 er sendt. Agenten svarer "lad mig tjekke det", slår ordren op i ERP-systemet og fortsætter samtalen, mens opslaget kører. Kunden henter sin tyske kollega ind og skifter til tysk, og agenten skifter med uden at blive sat op til det. I en app kan kunden holde en beskadiget kasse op foran kameraet, så agenten kan beskrive skaden i reklamationen.
For en B2B-virksomhed rammer modellerne de opgaver, der i dag fylder i telefonkøen: ordrestatus, booking af servicebesøg, modtagelse af reklamationer og intern IT-support. Prisen er 0,005 dollar pr. minut lyd ind og 0,018 dollar pr. minut lyd ud, og Artificial Analysis har målt 1,18 sekunder til første lyd på standardmodellen. Forgængeren Gemini 3.1 Flash Live (High) lå på 2,99 sekunder. Denne side gennemgår arkitekturen, de uafhængige tal, konkurrenterne og de regler, du skal overholde, før du sætter stemme-AI-agenter til at tage kundernes opkald.
Sådan virker Gemini 3.8 Live teknisk
Native lyd i stedet for en kæde af systemer. En cascade-løsning sender kundens tale gennem en talegenkender, giver teksten til en sprogmodel og lader en talesyntese læse svaret op. Hvert led tilføjer ventetid, og tonefald, tøven og afbrydelser går tabt, når lyd bliver til tekst. Gemini 3.8 Live tager lyden direkte ind og genererer lyd direkte ud i én model. Det er samme grundprincip, som vi beskriver under realtids-stemme-AI, og det er den største forskel fra de stemmeløsninger, mange virksomheder har bygget de seneste år.
2 modeller med hver sin rolle. API'et har 2 model-id'er: gemini-3.8-live og gemini-3.8-live-extended-thinking. Standardmodellen er optimeret til lav latens og har indbygget ræsonnement undervejs (interleaved reasoning), men du kan ikke skrue på det. Parameteren thinking_level understøttes ikke og skal udelades fra opsætningen. Extended Thinking-modellen ræsonnerer i baggrunden med en justerbar thinking_level på low, medium eller high, mens niveauet minimal ikke findes. Googles modelkort samler de 2 under navnet Gemini 3.8 Audio, og videnskæringsdatoen er januar 2025.
Asynkrone værktøjskald. Den tekniske nyhed med størst praktisk betydning er, at værktøjskald kører uden at stoppe samtalen. Du markerer dine funktioner med behavior: NON_BLOCKING, og modellen fortsætter med at tale, mens dit API svarer. På standardmodellen er asynkron tool calling nu standard, men blokerende kald kan stadig bruges af hensyn til ældre integrationer. Extended Thinking kræver asynkrone kald, og et synkront, blokerende værktøj returnerer en fejl.
En ny status, din integration skal lytte efter. Fordi arbejdet fortsætter efter, at modellen har talt færdig, sender serveren feltet interaction_status. Værdien IN_PROGRESS betyder, at modellen ræsonnerer eller venter på et værktøj. IDLE betyder, at opgaven er færdig og sessionen klar til kundens næste input. Google skriver direkte, at klienten skal holde øje med dette felt og ikke kun med signalet om afsluttet tur. En telefoniintegration, der lægger på eller stiller om ved første pause, vil ellers afbryde en opgave midt i et ERP-opslag.
Formater, protokol og kontekst. Live API kører over en WebSocket-forbindelse (WSS). Lyd ind er rå 16-bit PCM ved 16 kHz, lyd ud er 24 kHz, og billeder sendes som JPEG med højst 1 billede pr. sekund. Du kan koble op server-til-server eller direkte fra en browser eller app, og til det sidste anbefaler Google kortlivede tokens (ephemeral tokens) i stedet for rigtige API-nøgler. Kontekstvinduet er 131.072 tokens ind og 65.536 tokens ud på begge modeller.
97 sprog med automatisk skift. Live API understøtter 97 sprog, og dansk står på listen med koden da. Modellen opdager selv, når kunden skifter sprog midt i samtalen, og Google fremhæver, at accenten holdes stabil på tværs af skiftet. Google nævner også præcis gengivelse af alfanumeriske data som bekræftelseskoder og skadesnumre. Det er relevant, fordi en talegenkender i en cascade-løsning kan tage fejl af netop bogstaver og tal.
Det, modellen ikke kan. Modelkortene lister en række funktioner som ikke understøttet: caching, code execution, file search, grounding med Google Maps, billedgenerering, structured outputs, URL context og Batch API. Function calling og grounding med Google Search virker. Konsekvensen er, at virksomhedsviden skal ind via dine egne værktøjer, for eksempel et RAG-opslag bag et funktionskald, og at du selv skal validere de data, agenten skriver tilbage i dine systemer, fordi structured outputs mangler.
Ændringer fra Gemini 3.1 Flash Live. Googles migreringsguide nævner 3 ting, der påvirker eksisterende kode. Proaktiv lyd er altid slået til, funktionen affective dialogue er fjernet, og thinking_level skal fjernes fra sessionsopsætningen på standardmodellen. Live API begrænser som udgangspunkt en session til 15 minutter med ren lyd og 2 minutter med lyd og video, så længere forløb kræver genoptagelse af sessionen (session resumption).
Sådan gør konkurrenterne. OpenAIs GPT-Live-1 er en full duplex-model, der lytter og taler samtidig, men sender tunge opgaver videre til en separat backend-model som GPT-6 Astra, Luna eller Terra. Google holder ræsonnementet inde i selve stemmemodellen, når du vælger Extended Thinking. Samtidig lever cascade-systemer som ElevenLabs Agents, Deepgram Voice Agent og Cartesia Line videre, fordi de lader dig vælge sprogmodel og stemme hver for sig. Valget står derfor mellem kontrol over hvert led og kortere vej fra kundens ord til agentens svar.
Overvejer I at lade en stemmeagent tage en del af jeres kundeopkald, hjælper vi jer fra første testopkald til drift. Vi kobler Gemini 3.8 Live på jeres CRM og ERP via MCP og API'er, afgrænser de flows, hvor standardmodellen er nok, og dem, hvor Extended Thinking betaler sig. Vi måler tid til første lyd, afbrydelser og værktøjskald på jeres egne samtaler, så business casen bygger på jeres tal. Og vi sørger for, at artikel 50-oplysningen og GDPR er på plads, før første kunde ringer ind.
Hvad Gemini 3.8 Live kan i praksis
Værktøjskald under samtalen (asynkron function calling)
Agenten kalder dine API'er, mens den taler videre med kunden. Modellen sender kaldet afsted, siger en kort statusbesked og fletter resultatet ind, når svaret kommer. En dansk grossist kan give agenten et opslagsværktøj mod ordrer og lagerstatus i Business Central, så kunden får leveringsdato og restordre i samme opkald uden at blive stillet om.
Ræsonnement i baggrunden (Extended Thinking)
Extended Thinking-modellen planlægger flere skridt, mens den holder samtalen i gang med sætninger som "lad mig tjekke det". Forskellen er målbar: på Artificial Analysis' test τ-Voice, der måler løste kundeservicesager inden for fly, detailhandel og telekom, løser Extended Thinking (High) 68,6 procent mod 30,1 procent for standardmodellen. En producent af industriudstyr kan bruge den til reklamationer, hvor agenten skal slå købsdato op, holde den op mod garantireglerne og foreslå ombytning eller reparation.
Automatisk sprogskift (97 sprog)
Modellen registrerer selv sproget og skifter, når kunden gør. Du behøver ikke et separat nummer eller en menu pr. sprog. En dansk eksportvirksomhed med kunder i Tyskland, Sverige og Polen kan køre én agent på tværs af markederne. Designpartneren Ambr AI oplyser, at de efter skiftet til Extended Thinking leverer træningssimulationer på over 70 sprog.
Live-billede som kontekst
Modellen tager billeder ind, mens samtalen kører, og kan tale om det, den ser. Billederne sendes som JPEG med op til 1 billede pr. sekund. En servicevirksomhed kan lade en kunde filme typeskiltet på en varmepumpe, så agenten læser modelnummeret og finder den rigtige fejlkodeliste. Vær opmærksom på, at en session med video som udgangspunkt er begrænset til 2 minutter.
Præcise koder og numre
Google fremhæver, at modellen gengiver alfanumeriske data som bekræftelseskoder og skadesnumre præcist. Det er den slags data, hvor et "B" og et "D" let bliver forvekslet på en dårlig telefonforbindelse. Et forsikringsselskab eller en leasingvirksomhed kan lade kunden læse et sagsnummer op og få det bekræftet tegn for tegn, før agenten slår sagen op.
Statusbeskeder undervejs
Extended Thinking fortæller kunden, hvad den laver, mens den arbejder. Googles dokumentation bruger eksemplet "Checking flight options now". I praksis fjerner det den tavshed, der får kunder til at lægge på. Et installationsfirma kan lade agenten sige, at den kigger i teknikernes kalender, mens den finder 3 ledige tider til et servicebesøg.
Søgning på nettet (Google Search grounding)
Begge modeller kan hente aktuelle oplysninger via Google Search. Du får 5.000 gratis søgninger om måneden, delt på tværs af alle Gemini 3.x-modeller, og derefter koster det 14 dollar pr. 1.000 søgninger. Et rejsebureaus agent kan slå aktuelle indrejseregler op, men til jeres egne priser og vilkår bør agenten bruge jeres egne systemer frem for søgning.
Standardmodellen på first-line, Extended Thinking på de svære sager
De uafhængige tal peger på en tydelig arbejdsdeling. I Artificial Analysis' Speech Agent Arena, hvor rigtige mennesker stemmer blindt på den mest naturlige samtale, får standardmodellen en Elo på 1083 mod 990 for Extended Thinking (High). Standardmodellen scorer også højest på Full Duplex Bench, der måler turtagning og afbrydelser, med 96,1 procent mod 91,9 procent. I samme arena løser standardmodellen 93,2 procent af de simple opgaver som tandlægebooking og takeaway-bestilling, mens Extended Thinking løser 89,1 procent. Extended Thinking betaler sig først, når sagen kræver flere skridt.
Byg på eksisterende rammeværker
Du behøver ikke skrive WebSocket-håndteringen selv. Google nævner Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel og Vision Agents som integrationer fra første dag, og Salesforce, Genspark og Lumeris er med som designpartnere. En virksomhed, der allerede bruger LiveKit eller Pipecat til telefoni, kan skifte model uden at bygge lydlaget om.
Gemini 3.8 Live vs. konkurrenterne, priser og EU AI Act
Artificial Analysis har kørt modellerne gennem Live API med thinking sat til high, og tallene nedenfor er aflæst den 16. september 2026. Deres Speech to Speech Index vægter 3 test lige: Big Bench Audio (ræsonnement), Full Duplex Bench (turtagning og afbrydelser) og τ-Voice (løste kundeservicesager). Gemini 3.8 Live Extended Thinking (High) ligger nummer 1 med 82,6. Standardmodellen ligger nummer 5 med 76,0, og forgængeren Gemini 3.1 Flash Live (High) ligger på 71,5. Resultaterne i Googles evalueringsnotat er målt på model-id'et gemini-3.8-live-preview.
GPT-Live-1 (OpenAI)
GPT-Live-1 er OpenAIs full duplex-stemmemodel, der kom i API'et den 10. september 2026 og overlader ræsonnement og værktøjer til en valgfri backend-model. Varianten med GPT-6 Astra (medium) scorer 81,5 i indekset, 67,9 procent på τ-Voice og 32,0 procent på Sierras τ³-Banking. Tiden til første lyd er 1,34 sekunder. I arenaen får den en Elo på 1048 og løser 87,4 procent af opgaverne. Stemmelaget koster 0,05 dollar pr. minut, afregnet pr. sekund, og backend-modellen afregnes oven i. Artificial Analysis måler udgiften til 5,83 dollar pr. time inputlyd med Astra.
Grok Voice Think Fast 2.0 (xAI)
xAIs stemmemodel, som Artificial Analysis lister under SpaceXAI, scorer 81,3 i indekset og har den korteste tid til første lyd blandt topmodellerne med 0,70 sekunder. Den løser flest opgaver i arenaen med 94,6 procent, men får en lavere Elo på 1011. På τ-Voice ligger den på 56,5 procent, 12,1 procentpoint under Gemini 3.8 Live Extended Thinking. xAI tager 0,08 dollar pr. minut for sin Voice Agent API, og Artificial Analysis måler 4,80 dollar pr. time inputlyd.
GPT-Realtime-2.1 (OpenAI)
OpenAIs realtidsmodel scorer 73,9 i indekset i High-varianten med 96 procent på Big Bench Audio og 1,21 sekunder til første lyd. Den er stadig et solidt valg, hvis du allerede har en integration på OpenAIs Realtime API. I arenaen løser den 91,5 procent af opgaverne, men brugerne foretrækker samtalen mindre med en Elo på 928.
Gemini 3.1 Flash Live (Google)
Forgængeren taber på indeks, latens og agentopgaver. Brugerne kan dog stadig godt lide den. I arenaen har 3.1 Flash Live (Minimal) stadig den højeste Elo af alle med 1096, mens 3.8 Live får 1083. Den løser dog kun 74,6 procent af arenaopgaverne og 26,2 procent på τ-Voice, og tiden til første lyd er 2,99 sekunder i High-varianten. Artificial Analysis måler udgiften til 1,50 til 1,75 dollar pr. time inputlyd.
Cascade-løsninger (ElevenLabs, Deepgram, Cartesia)
Systemer som ElevenLabs Agents, Deepgram Voice Agent og Cartesia Line kæder talegenkendelse, sprogmodel og talesyntese sammen og deltager i samme arena. ElevenLabs Agents får en Elo på 993 og løser 90,5 procent, Cartesia Line får 1027 og Deepgram 914. Styrken er, at du selv vælger sprogmodel, stemme og eventuelle specialstemmer. Svagheden er de ekstra overgange mellem systemerne, som koster ventetid og gør afbrydelser sværere at håndtere.
Sierras bank-test er en spand koldt vand. På τ³-Banking skal agenten navigere i en stor, ustruktureret videnbase og udføre flere værktøjskald i realistiske bankforløb. Gemini 3.8 Live Extended Thinking fører med 35,1 procent foran GPT-Live-1 Astra på 32,0 procent, xAI-Realtime på 16,5 procent og Gemini 3.1 Flash Live på 11,3 procent. Selv førstepladsen løser kun godt 1 ud af 3 sager. Vores vurdering er, at ingen af modellerne er klar til at køre bank- eller forsikringssager uden et menneske i loopet.
Hvor Gemini 3.8 Live står stærkest, og hvor den ikke gør. Extended Thinking er det bedste valg i dag til komplekse, agentiske samtaler, målt på indeks, τ-Voice og bank-testen. Standardmodellen er den billigste i Googles sammenligning med 0,84 dollar pr. time inputlyd og har en af de højeste Elo-værdier. Grok Voice svarer hurtigere, GPT-Live-1 lader dig vælge backend-model, og cascade-løsninger giver mere kontrol over stemmen. Hvis dit flow kræver skemavalideret output fra modellen, mangler Gemini 3.8 Live structured outputs.
Priser: listepris og målt udgift
Begge modeller har samme listepris. Ifølge Googles prisside koster lyd ind 3 dollar pr. million tokens, cirka 0,005 dollar pr. minut, og lyd ud koster 12 dollar pr. million tokens, cirka 0,018 dollar pr. minut. Tekst koster 0,75 dollar ind og 4,50 dollar ud pr. million tokens, og billede og video ind koster cirka 0,002 dollar pr. minut. Kører lyd ind og ud konstant i en time, giver listeprisen 1,38 dollar. Artificial Analysis måler dog udgiften pr. time inputlyd til 0,84 dollar for standardmodellen og 3,50 dollar for Extended Thinking (High), så med samme listepris koster Extended Thinking omkring 4 gange så meget i målingen. Beregn derfor jeres business case på egne testopkald og ikke på minutprisen alene.
Adgang
Begge modeller er tilgængelige i Gemini API og Google AI Studio. Indhold fra gratisniveauet kan bruges til at forbedre Googles produkter, hvilket ikke sker på det betalte niveau, så en løsning med kundedata bør køre på betalt adgang. I Gemini Enterprise er modellerne i privat preview, og de kommer senere til Gemini Enterprise for Customer Experience. For forbrugere kører standardmodellen i Search Live, mens Extended Thinking kører i Gemini Live-appen, i Docs for Google AI Pro og Ultra og i Gmail og Keep for alle Google AI-abonnenter.
Kendte begrænsninger
Sessioner er som udgangspunkt begrænset til 15 minutter med ren lyd og 2 minutter med video. Modelkortet nævner risiko for hallucinationer og lejlighedsvise problemer med latens og timeouts, og videnskæringsdatoen er januar 2025. Google har ved lanceringen ikke offentliggjort latens-percentiler, rate limits eller detaljer om regional tilgængelighed, og modellerne kan ikke selvhostes.
EU AI Act artikel 50: kunden skal vide, at det er en AI
Når I bygger jeres egen stemmeagent på Gemini 3.8 Live, er I typisk udbyder af det AI-system, kunden taler med. Efter artikel 50, stk. 1, skal I sikre, at kunden får at vide, at samtalen er med en AI, senest ved første interaktion, medmindre det er åbenlyst. Den pligt gælder fra 2. august 2026 og blev ikke udskudt af Digital Omnibus, der blev offentliggjort i EU-Tidende den 24. juli 2026. En enkel åbningsreplik som "Du taler med en AI-assistent. Sig til, hvis du vil have fat i en medarbejder" dækker behovet i de fleste kundeserviceflows. Læs mere under EU AI Act.
Mærkning af syntetisk lyd og GDPR
Al lyd fra Googles AI-produkter får et usynligt SynthID-vandmærke. Artikel 50, stk. 2, kræver maskinlæsbar mærkning af syntetisk lyd og er primært en udbyderpligt. Systemer, der var på markedet før 2. august 2026, har frist til 2. december 2026, mens nye systemer skal overholde kravet med det samme. Få det skrevet ind i aftalen med leverandøren, hvordan SynthID dækker jeres løsning, og husk, at vandmærket ikke erstatter oplysningen til kunden. Overtrædelser kan koste op til 15 millioner euro eller 3 procent af den globale årlige omsætning. Gemmer I optagelser, gælder GDPR også: I skal have et behandlingsgrundlag, informere kunden og have en databehandleraftale. Vil du hurtigt afklare jeres situation, kan du bruge vores EU AI Act-tjek.
Læs videre om stemme-AI
Realtime Voice AI giver AI-systemer evnen til at føre naturlige samtaler med tale i realtid. Forstå teknologien, forretningsværdien og forskellen fra chatbots.
En Voice AI Agent fører samtaler via tale i realtid. Lær hvordan teknologien fungerer, hvilke forretningscases der giver værdi, og hvad den ikke kan.
Conversational AI fører naturlige samtaler via tekst og tale. Forstå de tre lag bag, forskellen fra chatbots, og hvad virksomheder bruger det til.
Gemini er Googles AI-assistent og modelfamilie. Se danske priser, modeller, sammenligning med ChatGPT, Claude og Copilot samt kravene i GDPR og EU AI Act.
Tool calling giver AI-modeller evnen til at kalde eksterne systemer, API'er og databaser. Forstå hvordan function calling fungerer og skaber værdi i praksis.
AI watermarking indlejrer usynlige signaler i AI-genereret indhold, så oprindelse kan verificeres. Lær teknikker, EU-krav og hvad det betyder for din virksomhed.
EU AI Act er verdens første samlede AI-lov. Forstå de fire risikokategorier, kravene, tidslinjen frem til 2027, og hvad det betyder for jer.
Omnilingual AI dækker AI-systemer, der forstår og genererer indhold på tværs af hundredvis af sprog. Lær hvad det betyder for din virksomhed.
Ofte stillede spørgsmål om Gemini 3.8 Live
Hvad er forskellen på Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking?+
Standardmodellen er bygget til lav latens og naturlig samtale og har 1,18 sekunders tid til første lyd. Extended Thinking ræsonnerer i baggrunden med justerbar thinking_level og løser 68,6 procent på τ-Voice mod 30,1 procent for standardmodellen. Brugerne foretrækker dog standardmodellens samtale, der får en Elo på 1083 mod 990 i Speech Agent Arena. Brug standardmodellen til first-line og Extended Thinking til sager med flere skridt.
Kan Gemini 3.8 Live erstatte vores nuværende telefonrobot?+
I mange flows kan den afløse en menubaseret telefonrobot eller en cascade-løsning med separat talegenkendelse og talesyntese, fordi den taler, lytter og kalder jeres systemer i én model. Du skal stadig bygge integrationen til telefoni, for eksempel via LiveKit, Pipecat eller Agora, og give agenten værktøjer mod jeres CRM og ERP. Husk, at sessioner med ren lyd som udgangspunkt er begrænset til 15 minutter. Start med et afgrænset flow som ordrestatus, før I lader den tage alle opkald.
Hvad koster Gemini 3.8 Live?+
Begge modeller koster cirka 0,005 dollar pr. minut lyd ind og 0,018 dollar pr. minut lyd ud, omregnet fra 3 og 12 dollar pr. million tokens. Tekst koster 0,75 dollar ind og 4,50 dollar ud pr. million tokens. Artificial Analysis har målt den reelle udgift til 0,84 dollar pr. time inputlyd for standardmodellen og 3,50 dollar for Extended Thinking. Til sammenligning koster OpenAIs GPT-Live-1 0,05 dollar pr. minut plus backend-model, og xAIs Voice Agent API koster 0,08 dollar pr. minut.
Skal kunderne have at vide, at de taler med en AI?+
Ja. EU AI Act artikel 50, stk. 1, kræver, at personer informeres om, at de interagerer med en AI, senest ved første interaktion, medmindre det er åbenlyst. Pligten gælder fra 2. august 2026 og blev ikke udskudt af Digital Omnibus. Googles SynthID-vandmærke i lyden erstatter ikke den oplysning. Læg en kort replik ind i starten af opkaldet og giv kunden mulighed for at komme videre til en medarbejder.
Taler Gemini 3.8 Live dansk?+
Ja. Live API understøtter 97 sprog, og dansk står på listen med koden da. Modellen opdager selv, når kunden skifter sprog midt i samtalen, og holder accenten stabil på tværs af skiftet. Test altid med jeres egne produktnavne, adresser og ordrenumre, før I går i drift, fordi hverken Google eller Artificial Analysis har offentliggjort separate resultater for dansk.
Hvor kan vi bruge modellerne i dag?+
Udviklere kan bruge begge modeller i Gemini API og Google AI Studio fra 15. september 2026. I Gemini Enterprise er de i privat preview, og de kommer senere til Gemini Enterprise for Customer Experience. Standardmodellen kører i Search Live, mens Extended Thinking kører i Gemini Live-appen og i Workspace: Docs for Google AI Pro og Ultra samt Gmail og Keep for alle Google AI-abonnenter.
Er Gemini 3.8 Live klar til bank- og forsikringssager?+
Ikke uden et menneske i loopet. På Sierras τ³-Banking-test løser Extended Thinking 35,1 procent af de realistiske bankforløb, hvilket er bedst af de testede modeller, men stadig kun godt 1 ud af 3 sager. Brug agenten til identifikation, opslag og forberedelse af sagen, og lad en medarbejder godkende beslutninger om penge, dækning og erstatning.