Gemini 3.8 Live och 3.8 Live Extended Thinking lanseras för röstbaserad AI
AI

Gemini 3.8 Live och 3.8 Live Extended Thinking lanseras för röstbaserad AI

I korthet

Google DeepMind introducerar Gemini 3.8 Live och Gemini 3.8 Live Extended Thinking, två avancerade röstmodeller som kombinerar realtidsreasoning, visuell kontextförståelse och flerspråkigt stöd i naturliga samtal. Modellerna finns tillgängliga via Gemini API, Google Workspace och Gemini-appen från och med den 15 september 2026. För marknadsförare och företag innebär detta nya möjligheter att bygga skalbara röstdrivna gränssnitt med hög intelligens och låg latens.

Nyckelpunkter

  • Gemini 3.8 Live Extended Thinking intar förstaplatsen på Artificial Analysis Speech to Speech Quality Index med ett poäng på 82,6 och leder inom agentbaserade uppgifter med 68,6 procent på tau-Voice-benchmarken.
  • Gemini 3.8 Live stödjer automatisk språkväxling mitt i ett samtal med stöd för 97 språk, vilket gör modellen lämplig för globala och flerspråkiga företagsmiljöer.
  • Extended Thinking-modellen kan resonera och tala samtidigt, och använder verbala signaler som 'Låt mig kolla det...' för att hålla konversationen flytande medan komplexa bakgrundsuppgifter körs.
  • Modellerna utför API-anrop och verktygsfunktioner i bakgrunden utan att avbryta samtalet, vilket möjliggör sömlösa agentarbetsflöden i produktionsmiljöer.
  • Partnerskap har etablerats med plattformar som Agora, LangChain, LiveKit och Vercel, samt företag som Salesforce och Genspark, för att möjliggöra snabb driftsättning av röstdrivna gränssnitt.
  • Allt AI-genererat ljud vattenmärks med SynthID, ett omärkbart vattenmärke inbyggt direkt i ljudet för att möjliggöra detektering av AI-skapat innehåll och motverka desinformation.

Analys

Lanseringen av Gemini 3.8 Live markerar ett tydligt skifte mot röstbaserade agentupplevelser som en produktionsklar teknologi. Tidigare har röst-AI präglats av hög latens och begränsad kontextförståelse, men de nya modellerna adresserar dessa brister direkt med realtidsvisuell bearbetning och parallell reasoning. Det innebär att röst inte längre är ett tillägg till textbaserade gränssnitt, utan kan bli det primära interaktionslagret i komplexa arbetsflöden.

Prestandan på branschens ledande benchmarkar är anmärkningsvärd och ger en objektiv bild av modellernas kapacitet. Med 97,7 procent på Big Bench Audio och toppplacering på Speech to Speech Quality Index positionerar sig Extended Thinking-modellen som ett starkt alternativ för företag som hanterar komplexa, flerstegiga uppgifter via röst. Att dessa resultat kombineras med ett konkurrenskraftigt pris gör modellerna attraktiva för skalbar driftsättning.

Integrationen i Google Workspace via Docs Live, Gmail Live och Keep Live signalerar att röstbaserad AI nu är en del av Googles kärnproduktivitetssvit. För marknadsförare och innehållsproducenter innebär detta att arbetsprocesser kan effektiviseras avsevärt, till exempel genom att diktera och redigera dokument, svara på e-post eller skapa marknadsföringsmaterial direkt via röstkommandon i välkända verktyg.

Ur ett SEO- och GEO-perspektiv är integrationen i Search Live särskilt intressant. När Googles sök-ekosystem i allt högre grad hanterar röstbaserade interaktioner förändras hur innehåll behöver struktureras och presenteras för att vara sökbart och tillgängligt. Innehåll som svarar på konversationella frågor, ger steg-för-steg-vägledning och är organiserat för naturligt talspråk kommer att gynnas i dessa sammanhang.

SynthID-vattenmärkningen av allt genererat ljud är en viktig transparensåtgärd som också har implikationer för varumärkestillit. I en tid då AI-genererat innehåll sprids snabbt ger denna teknik företag och konsumenter ett verktyg för att verifiera ursprunget till röstinnehåll, vilket är relevant för allt från kundtjänstautomatisering till marknadsföringskampanjer som använder AI-genererade röster.

Vad du bör göra

  • Undersök möjligheten att integrera Gemini 3.8 Live via API i era befintliga kundtjänst- eller säljprocesser, särskilt om ni arbetar med flerspråkiga målgrupper, eftersom modellen hanterar 97 språk automatiskt.
  • Anpassa er innehållsstrategi för att möta den växande betydelsen av röstbaserad sökning genom att strukturera innehåll i konversationella format, med tydliga fråge- och svarsmönster som matchar hur användare interagerar med Search Live.
  • Testa Extended Thinking-modellen för komplexa agentarbetsflöden, till exempel flerstegsbokningar, teknisk felsökning eller onboardingprocesser, där förmågan att resonera och kommunicera parallellt skapar ett mervärde gentemot enklare röstlösningar.
  • Utforska integrationen i Google Workspace via Docs Live och Gmail Live för att identifiera interna processer som kan automatiseras eller accelereras med röstbaserat stöd, och kartlägg hur detta påverkar produktiviteten i marknadsföringsteamet.
  • Bekanta er med SynthID och dess implikationer för transparens i era kommunikationsflöden, och upprätta interna riktlinjer för hur AI-genererat röstinnehåll märks och kommuniceras till kunder och intressenter.
  • Följ de partnerplattformar som stöder Gemini Live API, som LangChain och LiveKit, för att identifiera möjligheter att snabbt driftsätta röstdrivna prototyper utan att behöva hantera den underliggande infrastrukturen för realtidsmediasströmning.
Påverkan

Röstbaserad AI integreras nu djupare i Googles sökekosystem via Search Live, vilket innebär att röstinteraktioner kan påverka hur innehåll presenteras och konsumeras i sökresultat. Företag som optimerar för röstbaserade agentupplevelser och konversationssökning får en konkurrensfördel i takt med att dessa modeller sprids i Googles produkter.

Officiell källa
Missa inga nyheter

Produktnyheter, algoritmuppdateringar och bästa praxis, direkt i din inkorg.

Tillbaka till bevakningen

Ligg steget före algoritmerna

Pulsar följer dina Google-placeringar, din synlighet i AI:er och dina sociala medier i en enda instrumentpanel. 14 dagars testperiod, utan kreditkort.

Starta en gratis testperiod