Google lanza Gemini 3.8 Live y 3.8 Live Extended Thinking para conversaciones de voz avanzadas
Google DeepMind presenta dos nuevos modelos de IA diseñados para llevar las interacciones por voz a un nivel superior de fluidez, inteligencia y razonamiento en tiempo real. Gemini 3.8 Live apuesta por la eficiencia y la escala, mientras que Gemini 3.8 Live Extended Thinking aborda tareas de alta complejidad con razonamiento de múltiples pasos sin interrumpir la conversación. Ambos modelos están disponibles ya para desarrolladores, empresas y usuarios finales a través de la API de Gemini, Google Workspace y la aplicación Gemini.
Puntos clave
- Gemini 3.8 Live Extended Thinking ocupa el primer puesto en el Speech to Speech Quality Index de Artificial Analysis con una puntuación de 82,6, lidera en completación de tareas agénticas con un 68,6% en el benchmark tau-Voice y un 35,1% en el benchmark tau-Voice-banking de Sierra, y obtiene un 97,7% en Big Bench Audio.
- Gemini 3.8 Live soporta 97 idiomas con detección y transición automática en medio de la conversación, procesa entradas visuales en tiempo casi real y ejecuta llamadas a herramientas y APIs en segundo plano sin interrumpir el diálogo activo.
- Gemini 3.8 Live Extended Thinking utiliza señales verbales tempranas como 'Déjame comprobarlo' para reconocer solicitudes de forma natural, y ofrece narración de progreso en vivo mientras gestiona flujos de trabajo complejos de varios pasos.
- Ambos modelos están disponibles desde el 15 de septiembre de 2026 en la API de Gemini y Google AI Studio para desarrolladores, en vista previa privada en Gemini Enterprise y, para el público general, en Search Live y en la aplicación Gemini.
- Todo el audio generado por estos modelos lleva incrustada la marca de agua imperceptible SynthID, diseñada para garantizar la detectabilidad del contenido generado por IA y contribuir a la prevención de la desinformación.
- Plataformas de desarrollo como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents ya integran la Gemini Live API, mientras que empresas como Salesforce, Genspark y Lumeris han destacado sus capacidades de baja latencia, fluidez y llamadas a herramientas.
Análisis
La llegada de Gemini 3.8 Live y su variante Extended Thinking representa un salto cualitativo en la forma en que los sistemas de IA gestionan la conversación por voz. Hasta ahora, los modelos de voz tendían a pausar la interacción mientras procesaban tareas complejas, lo que generaba fricciones perceptibles para el usuario. La capacidad de razonar y hablar de forma simultánea, ejecutando herramientas en segundo plano mientras se mantiene el hilo conversacional, elimina esa fricción y eleva el estándar de lo que se entiende por un agente de voz de nivel de producción.
Desde el punto de vista del marketing y la visibilidad digital, la integración de estos modelos en Google Search Live es especialmente relevante. Los asistentes de búsqueda por voz están ganando protagonismo como punto de contacto entre marcas y usuarios, y la capacidad de proporcionar respuestas de resolución de problemas paso a paso en tiempo real puede desplazar ciertos patrones de búsqueda textual. Las agencias y responsables SEO deben prestar atención a cómo los contenidos están siendo consumidos y referenciados por estos agentes conversacionales dentro del ecosistema de Google.
El rendimiento competitivo documentado con benchmarks específicos como EVA-Bench de ServiceNow, el Speech Agent Arena o el índice de Artificial Analysis otorga a estos modelos una legitimidad técnica que los diferencia de lanzamientos anteriores. Para los equipos de marketing que evalúan soluciones de automatización conversacional, disponer de métricas objetivas sobre calidad, precisión y fluidez facilita la toma de decisiones a la hora de integrar agentes de voz en sus operaciones de atención al cliente o en sus plataformas digitales.
La compatibilidad con 97 idiomas con transición automática en mitad de la conversación abre posibilidades significativas para marcas con presencia internacional. Esto no solo reduce la complejidad técnica de ofrecer soporte multilingüe, sino que también mejora la experiencia del usuario en mercados donde la alternancia de idiomas es habitual, como en comunidades bilingües o en entornos corporativos globales.
La implementación de SynthID como marca de agua de audio responde a una creciente demanda de transparencia en el uso de IA generativa. Para las agencias de marketing, esto implica que cualquier contenido de audio generado con estas herramientas quedará identificado de forma inherente, lo que exige considerar las implicaciones de uso en campañas publicitarias, podcasts sintéticos o materiales de comunicación corporativa donde la autenticidad percibida es un valor clave.
Qué hacer
- Evaluar la integración de la Gemini Live API en los flujos de atención al cliente o en los asistentes virtuales de las marcas gestionadas, aprovechando las capacidades de ejecución en segundo plano para reducir los tiempos de espera percibidos por el usuario.
- Monitorizar el comportamiento de Search Live con las nuevas capacidades de Gemini 3.8 Live para identificar cómo cambia la forma en que los usuarios buscan información por voz y adaptar las estrategias de contenido a los formatos que estos agentes priorizan en sus respuestas.
- Revisar y actualizar las estrategias de contenido conversacional y FAQ estructurado, ya que los agentes de voz avanzados tienden a extraer respuestas directas de contenidos bien organizados, por lo que la calidad y claridad del contenido publicado se vuelve un factor aún más determinante para la visibilidad.
- Considerar la implementación de Gemini 3.8 Live Extended Thinking en Google Workspace para automatizar tareas complejas de producción de contenido, análisis de datos o planificación de campañas, aprovechando las integraciones ya disponibles con Docs Live, Gmail Live y Keep Live.
- Establecer protocolos internos de uso responsable del audio generado por IA, teniendo en cuenta la presencia de SynthID en todos los outputs de voz, y comunicar de forma transparente a clientes y audiencias el uso de tecnología generativa en materiales audiovisuales.
- Mantenerse al tanto de las actualizaciones de los benchmarks sectoriales como el Speech to Speech Quality Index o EVA-Bench para comparar de forma objetiva las capacidades de Gemini 3.8 Live frente a otros modelos de voz del mercado antes de tomar decisiones de inversión tecnológica.
La integración de estos modelos en productos como Google Search Live y Google Workspace abre nuevas posibilidades para los agentes de voz en entornos SEO y de atención al cliente, donde la calidad de la interacción conversacional y la capacidad de ejecutar tareas en segundo plano pueden influir directamente en la experiencia del usuario y en los flujos de captación. Las agencias de marketing deben considerar cómo estos avances redefinen los estándares de asistentes conversacionales en sus estrategias de presencia digital.