Google lance Gemini 3.8 Live et 3.8 Live Extended Thinking, deux modèles vocaux avancés
Google DeepMind introduit deux nouveaux modèles d'IA conversationnelle vocale, Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, conçus pour des interactions plus naturelles, fluides et intelligentes. Ces modèles intègrent le raisonnement en temps quasi réel, la compréhension visuelle et l'exécution de tâches complexes en arrière-plan sans interrompre la conversation. Disponibles dès aujourd'hui via l'API Gemini, Google Workspace et l'application Gemini, ils marquent une étape décisive dans la maturation des agents vocaux pour les entreprises et les développeurs.
Points clés
- Gemini 3.8 Live Extended Thinking se classe premier au Speech to Speech Quality Index d'Artificial Analysis avec un score de 82,6, et obtient 68,6 % sur le benchmark d'achèvement de tâches agentiques tau-Voice ainsi que 35,1 % sur le benchmark tau-Voice-banking de Sierra.
- Gemini 3.8 Live prend en charge la détection et la transition automatique entre 97 langues au cours d'une même conversation, sans intervention de l'utilisateur.
- Les deux modèles permettent l'exécution d'appels d'outils et d'API en arrière-plan pendant que la conversation continue, grâce à des signaux verbaux précoces comme « Laissez-moi vérifier... » pour maintenir un flux naturel.
- Gemini 3.8 Live Extended Thinking obtient 97,7 % sur le benchmark Big Bench Audio, démontrant des capacités de raisonnement particulièrement robustes pour des tâches complexes.
- Ces modèles sont déployés dans Google Workspace (Docs Live, Gmail Live, Keep Live), dans Google Search Live pour l'assistance au dépannage, et disponibles pour les développeurs via l'API Gemini et Google AI Studio.
- Tous les contenus audio générés sont filigranés de manière imperceptible via la technologie SynthID, afin de garantir la détectabilité des contenus produits par l'IA et de limiter les risques de désinformation.
Analyse
La distinction entre les deux modèles répond à des besoins très différents. Gemini 3.8 Live est conçu pour l'efficacité à grande échelle et la rentabilité, en ciblant les cas d'usage courants où la fluidité conversationnelle et le traitement visuel en temps quasi réel sont prioritaires. Gemini 3.8 Live Extended Thinking, lui, vise les workflows à haute complexité où le raisonnement multi-étapes est indispensable, sans pour autant sacrifier la naturalité de l'échange. Cette bifurcation stratégique permet à Google de couvrir simultanément les marchés grand public et entreprise avec un positionnement tarifaire ajusté à chaque segment.
L'intégration du raisonnement simultané à la parole constitue une avancée technique notable. Jusqu'ici, les modèles de type chain-of-thought interrompaient l'interaction le temps de produire une réponse élaborée. Gemini 3.8 Live Extended Thinking est capable de raisonner et de s'exprimer en parallèle, en narrant sa progression au fil des étapes. Cette architecture répond directement aux attentes des entreprises souhaitant déployer des agents vocaux capables de gérer des transactions complexes (réservations multi-étapes, onboarding, création de contenu) sans générer de silences ou de ruptures de flux qui dégradent l'expérience utilisateur.
Les résultats sur EVA-Bench de ServiceNow illustrent un point stratégique majeur: ces modèles ne se contentent pas d'être performants sur des benchmarks académiques, ils font progresser la frontière de Pareto entre précision et qualité conversationnelle pour des workflows complexes en production. Pour les agences et les responsables marketing, cela signifie que des cas d'usage autrefois réservés aux équipes techniques spécialisées deviennent accessibles via des interfaces vocales naturelles, ce qui ouvre de nouvelles perspectives d'automatisation et de personnalisation à l'échelle.
L'écosystème partenaire qui s'articule autour de l'API Gemini Live (plateformes de streaming en temps réel, frameworks d'orchestration d'agents, outils de déploiement) constitue un levier d'adoption déterminant. En permettant aux développeurs de se concentrer sur l'expérience utilisateur plutôt que sur la gestion de l'infrastructure media en temps réel, Google facilite l'émergence rapide d'une nouvelle génération d'interfaces vocales en production. Pour les agences, cela se traduit concrètement par la possibilité de construire ou d'intégrer des agents vocaux capables dans des délais plus courts et avec moins de ressources techniques dédiées.
Le filigrane imperceptible SynthID sur l'ensemble des sorties audio est un signal fort envoyé à l'ensemble de l'industrie en matière de responsabilité. En rendant les contenus générés par l'IA systématiquement détectables, Google anticipe les exigences réglementaires croissantes en matière de transparence de l'IA, notamment en Europe. Pour les équipes marketing, cela implique de penser dès maintenant aux implications de l'utilisation de contenus vocaux générés par l'IA dans leurs productions, notamment en termes d'obligations de divulgation et de gouvernance éditoriale.
Que faire
- Tester sans attendre les deux modèles via l'API Gemini et Google AI Studio afin d'évaluer leur pertinence pour des cas d'usage internes précis, notamment la création de contenu vocale, l'assistance client ou l'onboarding employé.
- Structurer les contenus éditoriaux et les bases de connaissances de manière à répondre à des requêtes complexes et multi-étapes, car les agents vocaux de nouvelle génération ont besoin de sources claires, contextuelles et bien balisées pour produire des réponses précises.
- Anticiper l'intégration de Search Live dans les stratégies SEO en optimisant les pages pour des réponses directes et conversationnelles, notamment via des formats question-réponse, des instructions pas à pas et des données structurées adaptées aux interfaces vocales.
- Auditer les workflows internes éligibles à une automatisation par agent vocal (réservations, suivi de dossiers, support technique, génération de rapports) afin d'identifier les gains de productivité réalisables avec Gemini 3.8 Live Extended Thinking en environnement Workspace.
- Définir une politique interne de gouvernance pour les contenus audio générés par l'IA, en prenant en compte le filigrane SynthID et les obligations de transparence potentielles, afin d'éviter des risques réputationnels ou réglementaires lors de la diffusion de ces contenus.
- Suivre de près les déploiements en private preview dans Gemini Enterprise afin d'être en mesure d'accéder rapidement aux fonctionnalités avancées dès leur disponibilité générale, et de garder une longueur d'avance sur les concurrents dans l'adoption des agents vocaux intelligents.
L'intégration native de ces modèles dans Google Search Live et Google Workspace modifie directement la manière dont les utilisateurs interagissent avec les résultats de recherche et les outils bureautiques, ce qui implique que les contenus doivent être optimisés pour répondre à des requêtes vocales complexes et multi-étapes. Pour les équipes SEO, la montée en puissance des agents vocaux capables de raisonner en temps réel renforce l'importance d'une structuration claire et contextuelle des informations, afin d'être correctement interprétés et restitués par ces interfaces conversationnelles.