
Google accélère sur le terrain de la voix et dévoile Gemini 3.8 Live ainsi que sa déclinaison avancée, selon une note de Google. Le premier modèle vise un déploiement massif et économique pour animer des assistants vocaux instantanés, capables d’échanger dans près de cent langues tout en intégrant des flux visuels en direct.
Cette version standard sert avant tout à fluidifier les interactions du quotidien et le service client automatisé en entreprise. Elle sait notamment exécuter des requêtes en arrière-plan sans interrompre l’échange oral, par exemple pour chercher une fiche technique ou réserver un créneau pendant qu’elle continue de dialoguer.
La réflexion poussée pour les tâches complexes
La mouture Gemini 3.8 Live Extended Thinking cible des cas d’usage nettement plus exigeants qui réclament une véritable planification étape par étape. Elle permet de résoudre des problèmes ardus tout en parlant, par exemple pour générer du code informatique à la volée à partir d’un croquis filmé. Ses capacités sont également évaluées sur des tâches vocales bancaires, notamment à travers le benchmark τ-Voice-banking de Sierra.
Le modèle peut fournir des indications vocales et narrer la progression de certaines tâches complexes en arrière-plan. Ce modèle s’adresse ainsi aux créateurs de logiciels et aux professionnels qui souhaitent déléguer de véritables flux de travail techniques par la voix.
Une intégration directe dans la bureautique
Au quotidien, ces nouveaux outils prennent place au cœur des outils collaboratifs comme la messagerie électronique ou le traitement de texte en ligne. Ces modèles sont également intégrés à certaines expériences de Google Workspace, notamment Docs, Gmail et Keep, afin de faciliter les interactions vocales avec les contenus et les tâches.
Google indique que l’audio généré par ses produits d’IA est associé à un filigrane SynthID imperceptible, conçu pour faciliter la détection des contenus générés par IA. Si la promesse technique impressionne sur le papier, il conviendra de vérifier à l’usage si ces agents vocaux tiennent la cadence sans inventer de fausses réponses.
XS
En savoir plus sur Le blog high-tech & telecom de Xavier Studer
Subscribe to get the latest posts sent to your email.