Google DeepMind ha lanzado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de conversación hablada que ejecutan herramientas en segundo plano mientras siguen charlando contigo y saltan solos entre 97 idiomas a mitad de frase. El segundo de los dos se coloca primero en el Speech to Speech Quality Index de Artificial Analysis con 82,6 puntos.
Ya están disponibles en la API de Gemini, en Google Workspace, en Search y en la app. No hay lista de espera para la parte de consumo.
Puntos clave
- Gemini 3.8 Live va para volumen: diálogo fluido, comprensión de lo que ve la cámara y precio bajo. Queda segundo en el Speech Agent Arena.
- Gemini 3.8 Live Extended Thinking va para lo difícil: razonamiento en varios pasos mientras mantiene la conversación viva. Primero en el índice de Artificial Analysis con 82,6.
- En tareas de agente por voz marca 68,6% en τ-Voice y 35,1% en el τ-Voice-banking de Sierra, el que simula atención bancaria.
- 97,7% en Big Bench Audio, que mide razonar sobre lo que se oye, no solo transcribirlo.
- 97 idiomas con cambio automático a mitad de conversación.
- El audio sale marcado con SynthID, la marca de agua inaudible de Google.
Qué cambia respecto a un agente de voz normal
Hasta ahora, montar un agente que hable decentemente pedía tres piezas encadenadas: uno que transcribe, un modelo de texto que piensa, y otro que sintetiza la respuesta. Cada eslabón suma su retardo, y el resultado es esa cadencia de walkie talkie que todos hemos sufrido llamando a un banco. Si además el agente tenía que consultar algo, se quedaba mudo esperando.
Estos dos modelos trabajan de audio a audio y resuelven las dos cosas.
La primera es que las llamadas a herramientas ocurren en paralelo. El modelo acepta el encargo, sigue hablando y termina la tarea por detrás. Extended Thinking lo lleva más lejos: razona y habla a la vez, suelta señales verbales tempranas del tipo "déjame que lo mire" y va narrando el progreso de las tareas largas mientras avanzan. Es la diferencia entre un silencio de doce segundos y alguien que te va contando qué está haciendo.
La segunda es el vídeo. Gemini 3.8 Live procesa lo que entra por la cámara casi en tiempo real y usa ese contexto en la respuesta. Google lo enseña con un onboarding de empleados, señalando cosas en pantalla y preguntando, y con una partida de ajedrez donde el modelo mira el tablero y comenta las jugadas.
De las demos que ha publicado, dos son las que le importan a un operador: convertir bocetos a mano en componentes de React hablando por encima de ellos, y coordinar una reserva de varios pasos con llamadas asíncronas sin cortar la conversación. La tercera, montar un plan de negocio y un kit de marketing hablando, es más escaparate que otra cosa.
Los números, con su asterisco
El 82,6 del Speech to Speech Quality Index es un primer puesto en un ranking que se mueve cada pocas semanas, así que vale más como foto del momento que como trono. Lo que sí cuesta más de mover es el 68,6% en τ-Voice y el 35,1% en τ-Voice-banking: esos miden si el agente termina la tarea, no si suena bien. Un tercio de éxito en el escenario bancario deja claro dónde está todavía el techo cuando hay dinero de por medio.
Google también dice que en el EVA-Bench de ServiceNow, otro banco de pruebas para agentes de voz, sus modelos empujan la frontera de Pareto entre precisión y calidad conversacional. Traducido: ya no hay que elegir tanto entre un agente que acierta y uno que se deja escuchar. La nota de prensa aclara que esa medición se corrió sobre la Live API dentro de Gemini Enterprise Agent Platform, que no es exactamente el entorno donde vas a desplegar tú.
Falta el dato que más manda en un agente de voz, que es el precio por minuto. Google repite "altamente competitivo" y "eficiente en coste" para los dos modelos, y deja la cifra para la página de la API. En voz, donde una cola de atención son miles de minutos al mes, esa diferencia decide el proyecto mucho antes que dos puntos de benchmark.
Un detalle que conviene tener presente si vas a poner esto delante de clientes: todo el audio generado sale con SynthID incrustado, la marca de agua inaudible de Google. Es a favor, porque deja rastro de qué se generó, pero significa que la salida es identificable como sintética por quien sepa buscarla.
Dónde se puede tocar hoy
Para desarrolladores, vía Gemini Live API. Google cita integraciones con Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents, que son los que se comen el streaming de audio en tiempo real para que no lo montes tú. Salesforce, Genspark y Lumeris salen como clientes tempranos.
Para empresas, aquí viene el matiz que se pierde en los titulares: Extended Thinking está en preview privada dentro de Gemini Enterprise, y la versión para atención al cliente y para clientes business de Workspace llega "pronto". Es decir, que si tu caso es un call center, hoy puedes probarlo, no desplegarlo.
Para el resto, está en Gemini Live, en Docs para suscriptores de Google AI Pro y Ultra, y en Gmail y Keep para cualquier suscriptor de pago de Google AI. También en Search Live, con ayuda paso a paso mientras apuntas la cámara a lo que se ha roto.
Es la cuarta pieza de Gemini en dos semanas. El 3 de septiembre salió Gemini 3.8 Flash, el 7 Lyria 3.5 para audio y el 9 Google Cloud fichó a Accenture para formar a 1.000 ingenieros en Gemini Enterprise. El ritmo de lanzamiento y el ritmo de venta van coordinados.
Por qué importa
Si tienes atención al cliente por teléfono o por WhatsApp, esto es lo primero que hay que probar este trimestre. Los 97 idiomas con cambio automático resuelven de una sentada el problema de una empresa española que vende en seis mercados y mantiene colas separadas por idioma. Y que la herramienta se ejecute mientras el agente sigue hablando es justo lo que hacía que las demos anteriores se cayeran en cuanto había que consultar un ERP.
Dicho eso, no compres la película del 82,6. El número que tienes que mirar antes de firmar nada es el 35,1% de τ-Voice-banking, porque se parece bastante más a tu operativa real. Prueba primero con el modelo barato sobre una cola de baja consecuencia, mide cuántas conversaciones acaban en escalado humano, y sube desde ahí.
Fuente original: Google DeepMind
Relacionado


