OpenAI lanza GPT-Live: modelos de voz que escuchan y hablan a la vez

OpenAI lanza GPT-Live: modelos de voz que escuchan y hablan a la vez
Fuente: openai.com

OpenAI lanzó este 8 de julio GPT-Live, dos modelos de voz nuevos que cambian la mecánica de hablar con ChatGPT. La diferencia gorda: son full-duplex, escuchan y hablan al mismo tiempo. Puedes cortarlos a media frase como cortarías a una persona, y la conversación fluye sin ese turno rígido de "yo hablo, tú hablas" que tenían los asistentes de voz hasta ahora.

Son dos versiones, GPT-Live-1 y GPT-Live-1 mini. Y no llegan como un extra: sustituyen al Modo de Voz Avanzado que ya había en ChatGPT.

Puntos clave

  • GPT-Live son modelos full-duplex: escuchan y hablan a la vez, permiten interrumpir de forma natural y hacen traducción en directo.
  • Muestran señales de que están atentos ("mhmm", "sí"), hacen ida y vuelta rápida o se callan cuando necesitas pensar.
  • Para preguntas que piden búsqueda web o razonamiento, delegan por detrás en el modelo frontera. En el lanzamiento usan GPT-5.5.
  • GPT-Live-1 mini pasa a ser el modo de voz por defecto en ChatGPT; los planes de pago acceden al GPT-Live-1 grande.

Qué cambia frente al modo de voz anterior

El Modo de Voz Avanzado funcionaba por turnos: hablabas, esperaba a que terminaras, procesaba y respondía. GPT-Live rompe ese esquema. Al escuchar y hablar a la vez, puedes interrumpirlo en mitad de una respuesta larga sin tener que esperar, y él ajusta sobre la marcha. Esa misma capacidad es la que habilita la traducción en directo, con las dos partes hablando casi sin pausas.

OpenAI también trabajó el lado humano de la conversación. GPT-Live suelta pequeñas señales de escucha, esos "mhmm" o "sí" que hacemos las personas para indicar que seguimos ahí, mantiene un ida y vuelta ágil y se queda callado cuando detecta que el usuario está pensando. Detalles pequeños que quitan la sensación de estar hablándole a una máquina que espera su turno.

La parte lista va por detrás

El modelo de voz no lo hace todo solo. Cuando la pregunta pide búsqueda web, razonamiento profundo o una tarea más compleja, GPT-Live delega en el modelo frontera de OpenAI, resuelve por detrás y trae el resultado de vuelta a la conversación cuando está listo. En el lanzamiento, ese cerebro de fondo es GPT-5.5, el mismo que OpenAI está empujando en el resto de su stack, como cuando llevó GPT-5.5 a la ciberdefensa de empresas con Cognizant.

O sea, GPT-Live es la capa de conversación, y por debajo tira del modelo pesado solo cuando hace falta. Así mantiene la voz fluida sin cargar cada respuesta con el coste de un razonamiento completo.

Disponibilidad

GPT-Live-1 y GPT-Live-1 mini se están desplegando a los usuarios de ChatGPT en todo el mundo. El mini pasa a ser el modo de voz por defecto para todos, y el modelo grande queda para los planes de pago. OpenAI dice que llevará GPT-Live a la API pronto, y ya abrió el registro para desarrolladores y empresas que quieran integrarlo.

Por qué importa para tu empresa

Una voz que interrumpe, traduce en directo y suena natural cambia el techo de lo que puedes montar sobre voz: atención al cliente, agentes telefónicos, asistentes internos que tu equipo usa hablando en lugar de escribiendo. Mientras GPT-Live viva solo dentro de ChatGPT, es una mejora de producto para el usuario. Cuando llegue a la API, será la pieza que te deja construir tus propios flujos de voz sin montar el andamiaje de transcripción, razonamiento y síntesis por separado. Si tienes un proceso donde hablar es más rápido que teclear, vale la pena ir pensando dónde encajaría.


Relacionado