OpenAI lanza GPT Transcribe y GPT Live Transcribe: 0,0045 dólares por minuto y menos errores con ruido

OpenAI lanza GPT Transcribe y GPT Live Transcribe: 0,0045 dólares por minuto y menos errores con ruido
Fuente: developers.openai.com

OpenAI ha lanzado dos modelos de transcripcion, GPT Transcribe para audio grabado y GPT Live Transcribe para streaming, segun su blog de desarrolladores. El primero cuesta 0,0045 dolares por minuto, un 25% menos que el modelo que sustituye, y la tasa de error sobre Common Voice baja de alrededor del 40% de whisper-1 a en torno al 19%.

Puntos clave

  • GPT Transcribe: audio grabado, 0,0045 dolares por minuto. El anterior gpt-4o-transcribe costaba 0,006.
  • GPT Live Transcribe: transcripcion en tiempo real, 0,017 dolares por minuto, mismo precio que gpt-realtime-whisper, que salio en mayo de 2026.
  • Sobre el conjunto Common Voice, que cubre 22 idiomas, la tasa de error de palabra cae de en torno al 40% con whisper-1 a alrededor del 19%.
  • La mejora se concentra en tres sitios: jerga tecnica, ambientes ruidosos y acentos o velocidades de habla poco estandar.
  • OpenAI demostro la resistencia al ruido de la version en directo transcribiendo habla con un instrumento musical sonando de fondo.

Por qué la tasa de error importa mas que el precio

Bajar el precio un 25% esta bien. Reducir la tasa de error de palabra a la mitad cambia que casos de uso son viables.

La tasa de error de palabra, o WER, mide el porcentaje de palabras que el modelo se equivoca. Con un 40% de error, una transcripcion sirve para buscar por palabras clave y poco mas: cuatro de cada diez palabras estan mal, asi que ningun proceso automatico puede fiarse de ella. Con un 19%, ya se puede resumir, extraer datos y clasificar sin que un humano revise linea a linea.

Ese salto es el que separa "tengo transcripciones que nadie lee" de "tengo un proceso". Y la parte donde mas se nota, segun la nota de OpenAI, es justo donde el audio real vive: reuniones con ruido, gente hablando con acento, terminologia interna de tu sector que ningun modelo generico conoce.

Los dos modelos resuelven problemas distintos

Conviene no confundirlos porque cuestan casi cuatro veces mas uno que otro.

GPT Transcribe es asincrono. Le mandas un archivo y te devuelve el texto cuando acaba. Sirve para grabaciones de reuniones, llamadas de comercial, entrevistas, formaciones, cualquier cosa que ya paso. Es la opcion barata y es la que cubre la mayoria de casos de una empresa.

GPT Live Transcribe es streaming, transcribe mientras se habla. Sirve para subtitulos en directo, para un agente que necesita reaccionar a mitad de conversacion, para atencion telefonica. Cuesta 0,017 por minuto, casi cuatro veces mas, y solo tiene sentido si de verdad necesitas la respuesta antes de que la frase termine.

El error tipico es montar todo sobre el modelo en directo porque suena mejor. Con audio grabado no lo necesitas.

Adios a Whisper como opcion por defecto

Whisper ha sido durante tres anos la referencia de transcripcion, en buena parte porque era abierto y se podia correr en local. Estos dos modelos no lo son: viven en la API de OpenAI.

Es un cambio de trato. Ganas precision y bajas precio por minuto, pero el audio sale de tu casa y el coste se vuelve variable. Para audio con datos personales o de cliente, eso obliga a revisar el encargo de tratamiento antes de mover nada. Whisper corriendo en tu propio servidor sigue siendo la respuesta cuando el audio no puede salir.

Por qué importa

Haz la cuenta con tus numeros. Una hora de audio con GPT Transcribe cuesta 0,27 dolares. Si tu equipo comercial graba 200 llamadas de 30 minutos al mes, son 100 horas y 27 dolares. Por menos de lo que cuesta una comida de equipo tienes transcritas todas las llamadas del mes con una tasa de error del 19%.

Lo que hace ese numero es cambiar la conversacion. Ya no va de si merece la pena transcribir, va de que haces despues con el texto. Ahi es donde esta el valor de verdad y donde casi nadie llega: sacar las objeciones que se repiten, detectar que producto se menciona y no se cierra, alimentar la base de conocimiento del equipo con lo que dicen los clientes de verdad.

Un consejo practico: si tienes vocabulario propio, nombres de producto, referencias internas, codigos, pasalos como contexto al modelo. La mejora en jerga tecnica que anuncia OpenAI solo se materializa si le dices cual es tu jerga.


Relacionado