Google lanza Gemini 3.5 Transcribe con 2,6% de error y 85 idiomas

Google lanza Gemini 3.5 Transcribe con 2,6% de error y 85 idiomas
Fuente: blog.google

Google ha lanzado Gemini 3.5 Transcribe, su nuevo modelo de voz a texto, con una tasa de error de palabra del 2,6% sin streaming y detección automática de más de 85 idiomas. La novedad práctica es que devuelve el texto ya limpio: sin muletillas, formateado y con las autocorrecciones del hablante resueltas.

Puntos clave

  • 2,6% de tasa de error de palabra sin streaming y 4,0% de media en streaming, según las medidas de Artificial Analysis. En el benchmark FLEURS marca 5,04% y 5,50%.
  • Más de 85 idiomas con detección automática, incluidos los cambios de idioma en mitad de una frase.
  • 70% menos de latencia que Chirp 3 en tiempo hasta la transcripción final.
  • Diarización de hasta 3 hablantes (más de 3 en experimental) y marcas de tiempo por palabra.

La diferencia está en lo que borra

Un transcriptor clásico te devuelve lo que se dijo. Este devuelve lo que se quiso decir.

Google pone el ejemplo de una frase con corrección hablada: "nos reunimos el martes, no, miércoles". El modelo entiende que el martes queda anulado y escribe el miércoles. Lo mismo con los "eh" y los "mmm", que desaparecen, y con el formato, que se aplica solo.

Para quien haya limpiado a mano una transcripción de reunión de una hora, ese trabajo es la mitad del trabajo. Aquí viene hecho.

Se puede además pasar vocabulario propio, que es lo que arregla el problema clásico de las transcripciones en empresa: nombres de producto, apellidos de clientes y siglas internas que ningún modelo genérico acierta.

Dos endpoints, dos usos distintos

Para desarrolladores hay dos vías. `gemini-3.5-transcribe-live` vive en la Live API y hace streaming en tiempo real con latencia por debajo del segundo. `gemini-3.5-transcribe` vive en la Interactions API y es para audio ya grabado.

Ambos están en Google AI Studio y en Antigravity. En empresa llega por la Gemini Enterprise Agent Platform, con la parte de atención al cliente anunciada para después.

Google no ha publicado precios en el anuncio, que es el dato que falta para hacer números de verdad.

Y en el móvil, sin API de por medio

La otra mitad del lanzamiento es de consumo. El modelo entra en Gboard en Android bajo la función Rambler, en la app de Gemini para macOS y en Chrome próximamente.

Rambler es el nombre que Google le da a hablar sin estructura y recibir texto ordenado. Hablas atropelladamente durante dos minutos y sale un párrafo escrito.

Entre los clientes que Google cita están Vivo, Intellitek Health, Lingopal, Stream y Agora, todos por la parte de latencia y cobertura de idiomas.

Por qué importa

Si tu empresa transcribe llamadas comerciales, entrevistas o reuniones, el cálculo cambia con el 2,6%.

A ese nivel de error el texto es utilizable sin revisión humana para uso interno: buscar en el histórico, alimentar un CRM, extraer acuerdos de una reunión. Por encima del 5% seguía haciendo falta que alguien lo repasara, y ese repaso era lo que mataba el proyecto.

Con soporte de 85 idiomas y cambio de idioma en directo, además, deja de ser un problema el equipo que mezcla castellano e inglés en la misma llamada. Que en cualquier empresa española con clientes fuera es la norma, no la excepción.

Lo que falta para decidir es el precio. Sin eso no se puede comparar con Whisper corriendo en tu propio servidor, que sigue siendo la alternativa cuando el volumen es alto y el audio no puede salir de casa.

Fuente original: Google


Relacionado