Meta lanza Muse Voice Transcribe: 3,1% de error y 20 hablantes a la vez

Meta lanza Muse Voice Transcribe: 3,1% de error y 20 hablantes a la vez
Fuente: research.meta.ai

Meta Superintelligence Labs ha lanzado Muse Voice Transcribe, su primer modelo de percepción de audio en tiempo real, y la cifra que lo vende es un 3,1% de tasa de error de palabra en transcripción de streaming. Hace tres cosas que normalmente requieren tres sistemas encadenados: transcribe, separa quién habla y detecta cuándo termina cada intervención.

Puntos clave

  • Tasa de error de palabra (WER) del 3,1% en la transcripción final de streaming. Meta dice que es la primera posición en el ranking de Artificial Analysis de speech-to-text en streaming.
  • Error de diarización del 17,5% de media en los conjuntos de prueba públicos. La diarización es identificar quién dice cada cosa.
  • Más de 20 hablantes separados en grabaciones de más de una hora, y todo desde un único modelo, sin post-proceso.
  • Entrenado con más de 70 idiomas, de los cuales 25 están verificados a fondo. Entre ellos el español, el chino, el francés, el hindi, el japonés y el vietnamita.
  • Latencia de aproximadamente 0,16 segundos, con retardo adaptativo.

Por qué juntar las tres tareas importa

El montaje habitual para transcribir una reunión son tres piezas. Un modelo que pasa audio a texto. Otro que decide dónde empieza y acaba cada turno de palabra. Y un tercero que asigna cada turno a un hablante.

Cada pieza mete su propio error, y los errores se acumulan. Si el detector de turnos corta mal, la diarización asigna la frase al hablante equivocado, y el texto queda inservible aunque la transcripción sea correcta.

Muse Voice Transcribe hace las tres en el mismo paso. Eso es lo que Meta subraya cuando dice "sin post-proceso": no hay una segunda pasada que arregle lo que la primera dejó torcido.

El code-switching y el sesgo por contexto

Dos detalles que se van a notar en España más que en Estados Unidos.

El primero es el code-switching: cambiar de idioma a mitad de frase. Es lo que hace cualquier reunión de una empresa española con equipo internacional, o cualquier conversación técnica donde media terminología está en inglés. Los transcriptores clásicos se atascan justo ahí, porque tienen que elegir un idioma para toda la sesión.

El segundo es el sesgo por idioma, palabras clave y contexto. Puedes darle al modelo una lista de términos, nombres de producto o apellidos, y mejora el acierto sobre esos. Cualquiera que haya visto una transcripción destrozar el nombre de su empresa entiende para qué sirve.

Google fue por el mismo camino hace unos días con Gemini 3.5 Transcribe y sus 85 idiomas. La diferencia de Meta está en el tiempo real y en la diarización.

Dónde se usa ya

Disponible desde el 1 de septiembre a través de la Meta Model API, y funcionando por dentro en Meta AI para Mac y en Muse Code, donde da el dictado por voz.

Meta no menciona licencia abierta. Es tecnología propietaria de Superintelligence Labs, servida por API. Quien esperaba otro Llama de audio se queda con las ganas.

Por qué importa

Los 0,16 segundos de latencia son el número que decide qué se puede construir encima. Con ese margen, la transcripción deja de ser algo que lees después de la reunión y pasa a ser algo que ocurre mientras hablas: subtítulos en vivo, un agente que escucha una llamada de soporte y busca en la base de conocimiento a la vez, notas que se escriben solas.

Para una empresa española con equipo repartido, el caso más directo son las llamadas de ventas y de soporte. Transcritas, con quién dijo qué, y en español mezclado con inglés sin que se rompa.

Antes de meterlo en producción, dos comprobaciones. El 17,5% de error de diarización es una media: en una sala con eco y gente hablando encima, sube. Y al ser API propietaria, el audio sale de tu infraestructura. Si son llamadas con datos de cliente, eso pasa por legal antes que por producto.

Fuente original: research.meta.ai


Relacionado