ElevenLabs lanza Eleven v4: voz con emoción en más de 90 idiomas

ElevenLabs lanza Eleven v4: voz con emoción en más de 90 idiomas
Fuente: elevenlabs.io

ElevenLabs ha lanzado hoy Eleven v4, su nuevo modelo de texto a voz, junto a una versión rápida, Eleven v4 Turbo, pensada para agentes que atienden llamadas. Según la empresa, en pruebas a ciegas un 75% de los oyentes lo prefirieron frente a los modelos de Cartesia, Inworld y Google, y encabeza la clasificación de voz de Artificial Analysis. Está disponible desde hoy por API y en sus aplicaciones.

Puntos clave

  • Dos modelos: Eleven v4, para narración, doblaje y contenido, y Eleven v4 Turbo, para conversaciones en tiempo real.
  • Velocidad del Turbo: unos 150 milisegundos desde que se pide la frase hasta que suena, y unos 100 de cálculo puro. Menos que la pausa normal entre dos personas hablando.
  • Idiomas: más de 90, y una voz grabada en un idioma habla los demás con acento nativo sin perder su timbre.
  • Clonado: el clonado instantáneo necesita 10 segundos de audio, y la versión profesional, de más fidelidad, también funciona con v4.
  • Dónde está: en ElevenAgents (su plataforma de agentes de voz), en ElevenCreative y en la API.

Qué cambia respecto a lo anterior

El texto a voz de hace un par de años leía bien y sonaba plano. El salto de v4, según ElevenLabs, está en que interpreta el tono, el ritmo y la intención del texto antes de decirlo. Su ejemplo: "necesito que mantengas la calma" suena distinto en boca de una médica con un paciente asustado que en la de un personaje de videojuego gritando a su escuadra.

Se controla de dos maneras. Describiendo en lenguaje normal cómo se tiene que decir una frase, o con etiquetas dentro del texto del tipo [se ríe], [dicho con enfado], [lluvia suave] o [suena el móvil]. Las etiquetas ya existían en la versión anterior, y lo que promete v4 es que ahora las obedece con más precisión. También mejora la pronunciación a medida con el alfabeto fonético, útil para nombres de marca, apellidos o términos médicos que el modelo destrozaba.

La otra mejora que importa en producción es la consistencia. Una voz clonada se mantiene igual a lo largo de un audiolibro entero o de una conversación larga, y en diálogos con varios personajes cada uno responde a lo que acaba de decir el otro en vez de sonar como frases grabadas por separado y pegadas.

El Turbo, para los agentes que cogen el teléfono

La parte con más recorrido comercial es el Turbo. Hasta ahora quien montaba un agente de voz tenía que elegir: o una voz expresiva y lenta, o una rápida y monótona. Casi todo el mundo elegía la segunda, y de ahí el tono de robot que tiene la mayoría de centralitas automáticas.

ElevenLabs dice que el Turbo junta las dos cosas, con unos 150 milisegundos hasta la primera palabra. La medición es suya, hecha en septiembre contra Cartesia Sonic 3.6, el TTS de xAI, Gemini Flash-Lite TTS y GPT-4o mini TTS de OpenAI, con la latencia de red restada en todos. Conviene tomarla como lo que es, una prueba del fabricante.

El Turbo está afinado para funcionar con ElevenAgents, su propia plataforma de agentes. Es la jugada de fondo: ElevenLabs quiere que compres el agente entero, voz, transcripción y lógica, en vez de solo la voz para montarla con piezas de otros. Hace diez días lanzó Reception, un recepcionista con IA por 29 dólares al mes, y v4 Turbo es el motor que lo hará sonar mejor.

Idiomas y doblaje

El dato que más interesa a una empresa española es el de idiomas. Una voz grabada en castellano puede hablar en inglés, alemán o japonés con acento nativo y conservando quién es. ElevenLabs asegura que la adherencia al acento es más fuerte que antes: la voz ya no se va escurriendo hacia su acento de origen a mitad de un texto largo, un defecto que la propia empresa reconoce en sus versiones anteriores.

Entre las demos oficiales hay una en castellano y otra en catalán, que se pueden escuchar en el anuncio. Para doblaje y localización, la promesa es que la voz de marca que elijas, sea un actor contratado o una voz diseñada, suena igual en los más de 90 idiomas.

Aquí conviene recordar el lado incómodo. Diez segundos de audio bastan para clonar una voz con alta fidelidad. Es una gran noticia para quien graba un curso, y una mala para cualquier departamento de finanzas que todavía autoriza pagos por una llamada del "director general". La suplantación por voz ya se usa en fraudes a empresas, y cada mejora de clonado la abarata.

Por qué importa

Para una empresa española hay tres usos donde esto se puede probar este mes con poco riesgo.

Atención telefónica de primer nivel: horarios, estado de un pedido, cita previa. Con 150 milisegundos de respuesta y una voz que no suena a contestador, la barrera de que el cliente cuelgue al notar la máquina baja bastante. Empieza por un horario acotado, fuera de oficina, y mide cuántas llamadas se resuelven sin pasar a una persona.

Contenido en varios idiomas: vídeos de producto, formación interna, audios de onboarding. Grabar una vez y sacar cinco idiomas con la misma voz ahorra estudio y locutores, y en e-commerce con venta en Europa se nota rápido.

Y una tarea interna que no cuesta nada: revisar cómo se autorizan hoy los pagos y los cambios de cuenta bancaria de proveedores. Si basta una llamada con la voz de alguien conocido, ese proceso necesita una segunda comprobación por otro canal, con v4 o sin él.

Fuente original: elevenlabs.io


Relacionado