> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# Cartesia lanza Sonic-3.6 con más de 40 idiomas y latencia por debajo de 90 milisegundos
- URL: https://www.digitalbrain.news/noticias/cartesia-sonic-3-6-40-idiomas-90-milisegundos/
- Published: 2026-08-18T14:16:11.000Z
- Updated: 2026-08-26T09:05:02.000Z
- Description: Cartesia ha lanzado en beta Sonic-3.6, su modelo de voz con más de 40 idiomas y latencia por debajo de 90 milisegundos, según la página oficial del…
- Author: Ramón Pérez Coronado
- Tags: #noticias, voz-ia, agentes-ia

Cartesia ha lanzado en beta **Sonic-3.6, su modelo de voz con más de 40 idiomas y latencia por debajo de 90 milisegundos**, según la [página oficial del producto](https://www.cartesia.ai/sonic?ref=digitalbrain.news). La compañía dice estar primera en el ranking de Speech Arena y en el de Speech to Text de Artificial Analysis.

## Puntos clave

- **Latencia por debajo de 90 ms**, el umbral por el que una conversación deja de sonar a espera.
- **Más de 40 idiomas** con acentos variados y calidad de hablante nativo.
- **Clonación de voz con 10 segundos de audio** y localización de un clip a 42 idiomas manteniendo emoción, tono e identidad del hablante.
- Expresiones no verbales como la risa se insertan directamente en el texto de entrada.
- Cumplimiento **HIPAA, SOC 2 Type 2, GDPR y PCI**, con opción de despliegue desde nube o local.

## Por qué 90 milisegundos es el número

La latencia es lo que decide si un agente de voz sirve para algo. Por debajo de 100 ms, el cerebro humano procesa la respuesta como parte natural de la conversación. Por encima de 300 ms, el interlocutor nota que habla con una máquina aunque la voz sea perfecta.

Sonic-3.6 se mete por debajo de 90 ms en la síntesis. Ese es el tiempo del modelo de voz solo, sin contar la transcripción de entrada ni el [razonamiento](https://www.digitalbrain.news/guias/que-es-un-modelo-de-razonamiento-en-ia/) del modelo de lenguaje del medio. **Es una pieza del presupuesto de latencia, no el total.**

El modelo también interpreta el subtexto emocional del texto y calibra la entrega automáticamente, en lugar de exigir etiquetas de emoción. Y admite marcas explícitas cuando hace falta: \`\[laughter\]\` intercalado en la frase genera la risa en ese punto.

## Lo que trae para producción

Tres funciones apuntan a uso empresarial más que a demo.

La **clonación con 10 segundos de audio** con alta similitud de hablante permite mantener una voz de marca consistente sin sesiones de grabación. La **localización** coge un clip existente y lo pasa a otro idioma conservando emoción, tono e identidad, con lo que un mismo locutor puede sonar en castellano, francés canadiense e inglés americano.

Los **diccionarios de pronunciación personalizada** resuelven el problema aburrido que hunde estos despliegues: nombres propios, términos de sector y palabras técnicas que el modelo pronuncia mal. Se especifican caso por caso, con notación fonética si hace falta.

La certificación es la otra pata. HIPAA, SOC 2 Type 2, GDPR y PCI, más la opción de ejecutar en local, es la lista que pide un departamento de cumplimiento antes de dejar que una voz sintética hable con clientes.

## Dónde se está usando

Cartesia enumera los casos que ya tiene en producción, y todos son de llamada saliente o entrante con acción detrás: llamar a leads calientes el día que arranca una campaña y agendar en el CRM, cualificar altas en segundos, autenticar a quien llama y resolver consultas de facturación con datos de cuenta en vivo, hacer de cliente simulado para que un comercial practique objeciones, y llamar a candidatos para hacer un cribado antes de volcar el resumen en el sistema de selección.

Ravi Krishnamurthy, VP de producto de una de las empresas que lo usa, apunta a la arquitectura: los modelos de espacio de estados de Cartesia son lo que da la velocidad, y eso es lo que permite desplegar agentes de voz que "entienden, actúan y se adaptan en tiempo real".

## Por qué importa

La voz es el hueco que queda entre los procesos automatizados y el cliente. Se puede automatizar la facturación, el inventario y el reporting, y seguir teniendo a alguien cogiendo el teléfono para decir dónde está un pedido.

Con latencia por debajo de 90 ms y más de 40 idiomas, ese caso concreto entra en rango. Para un negocio con clientes en varios países europeos, un agente que atienda en el idioma del cliente sin contratar un equipo por país cambia la aritmética del soporte.

Con dos advertencias que conviene tener delante. La primera es que **el presupuesto de latencia total lo marca el eslabón más lento**, y normalmente no es la voz sino el modelo que decide qué contestar. La segunda es de expectativas: un agente de voz funciona bien en consultas acotadas, no en una conversación abierta con un cliente enfadado. El sitio donde se gana el dinero es la llamada repetitiva de estado de pedido, no la de retención.

Fuente original: [cartesia.ai](https://www.cartesia.ai/sonic?ref=digitalbrain.news)

---

**Relacionado**

[![Wispr levanta 280 millones a 2.000 millones de valoración y se sale del dictado](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/wispr-280-millones-serie-b-2000-millones-valoracion.jpg)Wispr levanta 280 millones a 2.000 millones de valoración y se sale del dictado](https://www.digitalbrain.news/noticias/wispr-280-millones-serie-b-2000-millones-valoracion/)[![Engram y Harvey bajan la consulta legal de 1,32 a 0,13 dólares metiendo el despacho en el modelo](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/engram-harvey-agente-legal-memoria-013-dolares.png)Engram y Harvey bajan la consulta legal de 1,32 a 0,13 dólares metiendo el despacho en el modelo](https://www.digitalbrain.news/noticias/engram-harvey-agente-legal-memoria-013-dolares/)