Fish Audio levanta 52 millones y saca S2.1 Pro, que clona una voz con 5 segundos de audio

Fish Audio levanta 52 millones y saca S2.1 Pro, que clona una voz con 5 segundos de audio
Fuente: techcrunch.com

Fish Audio ha levantado 52 millones de dólares en una ronda semilla y ha abierto al público S2.1 Pro, su modelo de voz. El dato que importa no es la ronda: el modelo clona una voz a partir de 5 segundos de audio, y en la demo de lanzamiento los fundadores dejaron que el sistema copiara las suyas en directo.

Puntos clave

  • 52 millones de ronda semilla, liderada por Coreline Ventures y Capital Today, con 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners y HF0 dentro.
  • 21 millones de dólares de ARR y más de 8 millones de usuarios en poco más de un año de vida. El repositorio abierto pasa de 31.000 estrellas en GitHub.
  • S2.1 Pro clona con 5 segundos de audio, habla 83 idiomas y permite ajustar emoción, entonación y ritmo palabra por palabra.
  • La empresa afirma que va 2 veces más rápido que Cartesia y cuesta la sexta parte que ElevenLabs, y que en pruebas ciegas el 67% de los oyentes prefirió su voz.
  • HeyGen, LiveKit, Retell, Sanas y OpenArt ya lo tienen en producción.

Quién está detrás

La empresa la dirigen Rissa Cao, que venía de trabajar en Alexa en Amazon, y Shijia Liao, exinvestigador de Nvidia. Las dos casas que más dinero han metido en voz sintética durante la última década, y de ahí salen los dos fundadores de la startup que ahora les compite en precio.

Su recorrido es el de un proyecto abierto que se monetizó tarde. Los modelos anteriores están publicados con pesos abiertos, y esa comunidad es la que ha ido subiendo la biblioteca de voces que alimenta la calidad de la copia. S2.1 Pro rompe con eso: solo se accede por API de pago. Es el movimiento clásico de abrir para captar y cerrar para cobrar.

Qué cambia técnicamente

Clonar una voz decente hace dos años pedía minutos de grabación limpia y un proceso de entrenamiento por cada voz. Aquí son 5 segundos y el resultado sale al momento, mientras hablas. Eso quita del medio el único freno práctico que quedaba: el tiempo.

El control por palabra es el otro salto. No se le pide al modelo "lee esto contento", se le marca dónde sube el tono, dónde acelera y dónde hace la pausa. Para doblaje, atención al cliente o vídeo, la diferencia entre una voz que suena a robot y una que pasa desapercibida está casi toda ahí.

Sobre el precio conviene ser exacto: la comparación de 1/6 frente a ElevenLabs y de 2x frente a Cartesia la da la propia empresa, no un tercero. La compañía ha anunciado además que S2.1 Pro estará gratis hasta el 31 de agosto, que es la forma más rápida de comprobarlo sin creerse el gráfico de nadie.

Por qué importa

Si en tu operativa hay algún paso que se valida porque alguien reconoce una voz al teléfono, ese control acaba de perder valor. Confirmar un cambio de cuenta bancaria, autorizar un pago urgente, dar el visto bueno a un envío por nota de audio: cinco segundos de tu voz están en cualquier vídeo de LinkedIn, en una entrevista de podcast o en un mensaje que mandaste a un grupo.

No hace falta un plan de seguridad de tres meses. Hace falta una regla de dos canales para cualquier operación con dinero, escrita y comunicada esta semana. Quien la tenga desde antes de que esto fuera barato, la seguirá teniendo. Quien la deje para el trimestre que viene, se la aprenderá cuando le pase.

Y en el otro lado del tablero, si estás pagando ElevenLabs para locutar vídeo o atender llamadas, este mes hay una ventana para medir la alternativa sin coste. Los números de la comparativa son suyos. Los de tu factura son tuyos.


Relacionado