Pika ha publicado cuatro modelos de audio a la vez: Soundtrack, Music, SFX y Speech. Están disponibles desde el 14 de agosto a través de su Pika API Club.
Lo interesante no es la lista de modelos, es cómo los presenta. Toda la comunicación está montada sobre coste por segundo generado y sobre tiempo de cálculo, no sobre calidad percibida. Es la primera vez que un lanzamiento de audio generativo se argumenta así de frente.
Puntos clave
- Cuatro modelos: banda sonora a partir de vídeo, música, efectos de sonido y voz.
- Soundtrack cuesta 0,617 dólares por segundo y dice ser el doble de eficiente que Hunyuan Foley.
- Music genera 90 segundos de canción en 6,21 segundos de cálculo.
- Speech alcanza un factor de tiempo real de 0,02: un minuto de voz sale en aproximadamente un segundo.
- Pika reclama ser 9 veces más eficiente en coste que ElevenLabs v3 y 2 veces más que Fish Audio.
Qué hace cada uno
Soundtrack coge un vídeo y le pone música, voz, ambiente y efectos sincronizados con el movimiento de la imagen. Es la pieza que más trabajo manual quita: hoy eso lo hace una persona colocando efectos fotograma a fotograma. En sus pruebas cubre 529 segundos de vídeo con 0,617 segundos de cálculo por cada segundo generado, y la compañía afirma haber conseguido la mejor alineación semántica del campo probado.
Music genera canciones completas de hasta 6 minutos desde un texto, una letra, una referencia vocal o una referencia musical. Noventa segundos de canción salen en 6,21 segundos, unas 14,5 veces más rápido que escucharla.
SFX produce efectos de sonido de hasta 20 segundos a 44,1 kHz en estéreo, con la generación completa en 0,847 segundos.
Speech hace texto a voz de hasta 5 minutos a 48 kHz, con voces preajustadas o clonadas, y un factor de tiempo real de 0,02. Eso significa que un minuto de voz tarda alrededor de un segundo en generarse.
La comparación de precio, con su asterisco
Las cifras de eficiencia que publica Pika van contra rivales con nombre y apellido. En voz: 9 veces más eficiente que ElevenLabs v3, 4,5 veces más que Cartesia y que ElevenLabs Turbo, y 2 veces más que Fish Audio. En música, hasta 10 veces más eficiente que modelos comparables. En efectos, hasta 20 veces.
Conviene ponerle el asterisco de siempre: son mediciones propias, publicadas por la empresa que vende el producto, y "eficiencia de coste" es una métrica que admite muchas definiciones. Nadie de fuera lo ha replicado todavía.
Dicho eso, publicar precio por segundo y tiempo de cálculo es más verificable que publicar una nota de calidad subjetiva. Cualquiera con acceso a la API puede comprobar en una tarde si el coste por segundo se sostiene con su material.
Por qué importa
Si produces vídeo para marketing con regularidad, el audio es la partida que sigue haciéndose a mano cuando el resto ya está automatizado. Se genera la imagen con IA, se monta con IA, y luego alguien pasa dos horas colocando una pista de música de banco y unos efectos.
Lo que cambia con un precio por segundo publicado es que puedes hacer la cuenta antes de probar. Coge tu volumen mensual de vídeo en segundos, multiplícalo por 0,617 dólares y compáralo con lo que pagas hoy en licencias de música de banco más las horas de la persona que monta el audio. Si el número sale muy por debajo, merece una prueba de dos semanas. Si sale parecido, no lo toques.
La clonación de voz de Speech tiene una consideración aparte que no es técnica. Si vas a clonar la voz de alguien de tu equipo para locuciones, ponlo por escrito con esa persona antes. Es de las cosas que salen baratas de hacer y caras de arreglar.
Relacionado


