FLUX 3 Video genera clips de 20 segundos con audio nativo y lip-sync en catorce idiomas

FLUX 3 Video genera clips de 20 segundos con audio nativo y lip-sync en catorce idiomas
Fuente: bfl.ai

Black Forest Labs ha lanzado FLUX 3 Video, un modelo que genera clips de hasta 20 segundos con el audio creado a la vez que la imagen y lip-sync en catorce idiomas. Sale en 720p y 1080p, y cuesta desde 0,17 dólares por segundo vía API.

El laboratorio alemán ya había sacado FLUX 3 en julio, con vídeo y control de audio. Lo de ahora es el modelo de vídeo separado y afinado, con duración larga y sincronía labial de verdad.

Puntos clave

  • Clips de hasta 20 segundos, frente a los 5 u 8 que dan la mayoría de modelos comerciales.
  • Audio nativo, generado junto al vídeo en la misma pasada, no pegado después.
  • Lip-sync en inglés (varios dialectos), chino, español, francés, alemán, japonés, portugués, ruso, italiano, indonesio, turco, hindi y punjabi.
  • Cinco modos: texto a vídeo, imagen a vídeo, keyframes (primer y último fotograma), continuación de hasta 4 segundos de material existente y escenas con varios planos.
  • ELO de 1135 en texto a vídeo según su propia evaluación, por delante de los modelos punteros; empate con Shudu 2.0 en imagen a vídeo.
  • Los pesos abiertos de FLUX 3 Dev están anunciados en el roadmap, sin fecha.

Los 20 segundos importan más de lo que parece

El límite de duración ha sido el freno silencioso de todo el vídeo generativo. Con clips de 5 segundos puedes hacer un plano bonito, pero no puedes contar nada: en cuanto necesitas una frase completa de un personaje, se te acaba el metraje.

Veinte segundos son otra cosa. Caben una frase de dos oraciones, una reacción y un plano de cierre. Es la unidad mínima de un anuncio corto o de la pieza vertical que se publica en redes.

El modo de continuación empuja en la misma dirección: le das hasta 4 segundos de vídeo y audio existente y sigue desde ahí. Encadenando bloques puedes montar piezas más largas manteniendo el personaje y el tono, que es donde casi todos los modelos se rompen.

El audio nativo cambia el flujo de trabajo

Generar el audio en la misma pasada que la imagen suena a detalle técnico y es un cambio de proceso entero.

Cuando el audio va por separado, el montaje real es: generas vídeo, generas voz con otra herramienta, y luego peleas para que los labios cuadren. Ese último paso es donde se va el tiempo y donde salta la sensación de doblaje mal hecho.

Con lip-sync multilingüe integrado, la misma pieza sale en español y en alemán sin rehacer el vídeo. Para una marca que vende en varios países europeos, esa es la diferencia entre grabar cinco versiones de un anuncio y generar cinco versiones de una.

Cuánto cuesta de verdad

0,17 dólares por segundo suena barato hasta que multiplicas. Un clip de 20 segundos son 3,40 dólares por intento. Y con generativo nunca es un intento.

Si cuentas ocho iteraciones para dar con la toma buena, son unos 27 dólares por pieza final. Comparado con rodar, sigue siendo ridículo. Comparado con generar una imagen fija, es dos órdenes de magnitud más caro. El Draft Mode existe justo para eso: previsualizas barato y solo pagas la calidad completa cuando el plano ya te gusta.

El consejo práctico es aburrido pero salva presupuesto: itera en Draft, fija el prompt y el keyframe, y solo entonces lanza la generación final.

Qué mirar si esto entra en tu equipo

Tres cosas antes de meterlo en producción.

La primera, el derecho de uso comercial de las salidas y qué pasa con las caras generadas. Black Forest Labs dice haber evaluado el modelo con Cinder, un tercero independiente, pero la responsabilidad de lo que publiques es tuya.

La segunda, la consistencia de personaje entre bloques. Es el punto donde estos modelos siguen flaqueando y donde se nota si la pieza está hecha con IA o no. Pruébalo con tu propio producto antes de prometerle nada a nadie.

La tercera, los pesos abiertos. Si acaba saliendo FLUX 3 Dev en abierto, el cálculo cambia: pasas de pagar por segundo a pagar por GPU. Para volumen alto y contenido repetitivo eso puede salir mucho más barato, siempre que tengas quien lo mantenga.

En Barner llevamos meses generando imagen de producto con IA en vez de encargar sesiones para cada variante. El vídeo va por el mismo camino, con un año o dos de retraso. Este lanzamiento acorta esa distancia.


Relacionado