Meituan ha publicado LongCat-Video-Avatar 1.5 en Hugging Face con licencia MIT. Le das una foto y un audio, y devuelve un vídeo de esa persona hablando con los labios sincronizados. También funciona al revés, generando el vídeo desde texto y audio, y admite continuar un vídeo ya empezado.
Puntos clave
- Licencia MIT, uso comercial sin restricciones.
- Tres modos: audio y texto a vídeo, audio e imagen a vídeo, y continuación de vídeo.
- Soporta uno o varios personajes, con dos pistas de audio en modos de mezcla y concatenación.
- Inferencia en 8 pasos por destilación DMD2, con cuantización INT8 y FlashAttention-2/3.
- Salidas a 480p y 720p; funciona con anime, animales y escenas reales.
Los 8 pasos son el dato
En generación de vídeo, el número de pasos de inferencia decide si algo es usable o es una demo. Los modelos de difusión clásicos necesitan decenas de pasos por fotograma, y eso convierte cualquier vídeo de treinta segundos en minutos de GPU cara.
Meituan ha destilado el modelo con DMD2 hasta dejarlo en 8 pasos. Con cuantización INT8 encima, esto entra en hardware que no es de centro de datos.
Para la sincronización labial usa Whisper-Large como codificador de audio, el modelo de reconocimiento de voz de OpenAI. Tiene lógica: si quieres que los labios cuadren con el sonido, necesitas entender qué fonemas hay y cuándo, y Whisper es bueno en eso y está disponible.
La evaluación que sí han hecho
Merece la pena señalar cómo han medido, porque en generación de vídeo casi nadie publica esto.
508 pares de imagen y audio, seis escenarios de uso, dos idiomas, dos estilos visuales. 770 evaluadores puntuando cada vídeo del 1 al 5 en apariencia humana. 13.240 juicios en total.
Es evaluación humana a escala, que es lo único que sirve aquí. No hay métrica automática que capture el momento en el que un vídeo cruza el valle inquietante. La única forma de saberlo es preguntar a mucha gente.
De dónde viene Meituan
Meituan es una plataforma china de reparto y servicios locales, no un laboratorio de IA. Y lleva un año publicando modelos serios. En julio contamos que entrenó LongCat-2.0, de 1,6 billones de parámetros, sin un solo chip occidental.
Este lanzamiento encaja en el patrón chino que se repite desde hace meses: publicar con licencias permisivas mientras los laboratorios estadounidenses cierran las suyas. ByteDance hizo lo mismo esta semana con Seedance 2.5 y con DeerFlow 2.0.
Por qué importa
Para una empresa que hace formación interna, atención al cliente o comunicación de producto, esto abre una posibilidad concreta: locuciones con cara, en varios idiomas, sin volver a grabar.
Y trae el riesgo obvio. Una foto y un audio bastan para poner a alguien a decir lo que sea, con licencia MIT y ejecutable en local. Justo la semana en que la UE ha empezado a exigir etiquetado de deepfakes, sale un modelo abierto que los genera en 8 pasos.
Si lo vas a usar en tu empresa, dos reglas que aplicaría yo. Consentimiento por escrito de cualquier persona cuya cara aparezca, aunque sea un empleado y aunque sea para uso interno. Y etiqueta el resultado como generado con IA, sin esperar a que te obliguen.
Relacionado


