MiniMax ha presentado H3, un modelo multimodal que genera y edita vídeo de hasta 2K con audio estéreo nativo, y anuncia que abrirá los pesos en los próximos días. El dato que lo hace relevante para una empresa es el precio: dice cobrar menos de un tercio por segundo que los modelos habituales a esa resolución. Está detallado en el blog de MiniMax.
Puntos clave
- Vídeo de hasta 2K y 15 segundos por generación, con opción a 768p.
- Audio estéreo nativo incluido por defecto, no añadido después.
- Acepta texto, imágenes, vídeo y audio como referencias de entrada.
- Menos de un tercio del precio por segundo a 2K frente a los modelos convencionales, y menos de la mitad a 768p contra los 720p de la competencia.
- MiniMax dice que liberará los pesos en los próximos días, sujeto a la regulación aplicable.
Lo del audio no es un extra
La mayoría de generadores de vídeo producen imagen y luego alguien pega sonido encima, o el propio sistema genera pistas separadas de voz, efectos y música que después se mezclan.
H3 modela todo el audio a la vez como una sola salida. Voz, efectos ambientales y música salen del mismo proceso que la imagen. La ventaja práctica es la sincronización: los pasos suenan cuando el pie toca el suelo, sin trabajo de posproducción.
La contrapartida es el control. Si el audio sale unificado, separar la voz para doblarla al español es más difícil que si vinieran pistas independientes. Para contenido en castellano eso no es un detalle menor.
Las tecnologías que nombra y lo que no dice
MiniMax cita tres piezas: H3-VAE, el transformer H3-Omni y algo que llama regeneración en contexto. No publica el número de parámetros, y en su propio texto reconoce que el tamaño actual del modelo "deja margen de mejora".
Tampoco publica comparativas de benchmark contra Sora, Veo o Kling. Es una omisión llamativa en un lanzamiento de vídeo, donde las tablas comparativas son la norma. Lo prudente es tratar las afirmaciones de calidad como pendientes de verificar y quedarse con lo que sí es comprobable: resolución, duración, modalidades y precio.
Otro modelo chino abierto en la misma semana
Se junta con Qwen3.8-Max de Alibaba y con el DeepSeek-V4-Flash que rinde como Opus 4.8 a 28 céntimos por millón de tokens. Tres laboratorios chinos, la misma semana, con la misma jugada: rendimiento comparable, precio muy por debajo y pesos abiertos.
Los quince segundos de duración máxima marcan el techo de uso. Da para un anuncio corto, un plano de producto o una pieza social, no para nada narrativo. Seedance 2.5 de ByteDance ya llega a 30 segundos en 4K, así que la carrera va rápida.
Qué se puede hacer con quince segundos
Merece la pena aterrizarlo, porque la duración máxima decide los casos de uso mucho más que la resolución.
Quince segundos cubren un anuncio de redes, un plano de producto girando, una transición de marca o una pieza de stock para meter en un montaje mayor. No cubren nada con dos escenas y un desarrollo, ni una demostración de producto explicada.
El flujo realista es generar piezas cortas y montarlas después. Lo que ahorra el audio nativo es que cada pieza llega ya con su sonido ambiente sincronizado, y eso quita la parte más tediosa de juntar diez clips generados por separado.
Por qué importa
Si generas vídeo para marketing, el cálculo que importa es el coste por pieza publicable, no el coste por generación. Y ese cálculo depende de cuántos intentos necesitas antes de sacar algo usable.
Un modelo un tercio más barato con audio sincronizado de serie cambia ese número dos veces: pagas menos por intento y te ahorras el paso de sonido. Si además libera los pesos, se puede correr en tu propia infraestructura, que es lo que abre la puerta a generar cientos de variantes de una creatividad sin que la factura se dispare.
El aviso: pesos abiertos de un laboratorio chino significa revisar la licencia y decidir dónde corre antes de meterlo en un flujo con material de marca. Para pruebas, adelante. Para producción con datos de clientes, lee la letra pequeña primero.
Relacionado


