SpaceXAI actualiza Imagine Video 1.5 con voz, 7 referencias y 1080p nativo

SpaceXAI actualiza Imagine Video 1.5 con voz, 7 referencias y 1080p nativo
Fuente: x.ai

SpaceXAI ha actualizado Imagine Video 1.5 con la pieza que le faltaba para producción real: consistencia de personaje. Desde el 1 de agosto el modelo acepta hasta siete referencias de imagen por generación, referencias de voz, generación directa desde texto y salida nativa en 1080p.

El problema que resuelve es el que arruina cualquier intento de hacer una pieza de más de un plano con IA: que el protagonista cambie de cara entre toma y toma.

Puntos clave

  • Hasta 7 elementos fijados por generación: caras, localizaciones u objetos.
  • Referencias de voz para mantener la misma voz entre escenas.
  • Texto a vídeo directo, sin necesidad de una imagen inicial.
  • 1080p nativo en web, iOS y Android.

Qué cambia técnicamente

Hasta ahora, generar una secuencia de varias tomas con el mismo personaje era un ejercicio de suerte y reintentos. Pasabas una imagen de referencia, salía parecido, y en la siguiente escena el pelo cambiaba de tono o la nariz de forma.

Con siete referencias simultáneas, el modelo bloquea varios elementos a la vez. Puedes fijar la cara del protagonista, el producto que sostiene y el local donde está, y generar cinco planos distintos manteniendo los tres.

La referencia de voz cierra el otro flanco. Pasas una muestra de audio y el personaje suena igual en todas las escenas. Sin eso, un vídeo de treinta segundos con tres cortes suena a tres personas distintas.

El texto a vídeo directo elimina un paso del flujo. Antes tenías que generar primero una imagen y usarla como fotograma inicial. Ahora describes la escena y sale el vídeo.

Dónde está disponible

La distribución va escalonada. Las referencias de imagen y voz arrancaron en los planes SuperGrok Heavy y SuperGrok Plus en Estados Unidos, con extensión al resto de niveles en los días siguientes. El texto a vídeo y el 1080p salieron ya en disponibilidad general.

Para desarrolladores, el modelo se llama `grok-imagine-video-1.5` en la API. Las referencias de imagen, el texto a vídeo y el 1080p están accesibles por API. Las referencias de voz, no: hay que pedirlas directamente a la compañía.

Dónde queda frente al resto

El 1080p nativo importa menos de lo que suena, porque casi todo lo que se publica en redes se ve en móvil. Lo que sí marca diferencia frente a Runway, Luma o Kling es el número de referencias simultáneas y que la voz vaya en el mismo sistema en lugar de pegarse después con otra herramienta.

Ese "en el mismo sistema" es la parte con valor real. Cada herramienta que sacas del flujo (un doblador por separado, un paso de edición para sincronizar) es media hora por vídeo y un sitio más donde se rompe la consistencia.

Conviene recordar de qué compañía hablamos. xAI se fundió en SpaceX y pasó a llamarse SpaceXAI en julio, así que el newsroom del producto ya firma con el nombre nuevo aunque la mayoría de la prensa siga escribiendo xAI.

Por qué importa

Si haces contenido para tu empresa, esto baja el suelo de lo que puedes producir sin equipo.

El caso concreto: un anuncio de producto de veinte segundos con tres planos, el mismo portavoz y el mismo producto en todos. Hasta ahora eso pedía rodaje o una edición cara. Con siete referencias fijadas y voz consistente, entra en el rango de lo que una persona sola hace en una tarde.

Ahora, el aviso que doy siempre con vídeo generado: sirve para B-roll, para tests de creatividades antes de meter presupuesto en ads, y para piezas donde nadie espera una cara concreta. No sirve para poner en pantalla al fundador de tu empresa diciendo cosas que no ha dicho, ni para material de marca donde la confianza es el producto.

Nosotros en Barner lo usamos exactamente así: generar diez variantes de creatividad, medir cuál engancha, y solo entonces rodar la buena en condiciones. Eso ahorra el 80% del gasto en producción que se tira en anuncios que nunca iban a funcionar.


Relacionado