World Labs presenta Atlas, su modelo del mundo con vídeo 1440p de un minuto

World Labs presenta Atlas, su modelo del mundo con vídeo 1440p de un minuto
Fuente: worldlabs.ai

World Labs ha presentado Atlas, su modelo del mundo para inteligencia espacial, y la demostración más vistosa es un vídeo de hasta un minuto a 1440p con control de cámara al píxel. Debajo hay algo menos llamativo y más útil: el mismo modelo reconstruye escenas reales a partir de fotos y simula cómo evolucionan.

Puntos clave

  • Arquitectura: transformador de difusión autorregresivo multimodal. Un único modelo para generar, reconstruir y simular.
  • Generación controlada por cámara: vídeo de hasta un minuto a 1440p, con control de la cámara al píxel.
  • Reconstrucción espacial desde una o varias imágenes. Error medio de 25,3 (AbsRel x10⁻³) frente al 28,7 de Pi3X, un modelo especializado en esa tarea.
  • Gana a FLUX 3 en el 93% de las evaluaciones de generación controlada por cámara, según los datos que publica la propia empresa.
  • Genera además imágenes y panorámicas de 360 grados a partir de texto.

Qué es un modelo del mundo y en qué se diferencia

Un generador de vídeo produce fotogramas que parecen coherentes. Un modelo del mundo entiende que hay un espacio ahí detrás, con objetos que ocupan sitio y que siguen existiendo cuando la cámara se va.

World Labs lo define como un sistema que genera, reconstruye y simula cualquier mundo posible, y que entiende cómo aparecen los mundos, cómo se comportan y cómo evolucionan.

La diferencia se nota en el control de cámara. Si el modelo solo genera fotogramas plausibles, mover la cámara en un plano de treinta segundos produce derivas: los objetos cambian de sitio, las sombras no cuadran. Control al píxel significa que la geometría se sostiene.

Las cuatro cosas que hace

Generación controlada por cámara, con la duración y resolución citadas.

Reconstrucción espacial: le das una imagen, o varias, y levanta la escena. World Labs afirma que supera a modelos especializados solo en esa tarea, y da la comparación contra Pi3X con números.

Simulación espaciotemporal: modela el espacio y el tiempo de un vídeo, lo que abre la puerta a que un robot planifique sus movimientos sobre esa simulación en lugar de sobre el mundo real.

Y generación de imágenes y panorámicas 360 desde texto.

Lo que hay que leer con cuidado

Todas las cifras son de World Labs. No hay evaluación independiente todavía, y las comparaciones que elige una empresa para su propio anuncio nunca son neutrales.

El 93% frente a FLUX 3 es especialmente resbaladizo, porque compara contra un modelo de imagen en un terreno, el control de cámara sostenido, que no es su fuerte. Con Pi3X la comparación está mejor planteada: es un modelo de reconstrucción contra otro, con la misma métrica.

Atlas entra en acceso temprano con socios seleccionados. No hay API abierta ni precio, solo un formulario.

Tampoco hay datos de coste ni de velocidad de generación, que es lo que decide si algo así se puede usar en producción o solo en una demo. Generar un minuto de vídeo a 1440p con coherencia geométrica no es barato, y World Labs no dice cuánto tarda ni en qué hardware.

Por qué importa

Para la mayoría de empresas esto todavía no es una herramienta, es una señal de por dónde va la cosa.

La pata que sí tiene recorrido a corto es la reconstrucción. Levantar una escena tridimensional desde unas cuantas fotos vale para catálogo de producto, para inventario visual de almacén, para documentar una instalación. Son cosas que hoy se hacen con escáneres o con fotogrametría lenta.

La de robótica va más lejos y tardará más. Un robot que planifica sobre una simulación aprendida, en vez de sobre reglas escritas a mano, es un cambio de fondo en la automatización de almacén, y no está a la vuelta de la esquina.

Si tu negocio es físico, este es el hilo del que tirar en los próximos meses. Todavía sin presupuesto, solo con atención.

Fuente original: worldlabs.ai


Relacionado