Elon Musk anunció el 2 de agosto que Grok ya puede analizar cualquier vídeo, sin pasar antes por una transcripción. En las pruebas publicadas el modelo entiende un vídeo de matemáticas de nivel Terence Tao sin subtítulos y responde sobre una entrevista de 50 minutos. Es el paso de generar vídeo a entenderlo, que es una capacidad distinta y bastante más útil para una empresa.
Puntos clave
- Musk lo anunció en X el 2 de agosto. Grok procesa vídeo de forma nativa.
- En las pruebas resume metraje largo y responde preguntas sobre lo que ocurre en pantalla.
- Entendió un vídeo de matemáticas avanzadas sin subtítulos, apoyándose en lo escrito en pizarra y en el desarrollo visual.
- Resolvió una entrevista de 50 minutos completa.
- Se plantea además detectar contenido manipulado.
Por qué transcribir no es lo mismo que ver
La mayoría de asistentes reducen un vídeo a texto antes de poder hacer nada con él. Sacan la transcripción del audio y trabajan sobre ella.
Eso funciona en una charla donde todo lo importante se dice en voz alta. Se cae en cuanto la información está en la imagen: una demostración escrita en pizarra, un producto que se manipula, un gráfico que aparece en pantalla, una cara que reacciona.
El ejemplo de matemáticas es exactamente eso. Sin subtítulos, la transcripción daría un texto lleno de "aquí ponemos esto" y "si movemos esta parte". Todo el contenido está en lo que se escribe, no en lo que se dice.
Dónde encaja en la carrera de xAI
xAI lleva semanas empujando vídeo por los dos lados. Grok Imagine Video 1.5 añadió voz, siete referencias por generación y 1080p nativo hace días, y eso era generación.
Esto es comprensión, y son cosas distintas. Un modelo que genera vídeo aprende a producir píxeles plausibles; uno que lo entiende tiene que seguir objetos, causas y tiempo a lo largo de minutos. Que la misma casa haga las dos y en la misma quincena habla del ritmo que lleva.
Musk también tiene Grok 4.6 anunciado para el 7 de agosto, así que esta capacidad probablemente sea el aperitivo.
La detección de contenido manipulado, con reservas
Junto al anuncio se plantea que Grok pueda detectar vídeo manipulado. Es la parte que conviene coger con pinzas.
Detectar un deepfake bien hecho es un problema abierto, y los detectores tienden a envejecer mal: funcionan contra los generadores que conocen y fallan con el siguiente. Superhuman recogía esta misma semana el caso de Flux 3 generando metraje histórico falso tan convincente que abrió debate sobre reescribir la historia.
Un modelo que analiza vídeo puede señalar incoherencias visibles, y eso ya ayuda. Presentarlo como verificación fiable sería otra cosa, y por ahora no hay datos publicados que lo sostengan.
Lo que falta por saber
Ni la duración máxima de vídeo soportada, ni el precio por minuto procesado, ni si está disponible en la API o solo en la aplicación. Tampoco hay evaluación independiente sobre metraje difícil.
El anuncio es un tuit y unas pruebas de usuarios. Con xAI conviene esperar a la documentación antes de montar nada encima, porque el hueco entre lo anunciado y lo que se puede contratar ha sido notable otras veces.
Por qué importa
Si tu empresa graba, este cambio vale dinero.
Los sitios donde ya se nota: llamadas comerciales grabadas donde importa lo que se enseñó en pantalla, formaciones internas que hay que convertir en documentación, vídeo de proceso en fábrica o almacén, control de calidad de creatividades antes de meterles inversión publicitaria.
En todos esos casos hoy alguien ve el vídeo entero y toma notas. Un modelo que responde preguntas sobre 50 minutos de metraje quita ese paso, y quita también el paso previo de transcribir y limpiar.
El aviso de siempre: nada de meter grabaciones con datos personales de clientes en un asistente sin mirar antes dónde se procesan y qué dice tu política de privacidad. La capacidad técnica va por delante de la parte legal, como casi siempre.
Relacionado

