> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# Gemini estrena vídeo agéntico con hasta un 88% menos de tokens
- URL: https://www.digitalbrain.news/noticias/gemini-video-agentico-88-por-ciento-menos-tokens/
- Published: 2026-09-02T07:14:13.000Z
- Updated: 2026-09-02T07:42:42.000Z
- Description: Google ha activado el vídeo agéntico en Gemini y el cambio es de método, no de modelo. En lugar de tragarse el vídeo entero a una velocidad de muestreo…
- Author: Ramón Pérez Coronado
- Tags: #noticias, google-gemini, video-ia, modelos-de-ia, agentes-ia

Google ha activado el [vídeo agéntico en Gemini](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/?ref=digitalbrain.news) y el cambio es de método, no de modelo. En lugar de tragarse el vídeo entero a una velocidad de muestreo fija, el modelo decide qué trozo mirar, a qué ritmo y por qué vía: fotogramas, audio o transcripción. Google declara hasta un 88% menos de [tokens](https://www.digitalbrain.news/guias/que-es-un-token-en-ia/) consumidos y hasta un 66% menos de coste.

## Puntos clave

- Hasta 66% menos de coste, hasta 88% menos de tokens y hasta 7% más de precisión, según las cifras de Google.
- Recuperación de momentos por debajo del segundo, pensada para edición automatizada precisa.
- Búsquedas complejas en vídeos de varias horas sin quemar millones de tokens.
- Mejor detección de anomalías, porque el modelo puede remuestrear una zona sospechosa a más fotogramas por segundo.
- Conteo fiable de acciones y objetos repetidos, que era uno de los fallos clásicos del muestreo fijo.

## Qué hacía mal el método anterior

Hasta ahora, pasarle un vídeo a un modelo [multimodal](https://www.digitalbrain.news/glosario/#multimodal) significaba trocearlo en fotogramas a un ritmo constante, por ejemplo uno por segundo, y meterlos todos en el contexto. Un vídeo de dos horas se convierte en 7.200 imágenes.

El coste sube en línea recta con la duración, y la mayoría de esos fotogramas no aportan nada: son la misma escena repetida. Peor aún, si lo que buscas ocurre entre dos muestras, el modelo no lo ve.

El enfoque agéntico invierte el orden. El modelo empieza mirando por encima, localiza dónde puede estar lo que le has pedido, y entonces baja el zoom en esa zona. Como hace un editor de vídeo cuando busca un plano.

## Dónde se nota más

Google señala el contenido largo como el caso donde las ventajas se disparan, y tiene sentido: cuanto más dura el vídeo, más porcentaje del material es irrelevante para una pregunta concreta.

Los cuatro usos que destaca son concretos. Encontrar el momento exacto en el que pasa algo, con precisión por debajo del segundo. Buscar dentro de grabaciones de horas. Detectar anomalías remuestreando a distinta velocidad. Y contar cuántas veces se repite una acción o aparece un objeto, que suena trivial y es justo donde los modelos de vídeo fallaban.

Está disponible en [Gemini](https://www.digitalbrain.news/guias/que-es-gemini/) 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, la gama rápida y barata. No en los modelos grandes. Es una decisión coherente: el ahorro de tokens importa más justo donde el volumen es alto.

## Cómo se accede

Por la API de Gemini, a través de Google AI Studio y de Gemini Enterprise Agent Platform. Sin cargo adicional sobre el precio de la API.

La app de Gemini y la función Ask YouTube lo recibirán más adelante, sin fecha anunciada.

Google lleva meses empujando por esta vía. Hace unos días [presentó Gemini Omni 1.1 Flash con vídeo de 40 segundos](https://www.digitalbrain.news/noticias/google-gemini-omni-1-1-flash-video-40-segundos/), y esto es la otra mitad del problema: no solo generar vídeo, sino leerlo sin arruinarse.

## Por qué importa

Si tienes horas de vídeo guardadas y nunca las has explotado, el motivo probablemente era el coste. Grabaciones de formación, llamadas de ventas, cámaras de almacén, sesiones de soporte. Procesarlas con el método anterior salía a un precio que no compensaba.

Con un 88% menos de tokens, la cuenta cambia. Un caso realista para una empresa mediana: pasar las grabaciones de las llamadas comerciales del último trimestre y sacar en qué minuto aparecen las objeciones que más se repiten.

Dos avisos antes de presupuestar nada. Uno, las cifras son de Google y son "hasta": el ahorro real depende de la pregunta y del vídeo. Y dos, está en la gama Flash, así que si necesitas [razonamiento](https://www.digitalbrain.news/guias/que-es-un-modelo-de-razonamiento-en-ia/) pesado sobre lo que encuentras, tendrás que encadenar un segundo modelo detrás.

Fuente original: [Google](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/?ref=digitalbrain.news)

---

**Relacionado**

[![General Motors monta su propio asistente de IA porque Gemini no ve lo que sabe el coche](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/gm-asistente-ia-propio-onstar-gemini.jpg)General Motors monta su propio asistente de IA porque Gemini no ve lo que sabe el coche](https://www.digitalbrain.news/noticias/gm-asistente-ia-propio-onstar-gemini/)[![Runway genera interfaces como vídeo, sin código debajo](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/09/runway-solaris.png)Runway genera interfaces como vídeo, sin código debajo](https://www.digitalbrain.news/noticias/runway-solaris-interfaces-video-sin-codigo/)[![Meta lanza Muse Voice Transcribe: 3,1% de error y 20 hablantes a la vez](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/09/meta-muse-voice-transcribe-diarizacion-20-hablantes.webp)Meta lanza Muse Voice Transcribe: 3,1% de error y 20 hablantes a la vez](https://www.digitalbrain.news/noticias/meta-muse-voice-transcribe-diarizacion-20-hablantes/)