Gemini Robotics ER 2 coordina varios robots y acierta el 91,3% en vídeo

Gemini Robotics ER 2 coordina varios robots y acierta el 91,3% en vídeo
Fuente: blog.google

Google DeepMind ha lanzado Gemini Robotics ER 2, el modelo que hace de cerebro de alto nivel para robots, y el salto grande es que ya no mira fotos: mira vídeo continuo. Acierta el 91,3% de las veces al detectar el momento exacto en que pasa algo, con un error medio de 0,96 segundos y cuatro veces más rápido que los modelos rivales.

Puntos clave

  • Detección del momento crítico: 91,3% de acierto, 0,96 segundos de desviación media, 4 veces más rápido que la competencia.
  • Clasificación del progreso de una tarea en cinco tramos de 0 a 100%: 57,4% de acierto.
  • Coordinación nativa entre robots distintos, con traspaso de tareas de una máquina a otra.
  • Disponible desde el 30 de julio en la Gemini API y en Google AI Studio. En la Gemini Enterprise Agent Platform va en preview privada.

Qué cambia respecto a ER 1.6

La versión anterior trabajaba sobre instantáneas. Le enseñabas una foto del estado del mundo y decidía. ER 2 se conecta a un feed de vídeo y va evaluando sin parar, así que puede seguir su propio progreso y corregir sobre la marcha cuando algo se tuerce.

Eso suena menor y no lo es. La diferencia entre un robot que descubre que ha fallado al terminar y uno que lo descubre a los 0,96 segundos es la diferencia entre repetir la tarea entera y ajustar la muñeca.

DeepMind lo define así: "Gemini Robotics ER 2 es un agente físico, orquestando pasos para el robot y permitiéndole autocorregirse y generalizarse a situaciones más novedosas".

Orquestación y varios robots a la vez

ER 2 no mueve articulaciones. Piensa y reparte. Llama a herramientas externas de forma nativa (Google Search entre ellas), habla con modelos VLA que sí ejecutan el movimiento, con APIs de navegación y con sistemas de teleoperación remota.

La conexión va por la Gemini Live API, con una interfaz bidireccional optimizada para latencia, de modo que la orquestación no obliga al robot a quedarse quieto mientras el modelo piensa. DeepMind lo resume en una frase que explica por qué han peleado tanto la velocidad: "el razonamiento de alto nivel depende de la velocidad de ejecución".

La parte multirrobot funciona por comprensión semántica compartida. Dos máquinas distintas, un brazo fijo y un cuadrúpedo por ejemplo, se pasan una tarea entre ellas sin que un humano tenga que traducir.

También lee instrumentos: 10 tipos distintos de indicadores, manómetros y pantallas incluidos. Es el tipo de detalle que decide si esto sirve en una planta industrial de verdad o solo en un vídeo de demo.

Los robots donde ya se ha probado

Las pruebas se han hecho con Spot de Boston Dynamics, el Apollo 2 de Apptronik y el F3 Duo de Franka Emika. Tres formatos muy distintos: cuadrúpedo, humanoide y brazo industrial doble.

En seguridad, DeepMind dice haber mejorado los benchmarks de instrucción segura y de proximidad humana, con el comportamiento concreto de detener a un humanoide cuando hay personas cerca.

En paralelo, el modelo hermano que sí controla el movimiento, Gemini Robotics 2, extiende el control del tren superior al cuerpo entero. Según The Verge, la versión previa se centraba en la parte de arriba del humanoide y la nueva soporta movimientos "de los pies a las yemas de los dedos".

Por qué importa

Para una empresa española con almacén, taller o línea de producción, la pregunta útil no es si el humanoide llega este año. No llega. La pregunta es qué parte de este stack se puede usar ya sin comprar un robot.

Y la respuesta es la capa de vídeo. ER 2 está en la Gemini API desde ayer, y lo que hace bien (mirar un feed continuo, clasificar el progreso de una tarea, detectar el instante exacto en que algo se sale de lo previsto, leer un instrumento) no exige un brazo robótico. Exige una cámara.

Control de calidad en cinta, supervisión de un proceso de picking, lectura automática de contadores en planta. Todo eso es visión sobre vídeo con un modelo que ahora responde en menos de un segundo. El robot es la parte cara. La parte barata ya está en una API.


Relacionado