Google lanza Gemini 4 Argon, por ahora solo para ciberdefensores

Gemini 4 Argon, el nuevo modelo frontera de Google
Imagen: Google

Google ha presentado Gemini 4 Argon, su nuevo modelo frontera y el más potente que ha anunciado hasta hoy. Lo firma Koray Kavukcuoglu, vicepresidente de Google DeepMind, en el blog de DeepMind este 30 de septiembre. De momento no lo puede usar casi nadie: arranca solo con un grupo de expertos en ciberdefensa, y Google no ha puesto fecha para abrirlo a empresas y usuarios.

Cuando llegue, costará 2 dólares por millón de tokens de entrada y 10 por millón de salida como precio de lanzamiento. Después, el doble.

Puntos clave

  • Quién lo puede usar hoy. Solo defensores de ciberseguridad de confianza, a través del programa Fairwind de Google. Los siguientes en recibirlo serán los clientes de pago de la API y los suscriptores de Google AI Ultra.
  • Precio. 2 dólares por millón de tokens de entrada y 10 de salida durante el periodo de lanzamiento, con la entrada en caché un 95% más barata. Al acabar ese periodo, 4 y 20 dólares.
  • Respuestas de hasta 1 millón de tokens. El límite de salida pasa de 64.000 tokens a 1 millón, que Google presenta como el más alto del sector.
  • Resultados. 77,9% en DeepSWE v1.1 (programación en tareas largas), primer puesto en el Vals Index (finanzas, programación, derecho e impuestos), 51,3% en AutomationBench de Zapier y 91,7% en LVBench (vídeo largo).

Por qué todavía no se puede usar

Google dice que un modelo de este nivel se lanza "por fases". Está dentro del proceso voluntario del gobierno de Estados Unidos que da acceso previo a los modelos antes de publicarlos, y seguirá recogiendo opiniones de los primeros probadores mientras ajusta las protecciones. La fórmula oficial es que llegará a desarrolladores, empresas y consumidores "lo antes posible". Sin fecha.

El motivo de fondo es la ciberseguridad. Argon sabe encontrar, validar y parchear fallos de seguridad graves por su cuenta. A los defensores de confianza y a los equipos internos de Google se lo van a dar sin los frenos de ciberseguridad que llevará la versión pública, para que lo usen a pleno rendimiento. Un modelo que encuentra agujeros para taparlos también los encuentra para colarse, y eso explica el orden de entrada.

Antes de abrirlo, Google está reforzando cuatro frentes:

  • Que se niegue a ayudar con ataques informáticos o con armas químicas, biológicas, radiológicas y nucleares.
  • Que aguante la inyección de instrucciones: órdenes maliciosas escondidas en un documento o una web que el modelo lee mientras trabaja. Google dice que es su modelo más resistente a esto.
  • Vigilar su razonamiento y sus acciones para pararlo si intenta ir más allá de lo que le pidió el usuario.
  • Aislar y sellar los entornos donde se entrena y se prueba.

Es el mismo camino que tomó Anthropic cuando decidió no abrir Mythos Preview al público por su capacidad para fabricar ataques, y el que Google ya ensayó hace cuatro semanas con Gemini 3.8 Flash Cyber, que solo se entrega a defensores verificados.

Qué hace Argon dentro de Google

Miles de empleados de Google lo usan ya a diario, y la compañía ha dado cuatro casos con números:

  • Computación cuántica. Ayudó a los investigadores a recortar los recursos (cúbits por puertas lógicas) de subrutinas que frenan aplicaciones importantes. En un caso mejoró en un 40% la referencia publicada, en cuestión de minutos.
  • Memoria de los centros de datos. Un equipo de agentes de Argon analizó los datos de consumo de toda la flota de servidores y aplicó ajustes por su cuenta. Ha liberado más de 300 TiB de memoria, y Google calcula un ahorro total de entre 500 TiB y 1 PiB.
  • Migrar código a Rust. Agentes de Argon están pasando código de C y C++ a Rust, un lenguaje que evita buena parte de los fallos de memoria, desde librerías de decenas de miles de líneas hasta las más de 800.000 del núcleo Zircon del sistema operativo Fuchsia. Google aclara que estas reescrituras pasan auditorías automáticas y manuales antes de llegar a producción.
  • Un decodificador de vídeo 2,7 veces más rápido. En libgav1, el software abierto de Google para decodificar vídeo, Argon sustituyó 32.000 líneas de código especializado por Rust seguro. Salió 2,7 veces más rápido que la versión en Rust que ya existía, con el vídeo de salida idéntico.

Fuera de la programación, Google lo pone primero en el Vals Index, que mide el impacto económico en finanzas, programación, derecho e impuestos y pondera cada sector por su peso en el PIB de Estados Unidos. También destaca en el test de investigación financiera de Vals y en el de redacción jurídica de Harvey.

En AutomationBench, el test de Zapier que mide si un modelo completa de principio a fin tareas reales de áreas de negocio, saca un 51,3% y es el primero de la tabla. Leído al revés, falla casi la mitad de esas tareas. Es la cifra más útil del anuncio para no hacerse ilusiones con los agentes que trabajan solos.

En ciberseguridad empata en el primer puesto de CWE-bench v1, que mide si un modelo arregla vulnerabilidades, con un 68%. Wiz, la empresa de seguridad en la nube, ya lo usa en su programa Scan for Good, que protege gratis infraestructura pública. Con Argon encontró una vulnerabilidad crítica que exponía datos personales en un software sanitario usado por hospitales de todo el mundo, y que modelos frontera anteriores habían pasado por alto.

El millón de tokens de salida

Es el cambio que más va a notar quien lo use. Un token es un trozo de palabra, así que un millón de tokens de salida son varios cientos de miles de palabras en una sola respuesta. Hasta ahora el techo era de 64.000.

Google lo justifica por el razonamiento: con margen para pensar y escribir cientos de miles de tokens en una sola tarea, el modelo resuelve problemas difíciles de una tacada. Traducido a una empresa, son migraciones de código enteras, informes largos o análisis de decenas de documentos sin trocearlos en veinte peticiones.

La factura sube al mismo ritmo. A 10 dólares por millón de tokens de salida (20 cuando acabe el precio de lanzamiento), una respuesta que agote el margen cuesta 10 dólares, y el razonamiento previo también se paga. Para comparar: Gemini 3.8 Flash cuesta 0,75 dólares de entrada y 3,75 de salida con su precio de lanzamiento, así que Argon sale unas 2,7 veces más caro por token. Y ya con 3.8 Flash avisó Google de que sus modelos nuevos gastan más tokens para mejorar el resultado. Con Argon, lo que hay que medir es el coste por tarea terminada, que es lo que llega a fin de mes.

Por qué importa

Si tu empresa trabaja con Gemini, hoy no cambia nada. Argon no está en la app, ni en Google Workspace, ni en la API abierta. Cuando se abra, entrará primero por la API de pago y por Google AI Ultra, el plan más caro de Gemini.

Lo que sí puedes hacer ya es preparar la prueba. Elige dos o tres tareas largas que hoy se os atascan (un informe que cruza muchos documentos, una revisión de contratos, un análisis financiero de varios trimestres) y apunta cuánto tiempo y dinero os cuestan con el modelo que usáis ahora. El día que Argon esté disponible, las pasas por él y comparas coste y calidad por tarea. Con un precio de lanzamiento que después se duplica, conviene saber rápido si os compensa.

Y si llevas la seguridad informática de una empresa, el mensaje de las últimas semanas es siempre el mismo: los modelos ya encuentran fallos que las personas no ven, y los primeros en tenerlos son los defensores. Palo Alto ya vende servicios con Mythos y GPT-5.6-Cyber para probar las defensas de sus clientes, y hoy mismo contamos que GLM-5.3, un modelo abierto chino, ya fabrica ataques casi al nivel de Mythos. La ventaja de los defensores dura lo que tardan esas capacidades en llegar a cualquiera.

Fuente original: Google DeepMind


Relacionado