Google lanza Gemini 3.6 Flash: sube en código y gasta un 17% menos tokens

Google lanza Gemini 3.6 Flash: sube en código y gasta un 17% menos tokens
Fuente: blog.google

Google acaba de meter tres modelos Gemini nuevos el mismo día. Gemini 3.6 Flash, Gemini 3.5 Flash-Lite y una variante 3.5 Flash Cyber para ciberseguridad. Para quien ya paga la API, el titular es este: el Flash grande cuesta lo mismo por token, sube en los benchmarks de código y genera un 17% menos tokens de salida. Así que la factura por tarea baja aunque el precio no se mueva.

Puntos clave

  • Gemini 3.6 Flash: 1,50 dólares por millón de tokens de entrada y 7,50 por millón de salida.
  • Un 17% menos tokens de salida que 3.5 Flash para la misma tarea, según Artificial Analysis.
  • Sube en código: DeepSWE 49% (antes 37%), MLE Bench 63,9% (antes 49,7%), OSWorld-Verified 83% (antes 78,4%).
  • Flash-Lite a 0,30 dólares de entrada y 2,50 de salida, con 350 tokens por segundo.
  • Los tres modelos ya están en Google AI Studio, Android Studio, Gemini Enterprise y la app de Gemini.

Qué trae Gemini 3.6 Flash

Es el modelo del medio, el que usa la mayoría para producción. Google lo ha afinado para código, trabajo de conocimiento y tareas multimodales, y ha metido el dato que más importa cuando pagas por token: gasta menos. Un 17% menos tokens de salida para resolver lo mismo, medido por Artificial Analysis. Eso baja el coste real por tarea sin tocar el precio de tarifa.

Los benchmarks de programación suben con margen. En DeepSWE pasa del 37% al 49%. En MLE Bench, una prueba de tareas de machine learning, del 49,7% al 63,9%. En OSWorld-Verified, que mide agentes manejando un ordenador, del 78,4% al 83%. Y en GDPval-AA v2, un índice de trabajo económico útil, sube de 1.349 a 1.421. No es un salto de generación, es una versión que hace mejor lo que ya hacía y cuesta menos ejecutarla.

Flash-Lite: el barato para agentes rápidos

Gemini 3.5 Flash-Lite es la apuesta para volumen. Cuesta 0,30 dólares por millón de tokens de entrada y 2,50 de salida, y escupe 350 tokens por segundo. Está pensado para flujos con muchas llamadas y poca espera: procesar documentos, orquestar agentes, mover colas grandes de peticiones.

Aquí los números también suben fuerte. Terminal-Bench 2.1 pasa del 31% al 54%. GDM-MRCR v2, que mide memoria en contextos largos, del 60,1% al 72,2%. SWE-Bench Pro sube al 54,2% y OSWorld-Verified al 74%. Para una tarea repetitiva de baja latencia, es el modelo que más rinde por euro de la familia.

Flash Cyber: potente pero cerrado

El tercero es distinto. Gemini 3.5 Flash Cyber está afinado para encontrar y arreglar vulnerabilidades de seguridad, y funciona dentro de CodeMender, la herramienta de Google que coordina varios agentes trabajando juntos sobre el mismo código. Google no lo abre a todos. El acceso queda limitado a gobiernos y socios de confianza mediante un piloto, con restricciones de doble uso puestas a propósito. Un modelo que encuentra fallos de seguridad rápido sirve para defender, y también para atacar. Google prefiere controlar quién lo toca.

El lanzamiento lo firma Tulsee Doshi, directora sénior de producto del equipo Gemini. Llega semanas después de que Google retrasara Gemini 3.5 Pro por quedarse corto en código, así que la jugada de sacar tres Flash a la vez tiene lectura: mientras el modelo grande se cuece, Google refuerza la gama media y barata, que es la que factura de verdad en producción.

Por qué importa

Si tu empresa ya usa Gemini por API, la actualización es de las que se aplican sin pensar mucho. El mismo precio de tarifa, más acierto en código y menos tokens por respuesta se traducen en una factura mensual más baja para el mismo trabajo. Merece la pena hacer la cuenta: coge una tarea que ejecutes en volumen (clasificar tickets, redactar respuestas, revisar código) y compara el coste por 1.000 ejecuciones entre 3.5 Flash y 3.6 Flash. Y si tienes procesos de mucha llamada y poca latencia, Flash-Lite a 0,30 dólares la entrada cambia los números de cualquier agente que corra todo el día.


Relacionado