Google libera DiffusionGemma: genera texto en paralelo a 1.000+ tokens por segundo en una H100

Google libera DiffusionGemma: genera texto en paralelo a 1.000+ tokens por segundo en una H100
Fuente: blog.google

Google DeepMind ha publicado DiffusionGemma, un modelo open source experimental que cambia cómo se genera texto. En lugar de predecir un token detrás de otro como hacen los LLMs autorregresivos clásicos, genera 256 tokens en paralelo por cada forward pass. Resultado: hasta 4 veces más rápido en inferencia, con más de 1.000 tokens por segundo en una Nvidia H100, y más de 700 tokens por segundo en una RTX 5090 de consumo.

Cómo funciona en una frase

El modelo parte de un canvas de 256 tokens ruidosos y va refinándolos en paralelo mediante denoising iterativo, la misma lógica que usan los modelos de imagen tipo Stable Diffusion. Cada token del bloque puede atender a todos los demás (atención bidireccional), algo que el autorregresivo clásico no permite porque va token a token de izquierda a derecha.

Arquitectura interna: 26 mil millones de parámetros totales en formato mixture-of-experts, con solo 3,8 mil millones activos por inferencia. Está construido sobre la familia Gemma 4, con la investigación de Gemini Diffusion aplicada encima.

Qué hardware pide de verdad

Este es el dato que decide si te sirve o no. Cuantizado, DiffusionGemma cabe en 18 GB de VRAM. Eso lo mete dentro de una sola GPU de consumo tope de gama, no de un cluster. Google incluye soporte de cuantización NVFP4 (coma flotante de 4 bits) para exprimir todavía más la memoria.

Está pensado para inferencia local o de baja concurrencia, no para servir tráfico masivo en cloud. Brilla cuando tienes pocas peticiones que necesitan respuesta inmediata, no cuando tienes miles de usuarios a la vez. Es una herramienta de latencia, no de throughput.

Para qué tiene sentido

Aplicaciones donde la latencia es el factor que determina si el producto sirve o no. Voicebots en tiempo real, agentes interactivos en chat, traducción simultánea, transcripción en vivo con feedback inmediato. La calidad del modelo aún no es la de los frontera (es Gemma, no Gemini Ultra), y Google reconoce el trade-off de forma explícita: la calidad de output es inferior a Gemma 4 estándar. Pero el speedup abre una ventana de casos de uso que con autorregresivo estándar quedaban fuera por timing.

Google ya lo ha afinado como ejemplo para resolver sudokus, una pista de que el modelo se deja fine-tunear a dominios concretos sin demasiada fricción.

Distribución y disponibilidad

Licencia Apache 2.0, que permite uso comercial, modificación y redistribución sin restricciones. Disponible en Hugging Face, GitHub, vLLM, Google Cloud Model Garden y Nvidia NIM. El ecosistema de ejecución ya es amplio: MLX para Apple Silicon, Hugging Face Transformers, Unsloth y NVIDIA NeMo, con llama.cpp anunciado como próximo. Puede correr en GPU local o en cloud, sin ataduras de proveedor.

Por qué importa más allá del benchmark

El paradigma de difusión aplicado a texto lleva años sobre la mesa académica, pero ningún gran lab había publicado un modelo open source con métricas competitivas. Que Google lo haga, en formato MoE, con licencia comercial sin restricciones y corriendo en una GPU de 18 GB, abre dos vías para empresas de tamaño medio.

La primera es bajar coste por inferencia de forma real. Si tu factura cloud está dominada por queries de voicebot o chat donde la latencia importa, DiffusionGemma corriendo en tu propia H100 (o en una RTX 5090) puede partir el coste por unidad. Apache 2.0 significa que también puedes adaptarlo a tu dominio sin negociar términos.

La segunda es una pista de hacia dónde va la industria. Si el paradigma escala, los próximos modelos frontera (Gemini, Claude, GPT) probablemente incorporarán variantes híbridas: autorregresivas para razonamiento profundo, en paralelo para latencia baja.

Qué hacer con esto

  • Si tu producto tiene un componente de voz o de chat interactivo donde la latencia rompe la experiencia, prueba DiffusionGemma en una rama de feature flag y compara con tu modelo actual en métricas duras: tiempo a primer token, tiempo a respuesta completa, tasa de errores percibidos.
  • Si tu output requiere razonamiento complejo o creatividad alta, este no es el modelo. Sigue con Gemini, Claude o GPT en esa capa.
  • Patrón híbrido sensato: DiffusionGemma para la primera respuesta rápida que el usuario percibe, modelo frontera en background para refinar si la tarea lo merece.
  • Si tu equipo nunca ha tocado open source en producción, este es un buen candidato para empezar: cabe en una GPU, Apache 2.0, soporte en Hugging Face, vLLM y MLX.

Relacionado