Nvidia pone Groq 3 LPX en producción: 3.400 tokens por segundo con 100.000 de contexto

Nvidia pone Groq 3 LPX en producción: 3.400 tokens por segundo con 100.000 de contexto
Fuente: nvidianews.nvidia.com

Nvidia ha puesto Groq 3 LPX en producción plena, el acelerador de inferencia con el que quiere quedarse la parte del negocio de IA que ahora mismo crece más rápido: los agentes que escriben, revisan y ejecutan tareas largas. La cifra que enseña es 3.400 tokens de salida por segundo ejecutando Gemma 4 31B con 100.000 tokens de contexto.

Puntos clave

  • Groq 3 LPX está en producción plena desde este mes de agosto de 2026.
  • Rinde 3.400 tokens de salida por segundo con 100.000 tokens de contexto, según la medición independiente de Artificial Analysis.
  • Nvidia lo pone 4 veces por encima de plataformas alternativas en cargas donde la latencia manda.
  • Nebius es la primera nube que lo adopta y lo mete en su Nebius Token Factory. Groq también planea llevarlo pronto al mercado.

Qué cambia técnicamente

LPX no es una GPU más grande. Es una extensión de la plataforma Vera Rubin dedicada a una fase concreta de la inferencia: la generación, el momento en el que el modelo escupe token tras token después de haber leído el contexto.

Esa fase es la que determina si un agente se siente vivo o se siente atascado. Cuando un modelo tiene que leer 100.000 tokens de un repositorio y luego escribir 3.000 de código, la lectura se paraleliza bien y la escritura no. La escritura es secuencial por definición: cada token depende del anterior.

Danila Shtan, director de tecnología de Nebius, lo resume en el anuncio diciendo que la generación es la fase que decide lo receptivo que resulta de verdad un sistema de IA. Por eso Nvidia separa el hardware: deja el trabajo de contexto largo en la parte Rubin y le enchufa LPX para la parte que va token a token.

Jensen Huang, consejero delegado de Nvidia, lo vende como que la inferencia es el motor de crecimiento de la IA. Es una frase de directivo, pero coincide con lo que llevan meses diciendo las facturas de cualquiera que use agentes: el gasto ya no está en entrenar, está en ejecutar.

Cuatro anuncios y una presentación de resultados

LPX llega dentro de un bloque de cuatro productos que Nvidia soltó de golpe días antes de presentar resultados. Los otros tres:

Spectrum-X Multiplane, una arquitectura de red Ethernet acelerada por hardware que escala hasta 512.000 GPUs sin necesidad de añadir una tercera capa de red. Nvidia le atribuye un 1,6x de mejora sobre Ethernet estándar en redes de IA, y dice que mantiene alrededor del 90% del ancho de banda aunque caiga un plano entero. CoreWeave ya lo tiene desplegado en producción.

NVLink Fusion, que conecta XPUs de terceros (procesadores diseñados a medida por otras empresas) a la infraestructura de Nvidia con NVLink de sexta generación y NVLink-C2C. La idea es que un operador pueda montar una fábrica de IA semipersonalizada sin esperar a que haya silicio nuevo.

Y Vera, la CPU pensada para agentes, que ya tiene su primer cliente grande anunciado.

El calendario no es casual. Nvidia lleva tres trimestres sosteniendo que la demanda de inferencia crece más rápido que la de entrenamiento, y cada anuncio de este bloque apunta al mismo sitio: tokens por segundo, tokens por vatio y coste por token.

Por qué importa

Si tu empresa ya paga por agentes que trabajan solos (Claude Code revisando un repositorio, un agente que procesa facturas, un asistente que lee el ERP), tu factura no depende de lo listo que sea el modelo. Depende de cuántos tokens por segundo saque el hardware que lo sirve y de cuánto cuesta cada uno.

Lo que hace Nvidia con LPX es empujar hacia abajo ese coste unitario. Cuando eso llega al precio de las APIs, y suele llegar en meses, procesos que hoy no salen a cuenta empiezan a salir.

La lectura práctica: si tienes un caso de uso descartado por precio hace seis meses, vuelve a hacer los números. En este mercado, la línea de lo que es rentable automatizar se mueve cada trimestre.

Y si estás negociando con un proveedor de nube, pregunta qué hardware hay debajo del endpoint que te vende. Nebius con Token Factory y CoreWeave con Spectrum-X ya están comprando la generación nueva. La diferencia entre servirte desde silicio de 2025 o de 2026 no la vas a ver en el contrato, pero la vas a ver en la latencia.


Relacionado