IBM abre Granite 4.2 con 512.000 tokens de contexto y licencia Apache 2.0

IBM abre Granite 4.2 con 512.000 tokens de contexto y licencia Apache 2.0
Fuente: huggingface.co

IBM ha publicado Granite 4.2 en tres tamaños (3.000, 8.000 y 30.000 millones de parámetros), todos bajo licencia Apache 2.0 y con una ventana de contexto que llega a 512.000 tokens. El mayor de los tres saca un 57,00% en SWE-bench Verified, que es el banco de pruebas donde se mide si un modelo resuelve incidencias reales de repositorios de código.

Puntos clave

  • Tres tamaños: 3B, 8B y 30B, con la misma arquitectura y el mismo entrenamiento base.
  • Licencia Apache 2.0: uso comercial y modificación sin pedir permiso.
  • Contexto de hasta 512.000 tokens.
  • El de 30B: 57,00% en SWE-bench Verified, 29,24 en Terminal-Bench, 89,17% en AIME25 y 66,41% en GPQA.
  • Llamadas a herramientas nativas compatibles con el formato de OpenAI.

Qué lleva dentro

La arquitectura es un transformer denso solo decodificador, sin mezcla de expertos. Usa Grouped Query Attention con 40 cabezas de atención y 8 cabezas de clave y valor, embeddings posicionales RoPE, activación SwiGLU y normalización RMSNorm.

Traducido: nada exótico. IBM ha elegido la receta estándar y bien entendida, que para un modelo que va a correr dentro de la infraestructura de un banco o de una aseguradora es una decisión sensata. Un modelo denso es más predecible en consumo de memoria que uno de expertos.

La novedad de esta versión es el razonamiento explícito con dos modos, pensante y no pensante. El primero gasta más tokens y acierta más en problemas duros. El segundo responde directo. Que se pueda elegir por petición es lo que evita pagar razonamiento en tareas que no lo necesitan.

El entrenamiento agéntico

La parte que explica los números de código es el aprendizaje por refuerzo multietapa sobre entornos reales: ingeniería de software, terminal y búsqueda web.

Eso significa que el modelo no aprendió solo de texto sobre programación. Aprendió ejecutando, viendo fallar la ejecución y corrigiendo. Es la diferencia entre un 57% en SWE-bench Verified y el 20-30% que sacaban los modelos abiertos de este tamaño hace un año.

El 29,24 de Terminal-Bench es más modesto y honesto. Trabajar en una terminal real, encadenando comandos sin romper nada, sigue siendo difícil para modelos de 30.000 millones de parámetros.

Dónde encaja frente a la competencia abierta

El mercado de modelos abiertos que caben en una máquina propia se ha llenado en agosto. Meta abrió los pesos de Muse Glimmer, unos 30.000 millones de parámetros que corren en un portátil, y Alibaba hizo lo propio con Qwen3.8-27B.

Granite 4.2 entra en la misma franja con dos diferencias. Una es el contexto de 512.000 tokens, que es mucho más de lo que ofrecen sus rivales de tamaño similar. La otra es la marca: IBM vende a comités de compras que llevan veinte años firmando con IBM, y ahí un modelo Apache 2.0 con soporte detrás pesa más que dos puntos de benchmark.

Por qué importa

Si tu empresa tiene datos que no pueden salir de casa y estabas esperando a que un modelo abierto diera la talla, este es de los que hay que probar.

El tamaño de 8B es el punto dulce para la mayoría de casos internos: cabe en una máquina razonable, hace llamadas a herramientas en formato OpenAI (o sea, cambias la URL del endpoint y el código que ya tienes sigue funcionando) y con Apache 2.0 no hay conversación con el departamento legal.

Los 512.000 tokens de contexto abren un caso concreto que antes obligaba a montar bases de datos vectoriales: meter un contrato entero, un manual de operaciones o seis meses de tickets en una sola petición y preguntar.

Y el consejo de siempre: los benchmarks son la puerta de entrada, no la decisión. Coge veinte casos reales de tu operación, pásalos por el de 8B y por el de 30B, y mira la diferencia. Muchas veces el pequeño basta y te ahorra la mitad del hardware.

Fuente original: Hugging Face


Relacionado