Thinking Machines saca Inkling-Small: 12.000 millones de parámetros activos que superan al modelo grande

Thinking Machines saca Inkling-Small: 12.000 millones de parámetros activos que superan al modelo grande
Fuente: thinkingmachines.ai

Thinking Machines Lab ha publicado Inkling-Small, un modelo de pesos abiertos con 276.000 millones de parámetros totales y solo 12.000 millones activos que gana a su hermano mayor de 975.000 millones en las tres pruebas que la propia compañía destaca.

Puntos clave

  • 276.000 millones de parámetros totales, 12.000 millones activos por token (arquitectura de mezcla de expertos).
  • Humanity's Last Exam: 31,6% frente al 29,7% del Inkling completo.
  • SWE-bench Verified: 80,2% frente al 77,6%. GPQA Diamond: 89,5% frente al 87,2%.
  • Ventana de contexto de hasta 1 millón de tokens y precio de 1,20 dólares por millón de tokens de salida.
  • Pesos abiertos en Hugging Face, entrenado sobre sistemas NVIDIA GB300 NVL72.

Que el pequeño gane al grande no es un error

Inkling-Small activa 12.000 millones de parámetros por token. El Inkling original activa 41.000 millones. Y aun así el pequeño puntúa más alto en razonamiento, en programación agéntica y en preguntas científicas de nivel doctorado.

La explicación no está en el tamaño sino en el entrenamiento posterior. Un modelo con menos parámetros activos es más barato de iterar, así que se le pueden dar más vueltas de refuerzo en el mismo presupuesto. Cada ciclo de post-entrenamiento sobre un modelo enorme cuesta lo que cuestan varios sobre uno pequeño.

Es la misma dinámica que se lleva viendo todo el año en los laboratorios chinos: los modelos densos gigantes marcan el techo teórico y las variantes compactas se lo comen a base de refinado.

Qué trae además de los benchmarks

Multimodalidad nativa, no acoplada: procesa audio como espectrogramas e imagen en parches de 40x40 píxeles dentro del mismo espacio de representación.

Esfuerzo de razonamiento configurable de mínimo a muy alto, que es lo que permite usar el mismo modelo para clasificar un correo y para depurar un fallo de producción sin pagar lo mismo por ambas cosas.

Y calibración de pronóstico entrenada con refuerzo, que es una forma de decir que cuando el modelo estima una probabilidad, esa probabilidad se acerca a la realidad. Suena menor y no lo es si lo vas a usar para priorizar.

El movimiento de Thinking Machines

El laboratorio de Mira Murati publicó Inkling, su primer modelo abierto de 975.000 millones de parámetros, el 16 de julio. Dos semanas después saca la versión pequeña, con pesos abiertos y opción de ajuste fino en su plataforma Tinker.

La secuencia dice cuál es el negocio. El modelo grande es la demostración de capacidad. El pequeño es el que la gente va a usar, y Tinker es donde se cobra.

Ya se vio antes con Bridgewater entrenando un modelo abierto para igualar a sus analistas por catorce veces menos: el valor no está en el modelo suelto, está en poder ajustarlo con tus datos.

Por qué importa

Para una empresa que está pagando por tokens, 1,20 dólares por millón de salida con resultados de primera línea en programación agéntica es un número que obliga a recalcular.

Y hay un segundo argumento que no es de precio. Con pesos abiertos puedes servir el modelo en tu propia infraestructura, en Europa, sin que ningún dato salga. Para sectores con exigencia de cumplimiento (salud, banca, seguros) eso vale más que unos puntos de benchmark.

La prueba honesta es la de siempre: coge una tarea real de tu operación, no un test público, y mide. Los benchmarks los publica quien vende el modelo.


Relacionado