Moonshot libera hoy los pesos de Kimi K3, el primer modelo abierto de 2,8 billones de parámetros

Moonshot libera hoy los pesos de Kimi K3, el primer modelo abierto de 2,8 billones de parámetros
Fuente: huggingface.co

Moonshot AI libera hoy los pesos de Kimi K3, el primer modelo abierto que llega a la clase de los 2,8 billones de parámetros. La página del modelo en Hugging Face lleva una cuenta atrás que termina el 27 de julio de 2026 sobre las 15:00 UTC, las cinco de la tarde en España, con 1.559 cuentas apuntadas para recibir el aviso.

Puntos clave

  • 2,8 billones de parámetros totales en una arquitectura de mezcla de expertos (MoE): 896 expertos de los que solo se activan 16 por token, unos 50.000 millones de parámetros activos.
  • Ventana de contexto de 1.048.576 tokens, pensada para leer repositorios de código enteros.
  • La descarga ronda 1,4 TB en formato MXFP4 (cuatro bits), frente a los 5,6 TB que ocuparía a 16 bits.
  • Lleva funcionando por API desde el 17 de julio: 3 dólares por millón de tokens de entrada, 0,30 si la entrada está cacheada, y 15 de salida.

Qué cambia respecto a la API

Que un modelo esté disponible por API y que esté disponible para descargar son dos cosas distintas, y la diferencia importa. Hasta hoy, usar Kimi K3 significaba mandar tus prompts a servidores de Moonshot en China. A partir de esta tarde se puede bajar y ejecutar donde quieras, con tus datos sin salir de tu infraestructura.

Ese matiz explica buena parte del interés. Moonshot venía de cortar las suscripciones nuevas por falta de GPU, así que la vía hospedada estaba saturada. Los pesos abiertos quitan ese cuello de botella y lo trasladan al que se lo quiera montar.

El problema es que montárselo no es barato. Hacen falta alrededor de 18 aceleradores de 80 GB solo para cargar el modelo en memoria. Un nodo moderno con ocho tarjetas de 192 GB entra por los pelos, sin margen para casi nada más. Un Mac Studio o una 4090 no lo mueven ni cuantizado.

Los números que trae de fábrica

Moonshot ha construido K3 sobre tres piezas nuevas: Kimi Delta Attention, Attention Residuals y algo que llaman Stable LatentMoE. Los pesos vienen en MXFP4 con activaciones en MXFP8, es decir, entrenado ya pensando en la cuantización, no cuantizado después a martillazos.

En las evaluaciones independientes del 17 de julio sacó 57 puntos en el Artificial Analysis Intelligence Index v4.1, cuarto de 189 modelos. En el Vals Index marcó 74,70%, segundo de 38. En Terminal-Bench 2.1 llegó al 80,90%, también segundo, y encabezó provisionalmente Arena WebDev con 1.679. Escupe 62 tokens por segundo y tarda 1,99 segundos en el primer token.

La propia Moonshot reconoce que K3 se queda por detrás de Claude Fable 5 y de GPT-5.6 Sol en conjunto. Es una posición honesta y sigue el patrón de Alibaba con Qwen 3.8: los laboratorios chinos ya no venden que ganan, venden que están a un escalón y encima te dan los pesos.

El detalle que falta: la licencia

A la hora de escribir esto la licencia todavía no estaba publicada. Es el dato que decide si esto sirve para una empresa o solo para experimentar. Kimi K2.7 salió con una MIT modificada, así que lo esperable es algo parecido, pero "esperable" no es lo mismo que "firmado". Hasta que el texto esté en la página, cualquiera que planifique un despliegue comercial encima de K3 lo hace a ciegas.

Tampoco es un lanzamiento en el vacío. La Casa Blanca acusó a Moonshot de copiar el modelo Fable de Anthropic y el Tesoro llegó a hablar de sanciones. Washington sopesa restringir los modelos chinos mientras Nvidia, Meta y Microsoft firman una carta contra vetar los pesos abiertos. Soltar 1,4 TB de pesos en abierto en mitad de ese debate no es un gesto neutro.

Por qué importa

Si estás valorando modelos abiertos para tu empresa, K3 mueve el techo de lo que se puede autoalojar, pero no lo pone a tu alcance. Con 18 aceleradores de 80 GB para arrancar, esto es infraestructura de proveedor, no de sala de servidores. Lo realista para casi todo el mundo es que aparezca en los grandes clouds y en hosts especializados durante la próxima semana, y ahí sí la comparación es directa: rendimiento cercano al primer nivel con la opción de ejecutarlo en tu región y tus reglas.

Lo que sí conviene hacer hoy es mirar la licencia en cuanto se publique y no antes. Y si ya tienes procesos críticos encima de un modelo, tratar esto como lo que es: una alternativa que baja el coste de cambiar de proveedor, no una razón para cambiar mañana.


Relacionado