Cursor abre el núcleo con el que entrena y pasa de 760 a 1.070 tokens por GPU

Cursor abre el núcleo con el que entrena y pasa de 760 a 1.070 tokens por GPU
Fuente: cursor.com

Cursor ha liberado Mixture-of-Kittens, el núcleo de entrenamiento con el que entrena sus propios modelos de mezcla de expertos. En su producción real, el cambio sube el ritmo de 760,9 a 1.070,2 tokens por segundo y GPU. El código está en GitHub.

Puntos clave

  • Mixture-of-Kittens (MoK) es un megakernel único que fusiona comunicación y cómputo en una sola pieza determinista, pensado para sistemas Nvidia GB300 NVL72.
  • El paso hacia delante va hasta 2,37 veces más rápido en precisión MXFP8 y 1,92 en BF16. El paso hacia atrás, 1,78 y 1,58.
  • De extremo a extremo son 1,41 veces más tokens por segundo en el entrenamiento de producción de Cursor.
  • Se ha medido contra NCCL con PyTorch, DeepEP con PyTorch y HybridEP con Megatron, sobre las formas de Kimi K2.7 Code, GLM-5.2, Qwen3.5-397B-A17B y DeepSeek-V4-Pro.

Dónde estaba el cuello de botella

En un modelo de mezcla de expertos, cada token se enruta a unos pocos expertos que viven en GPUs distintas. Eso significa que antes de multiplicar matrices hay que mover tokens entre tarjetas, y después hay que devolverlos. Con paralelismo de expertos de grado 64, como el que usa Cursor, esa danza de mensajes se come una parte enorme del tiempo de cálculo.

El planteamiento clásico separa las dos cosas: una librería mueve datos, otra multiplica. MoK las mete en el mismo kernel. El reparto hacia delante funciona tirando datos (pull), la recombinación funciona empujándolos (push), y unos búferes circulares de tokens (lo que llaman macrobatch) eliminan la sincronización entre CPU y GPU que frenaba todo lo demás.

El resultado son 2.048 tokens por GPU antes del enrutado sin que la comunicación deje ratos muertos a las unidades de cálculo.

Por qué Cursor publica esto

Cursor lleva meses empujando por el lado del coste más que por el del tamaño. A primeros de agosto contó cómo recortó hasta un 30% los tokens de sus agentes en la nube, y antes había probado enjambres donde un modelo caro planifica y los baratos ejecutan. Esto va en la misma dirección, un escalón más abajo: si entrenar te sale un 41% más barato en tiempo de máquina, puedes iterar más veces con el mismo presupuesto.

Publicarlo también tiene lectura de mercado. El kernel está atado a hardware Nvidia de última hornada, así que quien más partido le saca es quien ya tiene ese hardware. Y quien lo usa, se queda dentro del ecosistema.

Lo que dice el número de 1,41x

Los 2,37 veces del paso hacia delante son el titular bonito, pero el número honesto es el de extremo a extremo: 1,41. Entre medias hay carga de datos, pasos del optimizador, puntos de control y todo lo que no es multiplicar matrices.

Es una diferencia que conviene tener presente cuando alguien te enseña una mejora de rendimiento. La aceleración de un componente rara vez se traslada entera al sistema. Cursor tiene el detalle de dar las dos cifras.

Por qué importa

Casi ninguna empresa española va a entrenar un modelo de mezcla de expertos. La lectura útil está en otro sitio.

Primero, en el precio. Cada avance de este tipo empuja hacia abajo el coste de entrenar, y ese ahorro acaba llegando a la factura de la API unos meses después. La guerra de precios que llevamos viendo todo el verano se alimenta de cosas así, no de generosidad.

Segundo, en el patrón. Cursor no ha ganado el 41% metiendo más GPUs, lo ha ganado quitando esperas entre piezas que ya tenía. Cuando montas una automatización interna y va lenta, el reflejo suele ser pedir más máquina. Mirar primero dónde se queda el proceso parado suele salir bastante más barato.


Relacionado