Cognition lanza SWE-2 sobre Kimi K3 y marca 92,8% en Terminal-Bench 2.1

Cognition lanza SWE-2 sobre Kimi K3 y marca 92,8% en Terminal-Bench 2.1
Fuente: cognition.com

Cognition ha lanzado SWE-2, su nuevo modelo de programación, y lo ha construido encima de Kimi K3, el modelo de 2,8 billones de parámetros de Moonshot AI. Según el anuncio, marca 92,8% en Terminal-Bench 2.1 y se pone por delante de Fable 5.1 y de GPT-6 Astra en ese banco concreto. Lo interesante no es el número. Es que cuesta un 64% menos.

Puntos clave

  • Terminal-Bench 2.1: 92,8% para SWE-2, 91,4% para Fable 5.1, 89,9% para GPT-6 Astra y 88,3% para el Kimi K3 del que parte.
  • FrontierCode 1.1: 50,0%. Astra saca 53,3% y Fable 5.1 un 50,9%. Aquí no gana.
  • DeepSWE 1.1: 73,0%, contra 74,1% de Astra y 72,7% de GPT-5.6 Sol.
  • Terminal-Bench 4: 27,3%. Astra hace 57,9% y Fable 5.1 un 55,8%. Es el agujero del modelo y Cognition lo publica igual.
  • Precio: un 64% por debajo de Fable 5.1 a rendimiento comparable, según sus propias cifras.

Lo que de verdad cambia es el número de pasos

El dato que más dice de SWE-2 no es un porcentaje de acierto. Es cuántas veces el agente tiene que darle una vuelta a la tarea antes de terminarla.

La versión anterior, SWE-1.7, necesitaba 127 pasos de media en FrontierCode 1.1. SWE-2 medium lo cierra en 53. Eso es un 58% menos de turnos y, en dinero, un 81% menos de coste por ejecución.

Las otras dos configuraciones suben el listón sin dispararse: SWE-2 high usa 80 pasos y SWE-2 max se planta en 98. Sigue siendo menos que el modelo al que sustituye.

Para quien paga la factura de un agente por token, esa es la partida que importa. Un agente que acierta lo mismo pero da la mitad de vueltas no es un modelo mejor sobre el papel, es uno que se puede dejar corriendo sin vigilar el contador.

Cómo lo han entrenado

Cognition dice haber llevado el aprendizaje por refuerzo al régimen de los billones de parámetros por primera vez, con una penalización de coste lineal derivada matemáticamente. Traducido: al modelo no solo se le premia por resolver la tarea, se le castiga por tardar.

Han triplicado los entornos de refuerzo, han metido capas de seguimiento de instrucciones y han usado checkpoints anteriores para ir afinando los verificadores. En infraestructura tiran de kernels NVFP4 y FP8, entrenamiento consciente de cuantización y decodificación especulativa con un modelo borrador en línea que llaman DSpark.

En seguridad reportan un 98,0% de aprobado en pruebas de propaganda y censura, sin efectos apreciables de sesgo por el marco cultural de la pregunta. Es un punto que se mira con lupa cuando el modelo base es chino.

Un modelo americano montado sobre uno chino

Aquí está el titular que Cognition no pone en negrita. SWE-2 no es un modelo entrenado desde cero: es Kimi K3, de la china Moonshot AI, llevado más lejos con refuerzo propio.

Y sale la misma semana en la que Anthropic ha destapado 200 millones de intercambios dedicados a destilar Claude, con Moonshot entre los laboratorios señalados. La misma empresa aparece en las dos historias, en papeles muy distintos.

La distancia entre SWE-2 y su base se ve en la tabla: Kimi K3 hace 88,3% en Terminal-Bench 2.1 y 44,2% en FrontierCode 1.1. El refuerzo de Cognition añade 4,5 y 5,8 puntos respectivamente. No es magia, pero es la diferencia entre pelear o no con Astra.

Cognition viene de cerrar 2.000 millones a una valoración de 48.000 hace dos días. SWE-2 es lo que esa ronda tiene que justificar.

Dónde se usa

SWE-2 llega ya a Devin Desktop y a Devin CLI. Devin Web y Devin Fusion lo están recibiendo por fases.

No hay API abierta anunciada. El modelo vive dentro del producto, que es exactamente lo contrario de lo que hacen OpenAI y Anthropic.

Por qué importa

Si tienes a alguien programando con un agente en tu empresa, la pregunta ya no es qué modelo acierta más. Es cuánto cuesta cada tarea terminada.

SWE-2 pone esa cuenta encima de la mesa: mismo resultado, la mitad de pasos, 81% menos de coste que su versión anterior. Con un agujero honesto en Terminal-Bench 4, donde las tareas largas y encadenadas lo dejan en 27,3%.

O sea: para tareas acotadas de código, entra en la comparación. Para flujos largos sin supervisión, todavía no.

Fuente original: cognition.com


Relacionado