Alibaba abre Qwen3.8-27B: 61,7% en SWE-bench Pro y 73,0 en Terminal-Bench con 27.780 millones de parámetros

Alibaba abre Qwen3.8-27B: 61,7% en SWE-bench Pro y 73,0 en Terminal-Bench con 27.780 millones de parámetros
Fuente: huggingface.co

Alibaba ha publicado Qwen3.8-27B bajo licencia Apache 2.0, con 61,7% en SWE-bench Pro y 73,0 en Terminal-Bench 2.1. Son 27.780 millones de parámetros en arquitectura densa, o sea, un modelo que cabe en una sola GPU y que discute tareas de código con modelos varias veces más grandes.

Puntos clave

  • 27.780 millones de parámetros, arquitectura densa (no mezcla de expertos), licencia Apache 2.0.
  • SWE-bench Pro 61,7%. Terminal-Bench 2.1 sube de 63,4 a 73,0 frente a Qwen3.6-27B.
  • DeepSWE 1.1 pasa de 13,3% a 42,2%. Es el salto más bruto de toda la tabla.
  • OSWorld-Verified de 63,9% a 84,3% y WebArena-Verified 64,8%, las pruebas de uso de ordenador.
  • Contexto nativo de 262.144 tokens, ampliable a un millón con escalado RoPE (YaRN).

Qué cambia técnicamente

El salto en DeepSWE es el número que hay que mirar. De 13,3% a 42,2% entre dos versiones del mismo tamaño significa que el trabajo está en el entrenamiento y en la arquitectura, no en meter más parámetros. Alibaba mantiene la cuenta de 27.000 millones y triplica el resultado en resolución de incidencias reales de software.

La arquitectura mezcla capas Gated DeltaNet con capas de atención: 16 bloques de tres pasadas de DeltaNet más una de atención con red neuronal por delante. DeltaNet es una alternativa a la atención clásica que cuesta menos memoria cuando el contexto crece, y esa es la razón por la que un modelo de este tamaño aguanta 262.144 tokens nativos sin dispararse.

El checkpoint que ha reventado Hacker News es el FP8, con cuantización de grano fino y tamaño de bloque 128. La ficha del modelo dice que rinde "casi idéntico" al original sin cuantizar. En la práctica ahí está la noticia para cualquiera que quiera correrlo en su propia máquina: FP8 recorta la memoria a la mitad frente a FP16, y un 27B en FP8 entra en una GPU de gama alta de una sola pieza.

También acepta imagen y vídeo, no solo texto. OSWorld-Verified en 84,3% mide agentes que manejan un escritorio de verdad, abriendo aplicaciones y haciendo clic. Ese 84,3% con pesos abiertos es la cifra que va a hacer ruido las próximas semanas.

Cómo queda frente a lo demás

Alibaba viene de abrir los pesos de Qwen3.8-Max, su modelo de 2,4 billones de parámetros. El 27B es el otro extremo de la misma estrategia: uno para presumir en benchmarks, otro para que la gente lo instale.

Conviene recordar que hace dos semanas Qwen3.8-Max cayó al puesto 28 en un índice agéntico independiente, después de haber publicado benchmarks propios muy por encima. Estos números del 27B son también de Alibaba, salidos de su propia ficha de modelo. La verificación de terceros llega con semanas de retraso y a veces cuenta otra cosa.

El competidor directo en tamaño es Muse Glimmer, los 30.000 millones de pesos abiertos que Meta soltó el 10 de agosto. Cinco días de diferencia entre los dos lanzamientos, misma franja de tamaño, misma promesa de correr en local. La franja de los 30B se ha convertido en el terreno donde se pelea de verdad.

Por qué importa

Si tienes datos que no quieres mandar a una API, este es el modelo que toca probar. Un 27B en FP8 corre en una sola GPU de datacenter, y con 61,7% en SWE-bench Pro ya sirve para trabajo real de código, no solo para demos.

La cuenta que hay que hacer es la de siempre: coge tres tareas que ya estés pagando por API, mídelas contra Qwen3.8-27B en tu hardware y compara coste total (GPU, electricidad y el tiempo de quien lo mantiene) contra la factura mensual del proveedor. Para volúmenes altos y repetitivos suele salir a cuenta. Para uso esporádico, casi nunca.

Y una advertencia sobre el contexto. Los 262.144 tokens son nativos, el millón sale de estirar con YaRN. Estirar contexto degrada la calidad en la parte final de la ventana, así que si tu caso de uso depende de meter un millón de tokens, mídelo antes de montar nada encima.


Relacionado