Un Qwen3.8-27B cuantizado en 22 GB aguanta contra Opus 5 High en SWE-bench-Live

Un Qwen3.8-27B cuantizado en 22 GB aguanta contra Opus 5 High en SWE-bench-Live
Fuente: huggingface.co

Un desarrollador ha publicado que una versión afinada de Qwen3.8-27B, corriendo dentro del agente de código Pi, supera a Claude Opus 5 High en el tramo actual de SWE-bench-Live. Y la model card enseña builds cuantizadas de entre 18 y 23 GB, que caben en una GPU de 24 GB de las que se compran para jugar.

Vamos con las advertencias antes que con el titular, porque aquí hacen falta.

Qué mide y qué no

SWE-bench-Live es un benchmark hecho con bugs reales de software publicados recientemente. Esa parte es buena: al usar problemas nuevos, se reduce la posibilidad de que el modelo los haya visto durante el entrenamiento, que es lo que arruina la mitad de las comparativas.

Ahora las pegas. El resultado es de la comunidad y sigue en curso, no lo ha verificado nadie de forma independiente. Y es un tramo del benchmark, no el conjunto entero. Esto no significa que Qwen sea mejor que Claude, y quien lo cuente así está exagerando.

Lo que sí significa, y ya es bastante: la distancia entre lo que corre en tu ordenador y lo que corre en un centro de datos se ha estrechado hasta ser discutible en al menos una tarea concreta y medible. Hace un año esa frase era ridícula.

Nosotros ya cubrimos [el lanzamiento de Qwen3.8-27B con pesos abiertos](/noticias/qwen-3-8-27b-pesos-abiertos-swe-bench-pro-terminal-bench/) hace diez días. Lo nuevo aquí no es el modelo, es que alguien lo ha metido en 22 GB y lo ha puesto a trabajar dentro de un agente.

La cuantización es la clave y tiene precio

Cuantizar es reducir la precisión con la que se guarda cada peso del modelo para que ocupe menos memoria. Un modelo que en precisión completa pide 54 GB, en 4 bits pide unos 18. Se pierde algo de calidad, y cuánto se pierde depende de cómo se haga.

Ahí es donde el asunto se pone interesante esta misma semana: Multiverse Computing ha publicado un método llamado Quantization-Aware Healing que consigue que una versión comprimida a 4 bits supere a la misma versión en 16 bits en siete de nueve benchmarks. No es magia, es que reentrenan el modelo cuantizado destilando desde el original completo en lugar de comprimir y rezar.

Si ese tipo de técnicas se generalizan, el argumento de "el modelo local pierde calidad al cuantizar" se cae, y con él buena parte de la razón para no correr cosas en casa.

FreeToken, la otra mitad

En paralelo, Shuo Yang, doctorando en Berkeley, ha presentado FreeToken, con paper en arXiv. La propuesta va por otra vía: ejecutar los checkpoints completos del modelo sin cuantización extrema, repartiendo el trabajo entre CPU y GPU de forma consciente del ancho de banda disponible, más caché entre turnos del agente.

Los números de su demo: Qwen3.6-35B a 39 tokens por segundo en un portátil con una RTX 4060 de 8 GB. Y DeepSeek-V4-Flash a 22-25 tokens por segundo en una RTX 5090 de sobremesa. Sus autores reportan de 3 a 4 veces la velocidad de generación de Ollama, con soporte para agentes de código incorporado.

Una RTX 4060 de 8 GB es una tarjeta de gama media de portátil. Que ahí corra un modelo de 35.000 millones de parámetros a 39 tokens por segundo es más noticia que el benchmark del principio.

Lo que cambia para una empresa

Hasta ahora el argumento para correr modelos en local era casi siempre la privacidad. Datos que no pueden salir, sectores regulados, contratos con cláusulas de confidencialidad. Se aceptaba pagar el peaje de un modelo peor a cambio de que la información no se moviera.

Lo que apuntan estos dos trabajos es que el peaje se está reduciendo, y entonces entran en juego el coste y el control.

Casos donde ya tiene sentido mirarlo con calma:

  • Volumen alto de tareas repetitivas y sencillas. Clasificar, extraer, etiquetar. Si haces cien mil llamadas al mes de algo mecánico, la aritmética de la API deja de ser evidente.
  • Procesos que no pueden depender de que una API esté arriba. Si el proveedor se cae, tu proceso se cae. Con el modelo en tu máquina, no.
  • Datos que legalmente no pueden salir. Aquí no hay discusión y nunca la hubo.

Y donde sigue sin tener sentido: cualquier cosa que necesite lo mejor que existe hoy. Ahí el modelo de frontera gana y no está cerca.

El aviso honesto: montar esto no es gratis. Hay que elegir modelo, elegir cuantización, medirla contra tus casos reales, y mantenerlo cuando salga la versión siguiente. Eso es trabajo de alguien, todos los meses. La API la pagas y funciona.

Fuente original: Hugging Face


Relacionado