Alibaba publica los benchmarks de Qwen3.8-Max y dice que ya iguala a Fable 5

Alibaba publica los benchmarks de Qwen3.8-Max y dice que ya iguala a Fable 5
Fuente: scmp.com

Alibaba ha puesto números a Qwen3.8-Max. Tres semanas después de enseñar el modelo en preview sin una sola cifra, la compañía ha publicado resultados que lo sitúan a la altura de Fable 5 de Anthropic y por delante del Kimi K3 de Moonshot en varias pruebas.

El salto retórico es notable. En julio Alibaba decía que su modelo era "segundo solo por detrás de Fable 5". Ahora enseña tests donde lo iguala o lo supera.

Puntos clave

  • ERQA, razonamiento encarnado: 77,8 para Qwen3.8-Max frente a 70,0 de Fable 5.
  • OSWorld-Verified (uso agéntico de ordenador): 86,1.
  • MobileWorld (uso agéntico de móvil): 77,8.
  • 2,4 billones de parámetros en Mixture-of-Experts dispersa, contra los 2,8 billones de Kimi K3.

De dónde viene esto

Alibaba presentó Qwen3.8-Max-Preview el 19 de julio en la World AI Conference de Shanghái, días después de que Moonshot soltara Kimi K3 con pesos abiertos. La presentación llegó sin tabla de benchmarks, sin model card, sin licencia y sin decir cuántos parámetros se activan por petición. Las acciones de Alibaba subieron hasta un 5% en Hong Kong ese lunes de todos modos.

Lo que faltaba entonces era justo lo que llega ahora: cifras que alguien pueda contrastar. Y no todas apuntan en la misma dirección. La única prueba independiente que circulaba hasta ahora, el StackPerf de Trilogy AI sobre una tarea de arquitectura de software compleja, dio 80 sobre 100 a Qwen3.8-Max-Preview y 83 a Kimi K3.

Qué miden esos benchmarks

Los tres nombres que ha sacado Alibaba tienen algo en común: ninguno es un test de conversación. ERQA mide razonamiento sobre el mundo físico a partir de imágenes, el tipo de tarea que necesita un robot o un sistema de visión industrial. OSWorld-Verified pone al modelo a manejar un ordenador de verdad, abriendo aplicaciones y completando tareas en un escritorio. MobileWorld hace lo mismo en un móvil.

Elegir esas tres pruebas y no SWE-bench o GPQA dice bastante de dónde quiere pelear Alibaba: agentes que operan software, no asistentes que redactan.

Como referencia, el modelo anterior de la casa, Qwen3.7-Max, marcaba 92,4 en GPQA-Diamond, 80,4% en SWE-bench Verified y 69,7 en Terminal-Bench 2.0-Terminus. Esas cifras siguen sin actualizarse para la versión 3.8.

Lo que sigue sin estar

Tres huecos, y ninguno es menor si estás valorando meter el modelo en producción.

El primero: los parámetros activos por petición. En una arquitectura de expertos dispersa, el total de 2,4 billones no dice casi nada del coste real. Sin ese número no se puede estimar cuánto sale servir el modelo.

El segundo: el precio. El acceso va por la suscripción Token Plan y por las plataformas Qoder y QoderWork, a un descuento reportado del 90% sobre tarifa estándar. La tarifa estándar por token no se ha anunciado.

El tercero: los pesos. Alibaba lleva desde julio diciendo que Qwen3.8 saldrá con pesos abiertos. Sin fecha, sin licencia y sin repositorio. Viniendo de la compañía que construyó su reputación en IA abierta, y que ya cerró Qwen3.7-Max, la promesa pesa poco hasta que se cumpla.

La API sí acepta tanto la spec de OpenAI como la de Anthropic, igual que el resto de la línea Max. Cambiar de proveedor es un cambio de endpoint.

Por qué importa

Si usas Claude o ChatGPT en tus procesos, la lectura práctica es de precio, no de orgullo nacional.

Cada vez que un modelo chino se acerca a Fable 5 o a GPT-5.6 en pruebas creíbles, la presión sobre las tarifas de los laboratorios americanos aumenta. Esa presión es la que ha metido modelos frontera en el rango de precio en el que una empresa mediana española puede correr cientos de miles de peticiones al mes sin pestañear.

Ahora, migrar por precio tiene coste. Los datos pasan por servidores chinos, con lo que eso implica en RGPD si tratas datos personales. Y un modelo del que no conoces los parámetros activos ni la tarifa oficial no es sobre lo que construyes un proceso crítico.

Mi recomendación para 2026: mira estas cifras para negociar, no para migrar. La mejor consecuencia de Qwen3.8-Max en tu empresa probablemente sea la bajada de precio que Anthropic u OpenAI hagan dentro de seis meses.


Relacionado