Xiaomi libera MiMo-V2.6-Pro, el modelo abierto mejor puntuado

Xiaomi libera MiMo-V2.6-Pro, el modelo abierto mejor puntuado
Foto: Winston Chen / Unsplash

Xiaomi ha publicado MiMo-V2.6-Pro con licencia MIT, y desde el 21 de septiembre es el modelo de pesos abiertos mejor puntuado del Intelligence Index de Artificial Analysis, con 46 puntos. Cualquier empresa puede descargarlo, montarlo en sus servidores y usarlo en producción sin pagar licencia. La pega es el tamaño: 1,02 billones de parámetros.

Puntos clave

  • Tamaño: 1,02 billones de parámetros en total, de los que solo trabajan unos 42.000 millones en cada token que genera. Admite un millón de tokens de contexto.
  • Qué entiende: texto, imagen, vídeo y audio dentro del mismo modelo, sin piezas pegadas por fuera.
  • Puntuación: 46 en el índice de Artificial Analysis, empatado con Grok 4.7 y por delante de Kimi K3, GLM-5.3 y los dos DeepSeek V4.1. Los mejores modelos cerrados están en 53.
  • Precio por API: 0,435 dólares por millón de tokens de entrada y 0,87 por millón de salida. El hermano pequeño, MiMo-V2.6-Flash, cuesta 0,14 y 0,28.
  • Licencia: MIT, la más permisiva que hay. Uso comercial, ajustes y despliegue propio sin condiciones.

Qué ha publicado exactamente

La familia MiMo-V2.6 trae tres modelos. El Pro es el grande. El Flash tiene 310.000 millones de parámetros y usa 15.000 millones por token, pensado para quien necesita volumen y coste bajo. Y hay una variante Pro-UltraSpeed que Xiaomi vende como 20 veces más rápida generando texto.

El 27 de septiembre llegó además una revisión del Pro, la MOPD, que según la ficha de Hugging Face corrige un vicio concreto: el modelo a veces repetía la misma llamada a una herramienta una y otra vez. Quien lo esté probando para tareas con agentes tiene que bajar esta versión, la del 21 arrastra ese fallo.

La arquitectura es de mezcla de expertos (MoE, del inglés *mixture of experts*): 384 bloques especializados, de los que se encienden 8 por cada token. Por eso un modelo de un billón de parámetros cobra como uno mucho más pequeño. Lleva además un codificador de visión de 681 millones de parámetros y dos de audio, todo entrenado junto.

Los números contra Claude y GPT

La ficha técnica compara el Pro con Claude Opus 5, GPT-5.6 Sol y Claude Fable 5 en una veintena de pruebas. Lo interesante es dónde llega y dónde no.

En DeepSWE, que mide si un agente resuelve incidencias reales de código, saca 71,9. Opus 5 marca 74,0, GPT-5.6 Sol 73,0 y Fable 5 70,0. El salto contra su versión anterior es enorme: MiMo-V2.5-Pro sacaba 19,0 en la misma prueba. En AutomationBench, que evalúa automatizaciones de oficina, se pone primero con 53,1 frente a 50,3 de Opus 5. En OSWorld-Verified, manejar un ordenador como una persona, se queda en 82,0 contra 83,4 de Opus 5 y 86,0 de Fable 5.

Donde se nota la distancia es en Terminal Bench 4.0, tareas largas en la línea de comandos: 34,9 contra 49,0 de Opus 5. Y en las pruebas de ciberseguridad ofensiva, ExploitBench le da 47,9 frente a 78,5 de GPT-5.6 Sol.

Todo esto son cifras que publica Xiaomi sobre su propio modelo. El 46 de Artificial Analysis es el dato independiente, y ese sí lo coloca arriba de todos los abiertos.

Cuánto costó entrenarlo

El dato que más ha circulado esta semana es el del coste. Según VentureBeat, la fase de aprendizaje por refuerzo del Pro costó 2,62 millones de dólares y la del Flash 850.000, en menos de seis días cada una. Ojo con leer esa cifra como el coste total del modelo: es solo la última fase, la que le enseña a razonar y a usar herramientas a base de premiar lo que sale bien. El preentrenamiento, la parte cara, no entra ahí.

El método es la apuesta del equipo. Hicieron una sola tanda de refuerzo mezclando código, agentes, visión y ciberseguridad en los mismos lotes, en vez de una tanda por área. Cada paso procesa 1.568 problemas con 16 intentos por problema, y otro modelo actúa de corrector comparando los intentos entre sí. Lo dirige Fuli Luo, que venía de DeepSeek. Su frase a la prensa: con el cómputo "brutalmente escaso", decidieron poner a varias decenas de personas durante mucho tiempo en un único objetivo, escalar el refuerzo.

Xiaomi anuncia también que publicará más de 7.000 entornos de entrenamiento, los escenarios donde el modelo practica. Parte del sector lo ve como lo más valioso del lanzamiento, porque hasta ahora esos entornos eran el secreto mejor guardado de cada laboratorio.

Lo que pide para correr en casa

Para montarlo en tu servidor hace falta mucha máquina. La propia Xiaomi recomienda desplegarlo con 16 tarjetas gráficas repartidas en dos máquinas, o con 8 como mínimo en la receta de vLLM. Hablamos de un equipo del orden de cientos de miles de euros, o de un alquiler serio en la nube.

La comunidad ya ha sacado versiones comprimidas. En Hugging Face hay copias cuantizadas (reducidas de precisión para que ocupen menos) para Mac y para tarjetas de consumo, y la versión oficial del Pro suma más de 76.000 descargas en su primer mes. También han aparecido copias con los filtros de seguridad quitados, que es la otra cara de publicar con licencia MIT.

Por qué importa

Para una empresa española que usa Claude o ChatGPT, la pregunta práctica tiene dos respuestas según el caso.

Si lo que frena es mandar datos fuera (sanidad, legal, banca, cualquier cosa con datos personales delicados), cada modelo abierto bueno amplía el margen. MiMo-V2.6-Pro ronda a Opus 5 en código y en automatización de oficina, y lo puedes tener en tu propio servidor. Lo que sigue haciendo falta es equipo técnico que lo mantenga y máquinas que lo muevan.

Si lo que importa es el precio por API, 0,87 dólares por millón de tokens de salida es una fracción de lo que cobran los modelos cerrados punteros. Para tareas de volumen con poco riesgo, clasificar correos, resumir tickets, extraer datos de facturas, merece la pena una prueba comparativa con tus propios casos antes de fiarse de ninguna tabla.

Para lo que va a producción con clientes, el coste de que algo falle suele pesar más que el de los tokens, y ahí los cerrados siguen por delante. La distancia en el índice de Artificial Analysis es hoy de 7 puntos.

Fuente original: Hugging Face


Relacionado