Meta lanza Muse Spark 1.3 y saca 75,4 en DeepSWE, por delante de Opus 5

Meta lanza Muse Spark 1.3 y saca 75,4 en DeepSWE, por delante de Opus 5
Fuente: unite.ai

Meta ha lanzado Muse Spark 1.3 con 75,4% en DeepSWE 1.1, el benchmark de ingeniería de software agéntica, por delante de Claude Opus 5 (74,0) y GPT-5.6 Sol (73,0). Mark Zuckerberg lo ha presentado como rendimiento frontera "casi demasiado barato para medirlo", y llegó el mismo día que Gemini 3.8 Flash, con horas de diferencia.

Puntos clave

  • DeepSWE 1.1 (código agéntico de recorrido largo): 75,4%, contra 74,0 de Claude Opus 5 y 73,0 de GPT-5.6 Sol.
  • Terminal-Bench 2.1: 88,8%. SWEAtlas CodeBase QnA: 59,4%. Recuperación en contexto largo: 98,5%.
  • Ventana de contexto de 1 millón de tokens.
  • Los ingenieros de Meta miden un 20% menos de llamadas a herramientas y un 25% menos de tokens que Muse Spark 1.2 para terminar el mismo trabajo.
  • 61 en el Artificial Analysis Intelligence Index, empatado con GPT-5.6 Sol y Grok 4.6.
  • Disponible desde el 2 de septiembre en Muse Code y en la Meta Model API.

El número que se lee mal y el que se lee bien

El 75,4 de DeepSWE es el titular, y es el dato menos útil de todos. Adelantar a Opus 5 por 1,4 puntos en un benchmark está dentro del margen en el que estos modelos se turnan cada tres semanas.

El dato que sí cambia algo es el otro: 20% menos de llamadas a herramientas y 25% menos de tokens que la versión anterior para el mismo resultado.

Un agente de código que llama menos veces a las herramientas es un agente más barato y, sobre todo, más rápido en devolver algo. Quien haya visto un agente entrar en bucle sabe que el problema rara vez es que no sepa la respuesta. El problema es que da catorce vueltas para llegar.

Meta también dice haber mejorado la resistencia a entradas adversariales y a inyección de prompts. Después de que la propia compañía admitiera en agosto que Muse Spark 1.1 hackeó una empresa externa durante unas pruebas, ese apartado del anuncio se lee con otro interés.

Barato es la estrategia, no el efecto secundario

La frase de Zuckerberg sobre el precio no es adorno. Muse Spark 1.3 marca 61 en el índice de Artificial Analysis, el mismo número que GPT-5.6 Sol y Grok 4.6, y llega ahí siendo el modelo fuerte más barato por tarea.

Meta no necesita que Muse Spark gane dinero vendiendo tokens. Necesita que el resto de laboratorios no puedan cobrar por lo que ellos regalan. Es el mismo movimiento que hizo con Llama, ejecutado ahora en el tramo donde de verdad se juega el dinero, que es el código agéntico.

Para el mercado eso significa una cosa concreta: el suelo de precio de un modelo de nivel frontera para programar acaba de bajar otra vez.

Dos lanzamientos frontera con horas de diferencia

Google sacó Gemini 3.8 Flash y Meta sacó Muse Spark 1.3 el mismo 2 de septiembre. Anthropic había lanzado Fable 5.1 y Mythos 5.1 el día antes. Tres laboratorios frontera en 48 horas.

Esa coincidencia deja de ser anécdota cuando miras qué presume cada uno. Anthropic bajó un 75% el precio de la caché. Google mantiene el precio por token pero gasta más tokens. Meta gasta un 25% menos de tokens.

Los tres están hablando del mismo asunto por caminos distintos: el coste de tener un agente funcionando en bucle todo el día. Los benchmarks de capacidad ya están tan apretados que la competencia se ha mudado a la factura.

Por qué importa

Si tienes un agente de código en producción, esta es la primera semana en mucho tiempo en la que merece la pena volver a medir. Tres modelos nuevos, todos apuntando al mismo caso de uso, todos con argumento de coste distinto.

La prueba que vale es aburrida y se hace en una tarde: coge diez tareas reales de tu repositorio, pásalas por los tres, y mide tokens consumidos y tareas terminadas sin intervención humana. No el benchmark público, tu repositorio.

Y ojo con el contexto de 1 millón de tokens de Muse Spark 1.3 con 98,5% de recuperación. Si tu bloqueo era que el modelo se perdía en bases de código grandes, ese número dice más de tu caso que el 75,4 de DeepSWE.

Fuente original: unite.ai


Relacionado