SpaceXAI lanza Grok 4.6 a 2 dólares por millón y empata con GPT-5.6 en el indice de Artificial Analysis

SpaceXAI lanza Grok 4.6 a 2 dólares por millón y empata con GPT-5.6 en el indice de Artificial Analysis
Fuente: x.ai

SpaceXAI ha lanzado Grok 4.6 el 12 de agosto a 2 dolares por millon de tokens de entrada y 6 por millon de salida, y empata con GPT-5.6 Sol Max en el indice de inteligencia de Artificial Analysis. Es el modelo que Musk puso fecha para el 7 de agosto y ha llegado cinco dias tarde, el mismo dia que DeepSeek sacaba su V4 Pro.

Puntos clave

  • 2 dolares por millon de tokens de entrada y 6 por millon de salida. La variante rapida cuesta el doble.
  • 500.000 tokens de contexto segun la ficha del modelo en OpenRouter.
  • Empata a 61 con GPT-5.6 Sol Max en el AA Intelligence Index, el compuesto que usa Artificial Analysis.
  • Disponible desde el primer dia en Cursor, Grok Build, las apps de movil, la consola de SpaceXAI, OpenRouter, Vercel y Cloudflare.

Donde gana y donde pierde contra GPT-5.6

Los numeros que publica SpaceXAI dibujan un modelo que gana por poco en unas pruebas y pierde por mucho en otras. En GDPVal-AA v2, que mide trabajo de conocimiento con valor economico, saca 1.753 frente a los 1.728 de GPT-5.6 Sol Max. En CursorBench v3.2, la prueba de codigo dentro del editor, 69,9% contra 67,2%. En APEX-Agents, 57,5% contra 56,7%. Tres victorias por margen estrecho.

Las derrotas son mas anchas. En DeepSWE v1.1 se queda en 65,9% frente al 73% de GPT-5.6. En Terminal-Bench v3.0, la prueba de tareas largas en terminal, 26% contra 34,6%. Ese ultimo dato importa mas de lo que parece: es exactamente el escenario que SpaceXAI vende cuando habla de agentes que trabajan solos durante horas.

FrontierCode v1.1 queda casi en tablas, 61,3% contra 60,6%.

Que promete el modelo

El anuncio insiste en una capacidad concreta: convertir una idea amplia de producto en una primera version funcionando. Investigar, estructurar la aplicacion, implementar las interacciones y probarse a si mismo a lo largo de varios pasos, sin que alguien le vaya dando instrucciones cada dos minutos.

Encaja con lo que SpaceXAI lanzo el dia anterior, Grok Bot y sus agentes con ordenador propio en la nube. Un modelo mas barato con 500.000 tokens de contexto es la pieza que hacia falta para que esos agentes salgan a cuenta cuando estan encendidos todo el dia.

Para empujar la adopcion, SpaceXAI regala el doble de uso incluido dentro de Grok Build y Cursor durante la primera semana.

La guerra de precios que se abrio ayer

Grok 4.6 salio el mismo dia que DeepSeek V4 Pro, y ahi la comparacion de precio duele. DeepSeek cobra 0,435 dolares por millon de entrada. SpaceXAI cobra 2. Casi cinco veces mas.

La diferencia se sostiene solo mientras Grok rinda de forma claramente superior. Con un empate a 61 en el indice compuesto y dos derrotas serias en las pruebas de codigo agentico, ese argumento se estrecha cada trimestre.

Por qué importa

Si usas Cursor en el equipo de producto, esta semana tienes tres modelos frontera compitiendo por el mismo trabajo y el doble de uso incluido durante siete dias. Es el momento barato de medir en tu propio repositorio en lugar de fiarte de la tabla de nadie.

Y hay una lectura mas util que la del ranking. Los benchmarks de codigo se han partido en dos: escribir codigo en el editor (donde gana Grok 4.6) y ejecutar tareas largas en terminal sin supervision (donde pierde por ocho puntos). Si lo que quieres es un agente que trabaje solo mientras cierras el portatil, mira Terminal-Bench antes que el numero grande del titular. En tu factura, esos ocho puntos son reintentos.


Relacionado