SpaceXAI lanza Grok 4.7 a 2 dólares por millón de tokens

Grok 4.7, el nuevo modelo de SpaceXAI
Imagen: SpaceXAI

SpaceXAI ha lanzado Grok 4.7 este 21 de septiembre, su modelo más capaz para programar y para trabajo de oficina, al mismo precio que Grok 4.6: 2 dólares por millón de tokens de entrada y 6 por millón de salida. El anuncio oficial dice que aguanta más tiempo en tareas difíciles y que revisa mejor su propio trabajo. Las mediciones independientes lo sitúan 7 puntos por detrás de Claude Fable 5.1 y GPT-6.

Puntos clave

  • Precio: 2 dólares por millón de tokens de entrada y 6 por millón de salida, igual que Grok 4.6. Hay una variante rápida que da el doble de velocidad de salida por el doble de precio.
  • Dónde está: desde hoy en Cursor, en Grok Build, en la API de Grok y a través de routers de modelos y plataformas cloud.
  • Qué cambia por dentro: un modelo base nuevo, más grande que el de Grok 4.6, y un entrenamiento por refuerzo más largo con tareas que tardan horas en resolverse.
  • Dónde queda: 46 puntos en el índice de Artificial Analysis, 2 más que Grok 4.6. Fable 5.1 y GPT-6 están en 53.

Qué cambia respecto a Grok 4.6

Grok 4.6 salió el 12 de agosto y Grok 4.7 llega 40 días después sin tocar la tarifa. Lo que cambia es el modelo de debajo.

SpaceXAI cuenta tres cosas. La primera, que el modelo base es más grande. La segunda, que la fase de entrenamiento por refuerzo (la parte en la que el modelo aprende a base de intentar tareas y recibir una nota) ha sido más larga y con una mezcla de problemas más difícil, cargada hacia trabajos que a una persona le llevan muchas horas. La tercera, que el modelo comprueba mejor lo que ha hecho y se pierde menos cuando el contexto (todo el texto que tiene delante en una conversación) se hace largo.

Hay un cuarto detalle con más recorrido del que parece. Han entrenado Grok 4.7 para entender de forma nativa el entorno de Grok Bot, los agentes que SpaceXAI lanzó en agosto con un ordenador propio en la nube. Es decir, el modelo ya sabe moverse dentro del programa que le da las herramientas, en vez de aprenderlo en cada tarea. Para quien use esos agentes, eso debería notarse en menos pasos perdidos.

Los números que publica SpaceXAI

La tabla oficial compara Grok 4.7 con Grok 4.6, con GPT-5.6 Sol en su nivel máximo y con Fable 5.1 también en el máximo. Estos son los resultados:

  • CursorBench 4.0 (programar tareas largas dentro del editor Cursor): 46,3%. Grok 4.6 sacaba 40,4%, GPT-5.6 Sol 41,7% y Fable 5.1 51,8%.
  • Terminal-Bench 4.0 (trabajo de horas en la terminal, la pantalla de comandos del ordenador): 38%, casi el doble que el 20,3% de Grok 4.6. Fable 5.1 marca 57,9%.
  • DeepSWE v1.1 (arreglar fallos reales en código): 71% con esfuerzo alto, frente al 72,7% de GPT-5.6 Sol y el 70% de Fable 5.1.
  • EEBench (ingeniería eléctrica): 64%, primero de los cuatro. Fable 5.1 se queda en 56,4% y GPT-5.6 Sol en 39,4%.
  • Harvey Legal Agent Benchmark (tareas de abogado): 19,6%, también primero. GPT-5.6 Sol saca 2,5% y Fable 5.1 un 6,7%.
  • AA Briefcase (trabajo de oficina de varias horas): 1.657 puntos, a 21 de los 1.678 de Fable 5.1.
  • HealthBench Professional (razonamiento clínico): 56,7%, por debajo de GPT-5.6 Sol (60,5%) y Fable 5.1 (62,1%).

Leída entera, la tabla dice algo bastante honesto. Grok 4.7 gana a GPT-5.6 Sol en casi todo y gana a todos en dos pruebas de nicho, la de ingeniería eléctrica y la legal. Fable 5.1 sigue por delante en programación y en el trabajo largo de terminal.

Y hay un detalle en la elección del rival. La tabla principal enfrenta a Grok 4.7 con GPT-5.6 Sol, cuando OpenAI ya tiene en la calle GPT-6 Astra desde principios de septiembre. GPT-6 Astra solo aparece en el gráfico de GDPval, la prueba de trabajo profesional.

Lo que dicen las mediciones independientes

Artificial Analysis, que junta diez benchmarks en un solo índice, le da a Grok 4.7 un 46, según recoge The Decoder. Es una subida de 2 puntos sobre Grok 4.6 y le vale a SpaceXAI para entrar entre los cuatro mejores laboratorios. Pero Fable 5.1 y GPT-6 están en 53.

La distancia crece en programación con agentes. En su propia ejecución de Terminal-Bench 4.0, Artificial Analysis mide a Grok 4.7 en un 26%, lejos del 38% que publica SpaceXAI. GPT-6 Astra saca 60% y Fable 5.1 55%. Hasta DeepSeek V4.1 Flash, un modelo mucho más barato, le pasa por un punto con un 27%. La diferencia entre el 38% oficial y el 26% independiente viene de configuraciones distintas de la prueba, y conviene fiarse más de la segunda para comparar entre modelos.

Vals AI, otro evaluador, lo coloca en el puesto 24 de su índice con un 54,2%, 5 puntos por debajo de Grok 4.6, que estaba en el 14. Según Vals, donde más mejora es en trabajo legal y médico.

El propio Elon Musk lo resume sin inflarlo. En X escribió que Grok 4.7 deja a SpaceXAI en tercer lugar en programación con agentes, detrás de Anthropic y OpenAI, y que su argumento es la velocidad y el precio.

Seguridad y ciberseguridad

SpaceXAI dice que Grok 4.7 estrena un sistema de salvaguardas hecho de cero. En HackerBench v0.3, su prueba interna de tareas de ciberseguridad maliciosas, deja pasar el 3,3% de las peticiones de riesgo de doble uso. En el benchmark de bioseguridad de LatchBio saca un 62,4%, el mejor resultado según la empresa. Además ha abierto acceso por invitación a sus capacidades de ataque simulado para algunos socios de ciberseguridad que trabajan en defensa.

Cuánto cuesta frente a la competencia

Con los precios que pone SpaceXAI en su tabla, la diferencia es grande. Fable 5.1 cuesta 10 dólares por millón de tokens de entrada y 50 por millón de salida. GPT-5.6 Sol, 4 y 20. Grok 4.7, 2 y 6.

Hice la cuenta con una tarea tipo que lee un millón de tokens y escribe 200.000 (por ejemplo, revisar un repositorio de código mediano y proponer cambios). Con Grok 4.7 sale a 3,20 dólares, con GPT-5.6 Sol a 8 y con Fable 5.1 a 20. Es una estimación mía sobre precios de lista, sin descuentos de caché ni de lote.

Ese precio por token no cuenta toda la historia. Si un modelo necesita tres intentos para lo que otro hace en uno, el barato sale caro. Por eso los laboratorios empujan ya el coste por tarea resuelta como métrica, y ahí Grok 4.7 compite mejor en CursorBench que en Terminal-Bench.

Box ha sido de los primeros en enseñarlo en uso real. En una vista previa de su agente, puso a Grok 4.7 a cuadrar una reclamación de seguros de 2 millones de dólares contra la póliza y los justificantes, y según la empresa encontró una factura duplicada de 82.000 dólares.

Por qué importa

Para una empresa que ya usa IA en sus procesos, Grok 4.7 no cambia la elección del modelo principal para trabajo delicado. Si tienes agentes programando solos durante horas, los datos independientes dicen que Fable 5.1 o GPT-6 Astra siguen rindiendo bastante más.

Donde sí entra en la conversación es en el trabajo de volumen: resumir documentos largos, extraer datos de contratos o facturas, primeras versiones de código que luego revisa una persona. Ahí pagar 6 dólares por millón de tokens de salida en vez de 50 se nota en la factura de final de mes. Y en trabajo legal, con un 19,6% frente al 6,7% de Fable 5.1 en la prueba de Harvey, merece al menos un ensayo.

Mi recomendación es la de siempre con cada modelo nuevo: coge 20 tareas reales de tu empresa, pásalas por Grok 4.7 y por el modelo que ya uses, y mide cuántas salen bien y cuánto cuesta cada una. Con eso decides en una tarde, y los benchmarks de la tabla oficial pasan a segundo plano.

Fuente original: x.ai


Relacionado