GPT-5.6 Sol lidera el Coding Agent Index de Artificial Analysis con 80 puntos, y OpenAI dice que lo consigue usando un 54% menos de tokens de salida y un 57% menos de tiempo que el siguiente modelo del ranking. El coste por tarea, que era el argumento que frenaba la mayoría de proyectos de agentes, se ha movido.
Puntos clave
- 80 puntos en el Coding Agent Index de Artificial Analysis, ejecutado dentro de Codex. Terra marca 77 y Luna 75.
- 1,04 dólares por tarea del índice con Sol, alrededor de un tercio de lo que cuesta resolver la misma tarea con Claude Fable 5.
- Precios por millón de tokens: Sol a 5 de entrada y 30 de salida, Terra a 2,5 y 15, Luna a 1 y 6. La lectura de caché va con un 90% de descuento.
- En enero y febrero hubo desarrolladores con facturas de 20.000 dólares al mes, cuando los agentes tipo OpenClaw se pusieron de moda y quemaban cómputo a lo bruto.
- En el Intelligence Index general, Sol se queda en 59 frente a los 60 de Claude Fable 5. Sigue por detrás en inteligencia bruta.
De dónde sale el ahorro
La pieza es lo que en OpenAI llaman el *harness*: la capa que envuelve al modelo, le pasa las herramientas, gestiona el contexto y lo mantiene en la tarea hasta terminarla. Joe Gershenson, que lidera esa parte, la describe como la forma en que el modelo interactúa con el mundo. Ahmed Ibrahim, del equipo técnico, es la otra voz de la entrevista.
Es lo que hay debajo de Codex y de ChatGPT Work, y no aparece en ninguna tabla de benchmarks. Pero es donde se decide cuántas veces el agente vuelve a pensar lo mismo, cuántas veces relee un archivo entero y cuántas llamadas gasta antes de dar con la respuesta.
El giro de método está ahí. En vez de bajar el precio por token, han recortado la cantidad de tokens que el sistema necesita generar para hacer el mismo trabajo. Es una diferencia contable pequeña y una diferencia de negocio grande: el precio por token lo fija el proveedor y se copia en una semana, el número de tokens por tarea depende de ingeniería que no se copia tan rápido.
El matiz que conviene guardar
La cifra del 54% es de OpenAI y está medida en programación con agentes, contra el modelo que va segundo en ese índice. No es un ahorro general.
Cuando Artificial Analysis mide tokens en tareas variadas, el resultado es mucho más modesto: 15.000 tokens por tarea con Sol frente a los 16.000 de GPT-5.5. Sigue consumiendo menos que Claude Opus 4.8, que GLM-5.2 y que Gemini 3.5 Flash, pero el titular no se sostiene fuera del terreno donde se midió.
Traducido: si tu caso de uso es un agente que escribe y ejecuta código, el ahorro es real y grande. Si es resumir documentos o clasificar tickets, cuenta con una mejora de un dígito.
Por qué importa
Si hace seis meses hiciste números para meter agentes en un proceso y salió que no compensaba, esos números caducaron. Merece la pena rehacer el cálculo con el coste por tarea terminada, que es la métrica que de verdad decide, y no con el precio por millón de tokens que sale en la web del proveedor.
Ali Ghodsi, CEO de Databricks, lo resume con lo que le llega de sus clientes: lo primero que le preguntan es cómo recortar coste sin dejar de invertir en IA. Esa es la conversación real en las empresas que ya pasaron de la fase de probar.
La dirección es la misma en todos los laboratorios. Quien venda agentes dentro de un año competirá por lo que cuesta terminar la tarea, no por lo que cuesta el modelo. Y eso conviene meterlo hoy en el criterio de compra, porque cambia qué proveedor sale ganando.
Relacionado


