OpenAI y Anthropic empujan el coste por tarea como métrica: 1,04 dólares GPT-5.6 Sol, 2,75 Fable 5

OpenAI y Anthropic empujan el coste por tarea como métrica: 1,04 dólares GPT-5.6 Sol, 2,75 Fable 5
Fuente: doit.com

OpenAI y Anthropic están empujando a sus clientes a dejar de comparar precios por millón de tokens y medir el coste por tarea completada. Con esa vara, el Intelligence Index de Artificial Analysis pone GPT-5.6 Sol en 1,04 dólares por tarea y Claude Fable 5 en 2,75, y varias comparaciones se dan la vuelta.

Puntos clave

  • Coste por tarea a máximo esfuerzo de razonamiento, agosto de 2026: GPT-5.6 Sol 1,04 dólares, Opus 4.8 1,80, Opus 5 2,03, Fable 5 2,75.
  • La fórmula es simple: coste por intento dividido por tasa de acierto.
  • En SWE-bench Verified, GPT-5.6 Sol acierta el 96,2% y Opus 4.8 el 88,6%, lo que da 1,56 dólares por incidencia resuelta frente a 3,06.
  • Opus 4.8 y Opus 5 consumen unos 1,88 tokens por palabra inglesa frente a los 1,17 de la codificación de GPT-5. Un 30% de inflación en cualquier comparación por token.

Por qué el precio por token engaña

El coste por millón de tokens describe lo que pagas por intentarlo, no por conseguirlo. La fórmula que propone la industria es coste por intento partido por tasa de acierto, y ahí un modelo que cuesta el doble pero falla la mitad de las veces sale más barato.

El ejemplo de código lo enseña bien. Con GPT-5.6 Sol a 5 dólares por millón de entrada y 30 de salida, y Opus 4.8 a 5 y 25, el precio de lista dice que Anthropic es más barato en salida. Metiendo la tasa de acierto de SWE-bench Verified, 96,2% contra 88,6%, la incidencia resuelta sale a unos 1,56 dólares con OpenAI y 3,06 con Anthropic. El doble.

Y la comparación se da la vuelta en cuanto cambias la tarea. En tau-bench de aerolíneas, Opus 4.8 acierta 0,64 con 4 violaciones de política por cada 100 tareas y GPT-5.5 acierta 0,58 con 9 violaciones. Contando 25 dólares de limpieza por violación, Opus sale a 1,47 dólares por tarea correcta y GPT-5.5 a 2,63.

Ese segundo caso es el que suele faltar en las hojas de cálculo. El coste de arreglar lo que el modelo hizo mal no aparece en ninguna factura de API.

El tokenizador mete su propio sesgo

Los modelos de Anthropic gastan unos 1,88 tokens por palabra inglesa. La codificación de GPT-5 gasta unos 1,17. Es un 30% de inflación que se cuela en cualquier comparación de precio por token sin que nadie lo declare.

A eso se suma el trato de los tokens de razonamiento. Los dos proveedores los cobran a tarifa de salida, pero Anthropic los devuelve visibles y OpenAI los oculta. Pagas por pensamiento que no ves.

Y el volumen no ayuda. Según Gartner, en marzo de 2026, un flujo agéntico consume entre 5 y 30 veces más tokens por tarea que una consulta de chatbot. Cuando el multiplicador es de ese tamaño, un error del 30% en el cálculo base deja de ser un detalle.

Lo que esto le hace al ranking

Con coste por tarea, la carrera de precios se lee distinta. Grok 4.5 se vendió a unos 0,13 dólares por tarea frente a 1,57 de Fable 5, y Grok 4.6 salió a 2 dólares por millón empatando en el índice compuesto de Artificial Analysis. Por tarea, esa diferencia se agranda o se encoge según lo bien que acierte cada uno en tu trabajo concreto.

El mismo razonamiento se aplica a los modelos abiertos. GLM-5.3 saca 31,4% en su prueba de código gastando 50.000 tokens donde Opus 4.8 saca 29,5% con 120.000. Por token es una comparación; por tarea es otra.

Por qué importa

Si estás decidiendo proveedor mirando la tabla de precios por millón de tokens, estás usando la métrica equivocada, y encima es la que los propios proveedores están dejando de defender.

Lo que hay que medir en tu casa son tres números por cada proceso que tengas en producción. Cuántos intentos hacen falta de media para una tarea buena. Cuánto cuesta cada intento con tu volumen real de contexto. Y cuánto cuesta arreglar un fallo que se cuela, contando el tiempo de la persona que lo arregla. Ese tercer número es el que nadie apunta y el que suele decidir cuál sale más barato.


Relacionado