METR pone precio al agente: por encima de 3.300 dólares de presupuesto sale más barato el humano

METR pone precio al agente: por encima de 3.300 dólares de presupuesto sale más barato el humano
Fuente: the-decoder.com

METR ha propuesto una métrica que le faltaba a todo el mundo que evalúa agentes: el horizonte de gasto. Es el presupuesto a partir del cual contratar a una persona sale más barato que seguir pagando tokens para el mismo resultado. En su primera medición, los mejores modelos se quedan en 3.300 dólares. Por encima de esa cifra, gana el humano.

La pregunta deja de ser si el agente puede hacerlo. Pasa a ser cuánto cuesta que lo haga, incluyendo supervisión y reintentos.

Puntos clave

  • Horizonte de gasto: el umbral de presupuesto donde agente y humano dan el mismo resultado. Por debajo compensa el agente, por encima la persona.
  • Banco de pruebas: el speedrun de NanoGPT, un proyecto abierto con 82 optimizaciones documentadas que han acelerado el entrenamiento 33 veces desde mayo de 2024 (de 45 minutos a menos de 2).
  • Referencia humana: unos 2.500 dólares por cada 1% de mejora, calculado a 150 dólares la hora por unas 16 horas de trabajo.
  • Los horizontes medidos van de 0 a 3.300 dólares, con hasta 10.000 dólares de presupuesto disponible por modelo.

Qué modelo consiguió qué

Los resultados son bastante crudos y merece la pena leerlos sin filtro.

GPT-5, GPT-5.2 y Opus 4.1 no lograron ninguna mejora medible sobre un proyecto que llevaba dos años de optimización humana. GPT-5.5 consiguió un 1%. Opus 4.8, un 1,5%.

El mantenedor del speedrun describió la mayoría de las sugerencias como "ajuste de parámetros", aunque señaló una optimización concreta como "la más chula" de todas. O sea: hubo una idea buena de verdad, rodeada de mucho tanteo.

Conviene entender por qué esta prueba es dura. El speedrun de NanoGPT lleva acumulados unos 250.000 dólares de esfuerzo humano y 82 mejoras encadenadas. Es un terreno ya barrido por gente muy competente. Encontrar el 83º truco es infinitamente más difícil que encontrar el tercero.

Por qué la métrica es más útil que el benchmark habitual

Los benchmarks de agentes miden capacidad: ¿resuelve la tarea, sí o no? Y esa pregunta se ha quedado corta.

Un agente que resuelve la tarea el 90% de las veces pero necesita cuatro intentos, dos revisiones humanas y treinta minutos de alguien leyendo el transcript, no es barato. Es caro con la factura repartida en sitios que nadie suma.

El horizonte de gasto obliga a meter todo eso en la misma casilla. Es la hoja de cálculo a la que acaba llegando cualquier piloto de IA cuando pasa de la demo a producción. Y encaja con lo que el experimento de enjambres de agentes de Cursor enseña desde el otro lado: la variable que mueve la aguja no es el modelo, es cómo repartes el trabajo entre modelos caros y baratos.

Dónde falla la métrica

Hay que decirlo: 3.300 dólares es el techo en una tarea, la optimización de un entrenamiento de red neuronal, que es de las cosas más difíciles que se pueden pedir. No es un número trasladable a "revisar 400 facturas" ni a "escribir 20 fichas de producto".

En tareas repetitivas y bien acotadas, el horizonte de gasto de un agente es muchísimo más alto, porque el humano cuesta lo mismo cada vez y el agente cuesta céntimos. Justo por eso la métrica es interesante: te dice dónde está la frontera, y la frontera se mueve según la tarea.

Por qué importa

Si estás valorando meter agentes en algún proceso, esta es la pregunta que hay que hacerse antes de pedir presupuesto a nadie.

Coge un proceso concreto. Calcula qué cuesta hoy en horas de persona, con su coste real por hora, incluyendo seguridad social. Después estima qué costaría en tokens, y súmale el tiempo de quien va a revisar el resultado y el porcentaje de veces que habrá que repetirlo. Si el segundo número no es claramente menor que el primero, no automatices eso todavía.

Yo he tirado proyectos abajo por este cálculo. Automatizar algo que se hace tres veces al mes y tarda veinte minutos no sale a cuenta ni aunque funcione perfecto. Lo que sí sale a cuenta es lo que se repite cada día y donde el error tiene coste.

Los outputs son lo que se compra, no los proyectos de IA. Esta métrica es la primera que lo pone en euros.


Relacionado