> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# METR pone precio al agente: por encima de 3.300 dólares de presupuesto sale más barato el humano
- URL: https://www.digitalbrain.news/noticias/metr-horizonte-gasto-agentes-ia-mas-caros-que-humanos/
- Published: 2026-07-28T13:05:41.000Z
- Updated: 2026-08-30T10:01:10.000Z
- Description: METR ha propuesto una métrica que le faltaba a todo el mundo que evalúa agentes: el horizonte de gasto. Es el presupuesto a partir del cual contratar a…
- Author: Ramón Pérez Coronado
- Tags: #noticias, metr, agentes-ia, evaluacion-modelos, roi-ia, coste

METR ha propuesto una métrica que le faltaba a todo el mundo que evalúa agentes: el **horizonte de gasto**. Es el presupuesto a partir del cual contratar a una persona sale más barato que seguir pagando [tokens](https://www.digitalbrain.news/guias/que-es-un-token-en-ia/) para el mismo resultado. En su primera medición, los mejores modelos se quedan en **3.300 dólares**. Por encima de esa cifra, gana el humano.

La pregunta deja de ser si el agente puede hacerlo. Pasa a ser cuánto cuesta que lo haga, incluyendo supervisión y reintentos.

## Puntos clave

- **Horizonte de gasto**: el umbral de presupuesto donde agente y humano dan el mismo resultado. Por debajo compensa el agente, por encima la persona.
- Banco de pruebas: el **speedrun de NanoGPT**, un proyecto abierto con **82 optimizaciones documentadas** que han acelerado el [entrenamiento](https://www.digitalbrain.news/glosario/#entrenamiento) **33 veces** desde mayo de 2024 (de 45 minutos a menos de 2).
- Referencia humana: unos **2.500 dólares por cada 1% de mejora**, calculado a 150 dólares la hora por unas 16 horas de trabajo.
- Los horizontes medidos van de **0 a 3.300 dólares**, con hasta 10.000 dólares de presupuesto disponible por modelo.

## Qué modelo consiguió qué

Los resultados son bastante crudos y merece la pena leerlos sin filtro.

[GPT-5](https://www.digitalbrain.news/glosario/#gpt), GPT-5.2 y Opus 4.1 no lograron ninguna mejora medible sobre un proyecto que llevaba dos años de optimización humana. GPT-5.5 consiguió un 1%. Opus 4.8, un 1,5%.

El mantenedor del speedrun describió la mayoría de las sugerencias como "ajuste de parámetros", aunque señaló una optimización concreta como "la más chula" de todas. O sea: hubo una idea buena de verdad, rodeada de mucho tanteo.

Conviene entender por qué esta prueba es dura. El speedrun de NanoGPT lleva acumulados unos 250.000 dólares de esfuerzo humano y 82 mejoras encadenadas. Es un terreno ya barrido por gente muy competente. Encontrar el 83º truco es infinitamente más difícil que encontrar el tercero.

## Por qué la métrica es más útil que el benchmark habitual

Los [benchmarks](https://www.digitalbrain.news/glosario/#benchmark) de agentes miden capacidad: ¿resuelve la tarea, sí o no? Y esa pregunta se ha quedado corta.

Un agente que resuelve la tarea el 90% de las veces pero necesita cuatro intentos, dos revisiones humanas y treinta minutos de alguien leyendo el transcript, no es barato. Es caro con la factura repartida en sitios que nadie suma.

El horizonte de gasto obliga a meter todo eso en la misma casilla. Es la hoja de cálculo a la que acaba llegando cualquier piloto de IA cuando pasa de la demo a producción. Y encaja con lo que [el experimento de enjambres de agentes de Cursor](https://www.digitalbrain.news/noticias/cursor-enjambre-agentes-planificador-trabajador-coste/) enseña desde el otro lado: la variable que mueve la aguja no es el modelo, es cómo repartes el trabajo entre modelos caros y baratos.

## Dónde falla la métrica

Hay que decirlo: 3.300 dólares es el techo en **una** tarea, la optimización de un entrenamiento de [red neuronal](https://www.digitalbrain.news/guias/que-es-una-red-neuronal/), que es de las cosas más difíciles que se pueden pedir. No es un número trasladable a "revisar 400 facturas" ni a "escribir 20 fichas de producto".

En tareas repetitivas y bien acotadas, el horizonte de gasto de un agente es muchísimo más alto, porque el humano cuesta lo mismo cada vez y el agente cuesta céntimos. Justo por eso la métrica es interesante: te dice dónde está la frontera, y la frontera se mueve según la tarea.

## Por qué importa

Si estás valorando meter agentes en algún proceso, esta es la pregunta que hay que hacerse antes de pedir presupuesto a nadie.

Coge un proceso concreto. Calcula qué cuesta hoy en horas de persona, con su coste real por hora, incluyendo seguridad social. Después estima qué costaría en tokens, y súmale el tiempo de quien va a revisar el resultado y el porcentaje de veces que habrá que repetirlo. Si el segundo número no es claramente menor que el primero, no automatices eso todavía.

Yo he tirado proyectos abajo por este cálculo. Automatizar algo que se hace tres veces al mes y tarda veinte minutos no sale a cuenta ni aunque funcione perfecto. Lo que sí sale a cuenta es lo que se repite cada día y donde el error tiene coste.

Los outputs son lo que se compra, no los proyectos de IA. Esta métrica es la primera que lo pone en euros.

Fuente original: [The Decoder](https://the-decoder.com/metr-introduces-a-new-metric-to-calculate-exactly-when-ai-agents-become-more-expensive-than-humans/?ref=digitalbrain.news)

---

**Relacionado**

[Cursor prueba enjambres de agentes: un modelo caro planifica, los baratos ejecutan y el coste baja de 10.565 a 1.339 dólares](https://www.digitalbrain.news/noticias/cursor-enjambre-agentes-planificador-trabajador-coste/)[![Las empresas top gastan 7.500$ al mes por empleado en IA y empiezan a apretar el cinturón](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/07/tokenmaxxing-tokenomics-7500-empleado-mes-ia.jpg)Las empresas top gastan 7.500$ al mes por empleado en IA y empiezan a apretar el cinturón](https://www.digitalbrain.news/noticias/tokenmaxxing-tokenomics-7500-empleado-mes-ia/)[![OpenAI retira su respaldo a SWE-Bench Pro: un tercio de las pruebas están rotas](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/07/openai-retira-respaldo-swe-bench-pro-benchmark-codigo-roto.png)OpenAI retira su respaldo a SWE-Bench Pro: un tercio de las pruebas están rotas](https://www.digitalbrain.news/noticias/openai-retira-respaldo-swe-bench-pro-benchmark-codigo-roto/)