El Remote Labor Index acaba de poner número a algo que se intuía: la IA ha dado un salto grande en trabajo freelance real. En su última ronda, Claude Fable 5 automatizo el 16,1% de las tareas, la cifra más alta que ha registrado el benchmark, y la marca de los modelos punteros se ha multiplicado por 6 en un año. El detalle que lo aterriza: aún así, solo 1 de cada 6 encargos llegó a calidad profesional.
El índice lo publican el Center for AI Safety y Scale Labs. La idea es sencilla y honesta: coger encargos freelance de verdad, dejar que un agente de IA los resuelva y que evaluadores humanos comparen el resultado contra el trabajo de un profesional. La tasa de automatización es el porcentaje de encargos en los que la IA lo hace igual de bien o mejor que la persona. La primera versión del índice salió en octubre de 2025, y entonces el mejor, el GPT-5.2, apenas llegaba al 2,5%.
Los números
- Fable 5: 16,1% (218 de 240 proyectos evaluados antes de las restricciones de exportación).
- Opus 4.8: 8,3%. GPT-5.5: 6,3%.
- Hace un año el GPT-5.2 inicial estaba en 2,5% y el mejor era Opus 4.6 con 4,17%.
- 240 proyectos reales, con presupuesto de 50 dólares por tarea (150 para Fable) y hasta 24 horas de cómputo.
Qué tipo de trabajo mide
No son preguntas de examen. Son encargos que un autónomo cobraría: diseño 3D y CAD, arquitectura, diseño gráfico, vídeo y animación, audio, análisis de datos y desarrollo de apps web. Sobre 240 proyectos, un humano de la profesión puntúa cada entrega frente a un trabajo de referencia hecho por un profesional real. Que Fable 5 iguale o supere a esa referencia en el 16% de los casos es mucho más de lo que hacía cualquier modelo hace doce meses, y a la vez deja claro que en el 84% restante todavía hace falta la persona.
El presupuesto por tarea también cuenta una historia. Al resto de modelos les dieron 50 dólares de margen por proyecto; a Fable 5 le dejaron gastar hasta 150. O sea, parte de su ventaja viene de que le permitieron trabajar más, no solo de que sea más listo. Es un matiz que en un titular se pierde y en una decisión de compra no debería perderse.
Y hay un dato que conviene no saltarse, porque es una lección en sí mismo. Cuando dejaron que otro modelo hiciera de juez en lugar de un humano, el juez automático inflaba los resultados: sobreestimaba cerca de 2,9 veces para GPT-5.5 y 2,3 para Opus 4.8. Traducido: si mides la calidad de tu IA con otra IA, te vas a creer bastante mejor de lo que estás.
Por qué importa
Este índice dibuja el escenario realista, no el de titular. La IA está multiplicando lo que un freelance puede sacar, con un humano decidiendo y dando el último toque, y ese es el modelo que va a durar. Es la misma foto que veo en mis empresas: la IA hace el 80% del trabajo pesado y el juicio sigue siendo mío. Para un director de operaciones la lectura práctica es doble. Una, la curva sube rápido (por 6 en un año), así que lo que hoy se le atraganta a un modelo, en unos meses puede resolverlo. Y dos, si vas a medir cuánto te ahorra la IA, mide con criterio humano, no dejes que otra IA te haga el informe y te pinte todo de verde, porque ya has visto cuánto se infla. Tiene sentido leerlo junto a los datos de uso real de Claude que publica Anthropic.
Relacionado


