OpenAI dice que sus agentes ya trabajan 3,1 jornadas por cada jornada humana

OpenAI dice que sus agentes ya trabajan 3,1 jornadas por cada jornada humana
Fuente: openai.com

OpenAI ha publicado datos internos sobre cuanto usan sus propios investigadores los agentes de codigo, y la cifra que se lleva el titular es 3,1. Son las jornadas de trabajo de agente que registraba por cada jornada humana a mediados de agosto de 2026, segun el post "Research acceleration: The view inside OpenAI". La empresa acompaña el dato con una advertencia sobre como leerlo.

Puntos clave

  • 3,1 jornadas de agente por cada jornada humana en la organizacion de investigacion, medido a mediados de agosto de 2026.
  • Los experimentos por investigador activo subieron a lo largo de 2026 y en agosto marcaron el maximo de la serie, que empezo en enero de 2025.
  • Los investigadores corren varias sesiones de agente en paralelo durante todo el dia.
  • Los agentes abordan tareas cada vez mas complejas y las completan con exito mas a menudo.
  • OpenAI matiza que mas ejecuciones lanzadas no significa mas ciencia util.

Que mide exactamente una jornada de agente

La metrica necesita traduccion, porque "3,1 jornadas de agente por jornada humana" suena a que la empresa ha triplicado su plantilla y no es eso.

Lo que cuenta es tiempo de trabajo autonomo acumulado. Un investigador lanza cuatro o cinco sesiones de agente en paralelo mientras revisa resultados de la anterior. Cada sesion suma su propio tiempo. Al final del dia, la suma de lo que hicieron los agentes triplica lo que hizo la persona.

Ese numero mide capacidad de ejecucion en paralelo. No mide descubrimientos.

El cambio de rol que describen los investigadores

La parte mas interesante del post no son las graficas, es como cuentan los propios investigadores que ha cambiado su trabajo.

Describen un desplazamiento desde implementar hacia verificar y orquestar. El investigador deja de escribir la mayor parte del codigo del experimento y pasa a decidir que experimentos vale la pena correr, revisar lo que salio y encadenar el siguiente paso.

Es el mismo patron que llevamos meses viendo fuera de OpenAI. En agosto contamos que Asana liquido en dos semanas y 12.000 dolares una migracion que estimaba en meses usando Codex, y que OpenAI sincronizo el trabajo de los agentes entre ChatGPT Work y Codex precisamente para que ese encadenado no se pierda entre herramientas.

La advertencia que pone la propia OpenAI

Aqui es donde el post gana credibilidad, y merece la pena citarlo entero porque casi ningun anuncio corporativo se pone estos frenos.

OpenAI dice que la investigacion en IA tiene muchos cuellos de botella posibles, y que el ritmo global de progreso probablemente no seguira el ritmo de estas metricas concretas. Y añade el punto afilado: mas experimentos ejecutados no es lo mismo que mas experimentos utiles. Los agentes hacen barato lanzar una ejecucion, y eso infla el recuento bruto sin mover la ciencia.

Traducido: la grafica de experimentos por investigador puede subir porque la gente prueba mas cosas mediocres, y el numero se ve igual de bonito.

Que se puede sacar de aqui y que no

Lo que si se puede sostener: en una empresa donde el trabajo es codigo, con equipo tecnico bueno y herramientas propias, los agentes ya aportan una parte enorme del volumen de ejecucion, y llevan un año creciendo sin meseta.

Lo que no se puede sostener: que eso se traduzca linealmente en resultados. OpenAI mide jornadas y ejecuciones porque son faciles de contar. Nadie ha publicado todavia una metrica limpia de descubrimientos por agente.

Tambien hay que leerlo por quien lo firma. OpenAI vende Codex. Publicar que sus investigadores viven dentro de agentes es a la vez un dato y un anuncio.

Por qué importa

Si diriges un equipo tecnico, el numero util no es 3,1. Es la pregunta de si tu cuello de botella era escribir codigo o decidir que escribir.

Cuando el cuello era escribir, un agente lo abre de par en par. Cuando el cuello era priorizar, revisar o validar, multiplicar la ejecucion te llena la cola de trabajo pendiente de revision y el sistema se atasca un paso mas abajo.

La medida practica es contar dos cosas por separado durante un mes: cuanto trabajo lanzas y cuanto trabajo llega a produccion. Si la primera se dispara y la segunda no se mueve, has comprado velocidad en el tramo que no la necesitaba. Es el aviso que la propia OpenAI se pone a si misma.

Fuente original: OpenAI


Relacionado