Prime Intellect ha liberado Prime Agent, un harness de programación de código abierto que se modifica a sí mismo mientras trabaja. Con Opus 5 por debajo alcanza un 95,5% RHAE en ARC-AGI 3, por encima del 95,4% que marca la referencia humana, según su anuncio.
No es un modelo. Es la capa que va entre tú y el modelo, y ahí está lo interesante.
Puntos clave
- Prime Agent es "un harness de programación que se automejora", diseñado para funcionar con los modelos actuales sin sustituirlos.
- En ARC-AGI 3 con Opus 5 obtiene un 95,5% RHAE, superando el 95,4% de la referencia humana.
- En OOLONG, un benchmark de contexto largo, saca 0,700 usando GLM-5.2 frente al 0,420 del competidor.
- El componente Continual Harness permite al agente crear, leer, actualizar y borrar sus propios prompts, skills, memoria y subagentes durante la ejecución, sin reiniciar.
- Es totalmente de código abierto y se instala con un comando curl.
Qué es un RLM y por qué cambia el problema del contexto
RLM son las siglas de Recursive Language Model, modelo de lenguaje recursivo. La idea es tratar el contexto como una variable de programa en lugar de como una tira de texto que se va llenando hasta reventar.
En un agente normal, todo lo que ocurre (tu petición, la salida de cada comando, cada archivo leído) se va acumulando en la ventana de contexto. Cuando se llena, hay que comprimir o cortar, y ahí se pierde información. Es la razón por la que las sesiones largas de cualquier agente de programación se vuelven tontas al cabo de un rato.
Prime Agent lo monta distinto: un kernel de IPython persistente como herramienta principal, con las subtareas delegadas como llamadas a función dentro de ese REPL. El agente tiene "acceso programático a su historial, subagentes y herramientas". No lo recuerda todo en el contexto, lo consulta cuando lo necesita, igual que tú no memorizas un archivo, lo abres.
La parte de automejora
Continual Harness es la otra pieza. Permite al agente reescribir sus propios componentes mientras corre: sus prompts, sus skills, su memoria, la definición de sus subagentes.
Dicho así suena a ciencia ficción y es más pedestre. Es lo mismo que hace un desarrollador cuando, a mitad de una tarea repetitiva, para y se escribe un script para no repetirla veinte veces más. La diferencia es que aquí lo hace el agente, sin reiniciar la sesión.
Los resultados que enseñan van en esa línea: en Factorio, un juego de automatización industrial que se usa como banco de pruebas de planificación a largo plazo, supera los 100.000 puntos de producción. Y en PMPP-Hard, sobre kernels de GPU, el rendimiento mejora con la iteración en lugar de estancarse.
Cuidado con el 95,5%
Sobre el titular de ARC-AGI 3 hay que poner una advertencia. RHAE es la métrica del propio benchmark, no una tasa de acierto bruta, y el resultado depende del modelo que pongas debajo: aquí, Opus 5. Es decir, no es que Prime Agent sea más listo que un humano. Es que un harness bien construido sobre el mejor modelo disponible llega a la marca humana en ese test concreto.
Ese matiz es justo la lección. La mayoría de la gente sigue midiendo modelos cuando el rendimiento real de un agente lo decide tanto el andamiaje como el modelo. Prime Intellect, que ya levantó 130 millones en Serie A para entrenamiento distribuido, ha decidido enseñar exactamente cuánto vale ese andamiaje.
Por qué importa
Si tu equipo usa Claude Code, Codex o Cursor y os frustra que las sesiones largas se degraden, aquí hay una idea que puedes robar sin instalar nada.
La idea es esta: deja de meterlo todo en el contexto y dale al agente una forma de consultar bajo demanda. Un archivo de notas que escriba él mismo, un índice del proyecto, un log de decisiones que pueda releer. Eso ya lo puedes montar hoy con un CLAUDE.md bien mantenido y unas cuantas skills.
Y siendo abierto y con instalación de un comando, probarlo cuesta una tarde. Si tenéis a alguien técnico en el equipo, es un experimento barato con un techo alto.
Relacionado


