OpenAI ha publicado algo que parece una nota tecnica menor y es la lectura mas util de la semana para cualquiera que este montando agentes: dos ajustes de API triplicaron la nota de GPT-5.6 Sol en ARC-AGI-3, del 13,3% al 38,3%. Y de paso gasto 6 veces menos tokens de salida.
Puntos clave
- Con el harness oficial del benchmark, GPT-5.6 Sol saca 13,3% en el set publico.
- Con razonamiento conservado y compactacion activada, sube a 38,3%.
- Los tokens de salida caen 6 veces. Mejor resultado y mas barato a la vez.
- OpenAI recomienda la Responses API y desaconseja la antigua Chat Completions.
Que mide ARC-AGI-3
Conviene situar el benchmark antes de mirar los numeros. ARC-AGI es la familia de pruebas creada para medir razonamiento abstracto en vez de conocimiento memorizado: puzles visuales donde hay que deducir la regla a partir de dos o tres ejemplos y aplicarla a un caso nuevo.
La tercera version anade el formato interactivo. El modelo no resuelve un puzle estatico, juega: hace un movimiento, ve el resultado, ajusta y vuelve a mover. Eso lo convierte en la prueba mas parecida a lo que hace un agente en tu empresa, que tampoco resuelve nada de un tiron.
Y por eso este resultado tiene lectura practica y no solo deportiva.
Qué estaba pasando en realidad
ARC-AGI-3 evalua al modelo jugando, movimiento a movimiento. El harness oficial hacia dos cosas que sonaban razonables y eran letales.
Primera: despues de cada movimiento tiraba el razonamiento privado del modelo. Segunda: cuando el historial pasaba del tamano de la ventana, empezaba a borrar las acciones mas antiguas.
El resultado combinado es que el modelo conservaba lo que habia hecho pero perdia el porque. Sabia que habia movido el bloque morado a la izquierda. No sabia que lo habia hecho para comprobar una hipotesis que ya habia descartado. Asi que volvia a empezar. Una y otra vez.
No es que el modelo fuera peor de lo que decia la nota. Es que el harness le estaba borrando la memoria de trabajo entre jugadas.
Los dos ajustes
El primero es conservar el razonamiento entre ventanas de contexto separadas. En vez de descartar las trazas internas al cerrar cada turno, se mantienen disponibles para el siguiente.
El segundo es la compactacion canonica: en lugar de recortar por la cola cuando se llena el contexto, el sistema resume de forma estructurada lo que ya paso y conserva el hilo.
La suma de las dos explica tambien la caida de 6 veces en tokens de salida. Un modelo que no tiene que reconstruir su razonamiento en cada turno escribe muchisimo menos.
La parte que casi nadie va a leer
El detalle operativo esta en la recomendacion final: usa la Responses API, no la Chat Completions de toda la vida.
Mucha gente monto sus agentes sobre Chat Completions porque era lo que habia cuando empezo, y ahi se quedo. Esa decision de hace ano y medio hoy puede estar costandote dos tercios del rendimiento del modelo que estas pagando.
Lo que dice esto de los benchmarks
Aqui hay una leccion incomoda para todo el sector. Si un cambio de configuracion multiplica por tres la nota de un modelo en un benchmark publico, el numero que publica el benchmark mide tanto la implementacion como la capacidad.
Cuando compares dos modelos por su puntuacion en algo, la pregunta correcta ya no es solo que modelo es. Es con que harness lo midieron.
Por qué importa
Esto es lo mas accionable que vas a leer hoy, y no cuesta dinero probarlo.
Si tienes agentes en produccion que hacen tareas largas de muchos pasos (procesar facturas, revisar contratos, cerrar tickets), es muy probable que tu implementacion este tirando el razonamiento entre pasos igual que hacia el harness oficial. Sintoma tipico: el agente repite trabajo, se contradice a mitad de proceso o pierde el hilo en tareas de mas de diez pasos.
Coge tu peor flujo, activa razonamiento conservado y compactacion, y mide. Si el patron de OpenAI se repite aunque sea a medias, subes calidad y bajas la factura de tokens en la misma tarde. Es de las pocas mejoras que no exigen cambiar de modelo ni reescribir prompts.
Relacionado

