OpenAI ha lanzado GPT-6 Astra y el número que lo resume está en el informe de ARC Prize: 99,9% en ARC-AGI-3 usando el adaptador del proveedor. Es el primer modelo que satura ese banco de pruebas, y lo hace gastando menos movimientos que un humano en 96 de cada 100 niveles.
Puntos clave
- Astra salió el 3 de septiembre. El despliegue va por tandas: primero clientes de Daybreak, después Pro, Plus, Enterprise y Business durante la semana, más la API.
- ARC-AGI-3 con arnés estándar: 62,7% de acierto, 26.098 dólares de coste total.
- ARC-AGI-3 con adaptador del proveedor: 99,9%, 18.817 dólares. Más barato y mucho mejor.
- Eficiencia: menos acciones que la referencia humana en el 96,0% de los niveles, un 51,7% menos por nivel de media. El humano de referencia costaba unos 12,78 dólares por partida.
- OpenAI dice que es su mejor modelo para ingeniería de software, por delante de su propio GPT-5.6 Sol y de Fable de Anthropic en detección de bugs, tareas de terminal y consultas sobre bases de código.
Qué mide ARC-AGI-3 y por qué 99,9% no es AGI
ARC-AGI-3 no es un examen de conocimiento. Son juegos interactivos con reglas que el modelo no conoce de antemano: tiene que jugar, deducir la mecánica y resolver el nivel. Mide aprendizaje sobre la marcha, no memoria.
Que un modelo lo sature es un salto real. ARC Prize lo llama "un cambio de función escalón en las capacidades de los modelos frontera", que en su vocabulario, bastante tacaño con los elogios, es mucho.
Pero el propio ARC Prize pone el freno en el mismo texto: saturar ARC-AGI-3 no prueba AGI porque las mecánicas son deterministas y cerradas. El mundo real no lo es. La distancia entre resolver un puzzle con reglas fijas y operar en un entorno donde las reglas cambian sigue ahí.
La diferencia entre el 62,7% y el 99,9% también merece una lectura fría. El segundo número sale con un adaptador que le da al modelo acceso a través de la infraestructura de OpenAI. Son dos maneras distintas de conectar el mismo modelo al juego, y dan resultados a 37 puntos de distancia. Cuando alguien te enseñe un benchmark, pregunta por el arnés.
Lo que OpenAI no cuenta en la nota de prensa
Astra llega con la técnica que la comunidad de seguridad lleva días criticando. Se llama recurrent depth, o recurrencia opaca, y consiste en que el modelo procese la consulta en bucle en vez de escribir sus pasos intermedios en texto legible.
Eso rompe la monitorización de la cadena de pensamiento, que hoy es la herramienta práctica más útil para auditar qué está haciendo un modelo por dentro. Lo contamos cuando saltó el aviso, con Buck Shlegeris de Redwood declarándose "extremadamente preocupado".
Jakub Pachocki, científico jefe de OpenAI, ha reconocido el problema en voz alta: "a medida que las capacidades de los modelos aumentan, la monitorizabilidad se vuelve más difícil". No es una negación. Es una constatación.
Y a esto se suma que Astra ya venía clasificado como capacidad Crítica en ciberseguridad dentro del Preparedness Framework de la propia OpenAI, el primer modelo de la casa en llegar a ese nivel. Un modelo que encuentra zero-days solo, y que además razona sin dejar rastro auditable.
La AGI pasa a ser un "concepto espiritual"
La frase de la semana la ha soltado Greg Brockman: la cláusula contractual de AGI que OpenAI tenía con Microsoft ya no aplica, y la AGI es ahora "un concepto espiritual".
Conviene traducirlo. Esa cláusula era un mecanismo legal: cuando el consejo de OpenAI declarase AGI alcanzada, cambiaban los términos de la relación con Microsoft. Quitarla del medio a la vez que se lanza el modelo que satura ARC-AGI-3 no parece casualidad.
Por qué importa
Si tienes procesos montados sobre GPT-5.6 Sol, aquí hay dos cosas que medir esta semana y ninguna es el titular.
La primera: Astra es mejor en ingeniería de software según OpenAI, pero el precio por tarea no está publicado y el modelo consume más cómputo interno por el bucle de recurrencia. Mide coste por tarea terminada en tu flujo, no precio por millón de tokens.
La segunda: si tu sector tiene requisitos de auditoría, la recurrencia opaca es un problema de cumplimiento, no una nota al pie técnica. Un modelo del que no puedes reconstruir el razonamiento es difícil de defender ante un auditor. Antes de meterlo en un proceso regulado, pregunta a tu responsable de riesgos.
Fuente original: arcprize.org
Relacionado


