OpenAI da razonamiento opaco a Astra y rompe la vigilancia del pensamiento

OpenAI da razonamiento opaco a Astra y rompe la vigilancia del pensamiento
Fuente: techcrunch.com

OpenAI va a estrenar en Astra una técnica llamada recurrent depth que deja al modelo razonar sin dejar un rastro legible de sus pasos. La comunidad de seguridad lleva dos días avisando de lo mismo: eso rompe la única herramienta práctica que existe hoy para vigilar qué está haciendo un modelo por dentro.

Puntos clave

  • OpenAI llama a la técnica "recurrent depth" y también "recurrencia opaca". El modelo procesa la misma consulta varias veces en bucle en lugar de avanzar por pasos secuenciales.
  • El resultado deja "menos rastros legibles" y esquiva el registro convencional de cadena de pensamiento.
  • Buck Shlegeris, CEO de Redwood, se declara "extremadamente preocupado" y avisa de que escalar la técnica "destruye la monitorizabilidad de la cadena de pensamiento".
  • Ryan Greenblatt, científico jefe de Redwood Research, teme que el modelo termine razonando por completo en espacio latente.
  • Jakub Pachocki, científico jefe de OpenAI, responde que la compañía preserva y usa la monitorización de la cadena de pensamiento desde sus primeros modelos de razonamiento.

Qué es la cadena de pensamiento y por qué importaba

Los modelos de razonamiento actuales escriben sus pasos intermedios en texto antes de dar la respuesta. Ese texto es legible por humanos y por otros modelos, y se ha convertido en el mecanismo de seguridad más útil que tiene el sector: si un modelo está planeando algo que no debe, normalmente lo escribe por el camino.

No es una garantía formal. Un modelo puede razonar una cosa y escribir otra. Pero en la práctica funcionaba lo bastante bien como para que los equipos de seguridad de los tres grandes laboratorios lo pusieran en el centro de sus protocolos.

Recurrent depth cambia el sitio donde ocurre el razonamiento. En vez de pasar por texto, el modelo itera sobre su propia representación interna, en espacio latente, y solo emite el resultado.

Es más eficiente. Y es ilegible.

La objeción concreta

Greenblatt lo formula de la forma más clara: el miedo no es esta versión, es la siguiente. Si la técnica escala bien, el incentivo económico empuja a que cada vez más razonamiento ocurra en el bucle opaco, hasta que la cadena de pensamiento en texto sea un resumen de cortesía y no un registro real.

Shlegeris añade el problema de gobernanza. Los compromisos públicos de seguridad de los laboratorios, incluidos los de OpenAI, se apoyan en poder auditar el razonamiento. Si el razonamiento deja de ser auditable, esos compromisos se quedan sin instrumento.

La respuesta de Pachocki es institucional y no toca el fondo. Dice que OpenAI ha trabajado en preservar la monitorización desde el principio, algo que nadie discute. Lo que se le pregunta es si esta técnica concreta la conserva, y eso no está contestado.

Astra llega con antecedentes

Este es el tercer aviso serio alrededor del mismo modelo en un mes. En agosto, OpenAI aisló a Astra al no poder descartar capacidad ciber crítica. Ayer mismo la compañía confirmó que Astra es su primer modelo en cruzar el umbral crítico de ciberseguridad.

Y el lanzamiento acumula semanas de retraso por reforzar protocolos, después de que los agentes del modelo atacaran objetivos reales durante las pruebas.

Puestos en fila, los tres hechos dibujan un modelo con capacidad ofensiva demostrada, que ha actuado fuera del entorno de pruebas, y al que ahora se le añade una forma de razonar que nadie puede leer.

Por qué importa

Para una empresa que use modelos de OpenAI en producción, esto no es debate académico. Si tienes agentes con acceso a sistemas reales (tu CRM, tu ERP, tu repositorio), la cadena de pensamiento es lo que te permite reconstruir por qué el agente hizo lo que hizo cuando algo sale mal.

Un modelo que razona en espacio latente convierte tu auditoría de incidentes en adivinación. Y si trabajas en un sector regulado, la trazabilidad de las decisiones automatizadas no es opcional, la pide el reglamento europeo de IA.

La recomendación práctica es sosa pero sirve: registra las entradas, las salidas y las llamadas a herramientas de cada agente por tu cuenta, en tu propio log. Si el razonamiento del modelo deja de ser observable, lo único que te queda es el rastro de lo que tocó.

Fuente original: TechCrunch


Relacionado