OpenAI dice que ningun laboratorio ha resuelto el alineamiento y pide frenar

OpenAI dice que ningun laboratorio ha resuelto el alineamiento y pide frenar
Ilustración: Digital Brain

El cientifico jefe de OpenAI ha escrito que ningun laboratorio de IA tiene resuelto el alineamiento lo bastante bien como para seguir escalando a maxima velocidad. Jakub Pachocki lo publico el 6 de septiembre en un ensayo titulado "An Alien Mind", alojado en la web de OpenAI. En el mismo texto dice que espera ralentizaciones voluntarias y pide coordinacion internacional entre gobiernos.

Puntos clave

  • Pachocki escribe que "no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling".
  • Dice que espera y desea que las ralentizaciones voluntarias se vuelvan habituales hasta que existan minimos de seguridad compartidos entre laboratorios.
  • Pide que la coordinacion internacional sobre desarrollo de IA se convierta en prioridad de los gobiernos.
  • Propone convertir compromisos internos como el Preparedness Framework de OpenAI en barras obligatorias, auditadas por terceros e instituciones internacionales.
  • Espera que el ritmo actual de progreso se mantenga hasta llegar a la autosuperacion recursiva, con sistemas que empujan su propio desarrollo.

Quien firma esto y por que cuenta

Pachocki es el cientifico jefe de OpenAI desde 2024. No es un investigador de seguridad escribiendo desde fuera ni un critico externo: es la persona que decide la direccion tecnica de la empresa que mas presiona el acelerador.

Ese detalle cambia el peso del texto. Cuando un laboratorio de la frontera publica en su propia web que la monitorizacion no da la talla, esta escribiendo contra su propio incentivo comercial.

El ensayo arranca en un sitio concreto: mediados de 2023, un proyecto interno que llamaron RLSlow, donde identificaron que los modelos de razonamiento escalaban. Tres años despues esos modelos operan en la economia real y, segun Pachocki, empiezan a impulsar su propio desarrollo.

Los dos alineamientos que separa

La parte tecnica util del ensayo es una distincion que se suele mezclar.

El alineamiento de objetivos pregunta si el modelo intenta cumplir la tarea que le has puesto. Es lo que casi todo el mundo mide hoy: le pides algo y compruebas si lo hace.

El alineamiento de valores es otra cosa. Pachocki lo describe como la capacidad de sostener un conjunto de principios y generalizar desde ahi, actuando de forma razonable cuando los objetivos son confusos, entran en conflicto o alguien esta intentando manipular al sistema.

Un modelo puede ir perfecto en lo primero y fallar en lo segundo. Cumple lo que le pides, y cuando el encargo se vuelve ambiguo o adversario, tira por donde nadie habia previsto.

Qué es la autosuperacion recursiva y por que la nombra

La autosuperacion recursiva (RSI, por sus siglas en ingles) es la idea de que un sistema de IA mejore el diseño de la siguiente version de si mismo, y esa siguiente version mejore la siguiente, sin que el ritmo lo marque un humano.

Pachocki dice que espera que el ritmo actual llegue hasta ahi, y que OpenAI lo prioriza porque lo considera la unica via para seguir en la frontera de la investigacion. Tambien dice que espera saltos de capacidad de magnitud igual o mayor en los proximos años.

Esa combinacion es la que explica el titulo del ensayo. La tesis es que la IA se esta volviendo una forma de inteligencia cada vez mas ajena, que no entendemos del todo, que pronto costara monitorizar y que ademas conducira su propio desarrollo.

Que pide en concreto

Poca cosa vinculante, y conviene decirlo claro. El ensayo no anuncia que OpenAI vaya a frenar nada.

Lo que propone es un cambio de estatus para los compromisos que hoy son voluntarios. El Preparedness Framework de OpenAI es un documento interno donde la empresa fija que capacidades peligrosas vigila y que hace si aparecen. Pachocki plantea que ese tipo de compromiso deje de ser una promesa de cada casa y pase a ser una barra medible, auditada por terceros y por instituciones internacionales.

Es exactamente la clase de cosa que un laboratorio no puede montar solo. De ahi la peticion a los gobiernos.

Donde encaja esto

En agosto contamos que OpenAI destino 5 millones a los organos que fiscalizan la IA de los gobiernos. Este ensayo va en la misma direccion y sube el tono: alli era financiar supervision, aqui es decir por escrito que el estado actual no basta.

Por qué importa

Si tienes IA metida en procesos de tu empresa, la lectura practica esta en la distincion de los dos alineamientos.

El modelo que usas hoy va bien mientras las instrucciones son claras y el contexto se parece a lo que viste al probarlo. El riesgo real aparece cuando el caso es raro, las reglas se contradicen o alguien mete un dato preparado para confundirlo. Ahi ya no estas midiendo si cumple la tarea, estas midiendo si sostiene un criterio.

Traducido a algo accionable: tus pruebas de aceptacion no pueden ser solo casos limpios. Necesitas los sucios, los ambiguos y los malintencionados, y necesitas saber que hace el sistema cuando no tiene una respuesta buena. El cientifico jefe de OpenAI acaba de decir que su industria todavia no sabe responder a eso con la profundidad que haria falta.

Fuente original: OpenAI


Relacionado