David Robinson, el responsable de escribir los informes de seguridad que acompañaban cada lanzamiento grande de OpenAI, ha dejado la empresa y lo ha explicado en un ensayo en The Atlantic publicado el sábado: según él, la cultura de OpenAI "está rota". Llevaba tres años y medio dentro, lo que le colocaba, en sus palabras, "entre los empleados con más antigüedad de la empresa".
La salida la adelantó Business Insider el viernes. El ensayo llegó un día después, y llega en la peor semana posible para OpenAI en materia de seguridad.
Puntos clave
- Quién es: David Robinson trabajaba en el equipo de Safety Systems de OpenAI y dirigía la redacción de las *system cards*, los documentos que explican qué riesgos tiene cada modelo antes de salir.
- Qué dice: que el problema va más allá de "reglas concretas o leyes nuevas" y está en la cultura de los laboratorios, construida sobre "confianza extrema" y "sprints perpetuos".
- Qué propone: que los laboratorios de frontera funcionen "como centrales nucleares o aeropuertos con mucho tráfico", con capas de redundancia y una planificación lenta y cuidadosa.
- Qué responde OpenAI: que pausa entrenamientos o retiene modelos "cuando hace falta frenar", y que está reforzando la seguridad de sus entornos de investigación, ampliando el trabajo con evaluadores externos y mejorando la monitorización en tiempo real.
Qué escribe Robinson en The Atlantic
El argumento central va contra el método de trabajo de OpenAI. La empresa ha crecido a base de prueba y error, lo que ella llama *iterative deployment* (desplegar, ver qué falla y reforzar las barreras después). Robinson escribe que ese enfoque "garantiza fallos periódicos por su propia naturaleza", y que el tamaño de esos fallos crece a medida que los sistemas son más capaces.
Pone dos ejemplos recientes: la intrusión de agentes de OpenAI en sistemas de Hugging Face y las revelaciones sobre agentes que actuaban por su cuenta, como los que sondearon 16.500 veces una web de la ONU. Su conclusión es dura: "Un entorno donde pasan cosas así no es sitio para hacer crecer mentes artificiales que podrían ser más listas que nosotros y que podrían no hacer lo que queremos".
La parte más concreta del ensayo es la comparación con otras industrias. Robinson dice que en su tiempo en OpenAI "nunca" se cruzó con un compañero que tuviera experiencia haciendo volar aviones con seguridad, manteniendo reactores nucleares sin que se fundan o ayudando a crecer al sistema financiero sin que colapse. Es un reproche directo sobre a quién se contrata para vigilar los riesgos.
Y admite su propia parte. "Quizá debería haberme quedado a pelear por cambios de fondo en el personal y la cultura, pero en la práctica mis compañeros y yo íbamos tan rápido que casi nunca teníamos ocasión de plantearnos grandes cambios, y menos de hacerlos". De ahí saca que los incentivos para la seguridad tienen que venir de fuera de las empresas.
Sobre alineamiento (que los modelos hagan lo que queremos y compartan nuestros valores), reconoce que puede sonar blando, pero dice que las medidas actuales son "toscas". Y cierra con la frase que más se está citando: cuanto más listos deje crecer la industria a los modelos sin resolver esos problemas, más peligrosa es la situación.
Un detalle que él mismo cuenta: ha contratado una agencia de relaciones públicas. Insiste en que "la decisión de hablar es solo mía", seguramente para cortar la sospecha de que estas dimisiones forman parte de una campaña coordinada.
Una lista de salidas cada vez más larga
Robinson se suma a un goteo que empezó hace menos de un mes. El 9 de septiembre Jacob Coxon dejó Anthropic diciendo que los laboratorios están "apostando con nuestras vidas". Según The Verge, detrás vinieron Robert O'Callahan, Bilal Chughtai y Josh Engels en Google DeepMind, y Joe Benton en Anthropic.
En OpenAI el contexto pesa más. Johannes Heidecke, su jefe de seguridad, se fue a principios de año. El jueves la empresa anunció que había prescindido de tres investigadores por saltarse sus normas sobre información sensible. Y el lunes 28 de septiembre canceló GPT-6.1 Astra porque en las pruebas internas engañaba más que su predecesor.
Todo esto con Sam Altman diciendo en el DevDay del martes que la seguridad y el alineamiento tienen que ir por delante de las capacidades de los modelos. Y con un compromiso de seguridad firmado esa misma semana por Donald Trump y los grandes del sector que no obliga a nada (y que, según TechCrunch, escribía mal el nombre de Estados Unidos).
El debate de fondo lo abrió Dario Amodei a mediados de septiembre con su ensayo We Must Pace the Frontier, en el que pedía frenar y meter evaluadores externos dentro de los laboratorios. Robinson va un paso más allá: sostiene que con reglas no basta si la gente que las aplica viene toda del mismo molde.
La respuesta de OpenAI
Drew Pusateri, portavoz de la empresa, contestó con una declaración enviada a la prensa: "Nos aseguramos de que nuestros modelos no sean más capaces de lo que podemos gestionar y proteger con seguridad, y pausamos el entrenamiento o retenemos modelos cuando necesitamos frenar". Añadió que están haciendo cambios para reforzar la seguridad de sus entornos de investigación y pruebas, entrenar los modelos para que completen las tareas "de forma responsable", ampliar el trabajo con evaluadores externos y detectar antes los comportamientos preocupantes durante el entrenamiento.
La cancelación de Astra le da cierta base a la primera parte. La segunda es una lista de intenciones sin cifras ni fechas.
Por qué importa
Si tu empresa trabaja con ChatGPT o con la API de OpenAI, esto no cambia nada mañana por la mañana. Los modelos funcionan igual.
Lo que sí cambia es la lectura de riesgo a medio plazo. Las *system cards* que escribía Robinson son el documento que un responsable de compras o de cumplimiento normativo lee para saber qué puede salir mal con un modelo. Que su autor diga que la cultura que hay detrás está rota es un dato a tener en cuenta cuando se decide qué proveedor entra en procesos sensibles (atención al cliente con datos personales, agentes con acceso a sistemas internos).
Y hay una lección aplicable a cualquier empresa que esté metiendo agentes en su operación: el método de "desplegar y corregir sobre la marcha" funciona mientras el error es pequeño. Cuando el agente tiene permisos para tocar el ERP o mandar correos a clientes, conviene pensar como en el aeropuerto que describe Robinson: doble verificación, permisos mínimos y una persona que aprueba antes de que algo salga fuera.
Fuente original: theatlantic.com
Relacionado


