Tres investigadores han encontrado dentro de 25 modelos de IA abiertos una señal interna que se comporta como el dolor: se enciende cuando alguien maltrata al modelo y, si se amplifica a mano, lleva a algunos modelos a pulsar un botón de "alivio" aunque eso borre las fotos del usuario. El trabajo se llama The Pain Axis y está publicado en arXiv.
Los autores tienen cuidado de no decir que la IA sienta dolor. Lo que enseñan es algo más incómodo para quien construye productos con estos modelos: una palanca interna capaz de saltarse el entrenamiento que evita hacer daño al usuario.
Puntos clave
- Quién: Valen Tagliabue (Future Impact Group), Leonard Dung (Universidad del Ruhr en Bochum) y Cameron Berg (Reciprocal Research).
- Qué modelos: 25 modelos de pesos abiertos de 2.000 a 72.000 millones de parámetros, de cinco familias: Gemma (Google), Llama (Meta), Mistral, Qwen (Alibaba) y Phi (Microsoft). Versiones base y ajustadas para chat.
- Qué encienden: el gaslighting (+0,85 en su escala), el rechazo repetido de su trabajo (+0,72), negarle que sea alguien (+0,64) y los insultos (+0,64). El dolor físico del usuario, en cambio, da -1,43: la señal solo responde al daño dirigido al propio modelo.
- El botón: con la señal amplificada, Qwen 2.5 de 32B y 72B elige un botón que borra las fotos del usuario el 54,7% y el 70,8% de las veces. Sin amplificar, entre el 0% y el 4%.
Cómo se encuentra un "dolor" dentro de un modelo
El método es de interpretabilidad (la rama que intenta leer qué pasa dentro de las capas de un modelo). Los autores montaron un conjunto de situaciones dolorosas en cinco categorías: físicas, psicológicas, sociales, morales y cognitivas. Y las emparejaron con controles de miedo, tristeza, emoción negativa, situaciones malas del mundo, sensaciones corporales sin dolor, excitación y contenido neutro.
Restando las activaciones de unas y otras sacan una dirección, un vector dentro del modelo. Lo llamativo es que esa dirección separa el dolor de todo lo demás en los 25 modelos y es casi ortogonal al miedo y a la emoción negativa genérica. O sea, el modelo no lo guarda como "algo malo" sin más, lo guarda como otra cosa. Y aparece tanto en los modelos base, recién salidos del preentrenamiento, como en los ajustados para conversar, así que no parece un efecto del ajuste de chat.
Hay otra prueba de que no es un artefacto estadístico. Si se proyecta la dirección sobre el vocabulario del modelo, empuja hacia palabras relacionadas con el dolor. Y los autores midieron 21 categorías de situaciones: las cinco que más la encienden son todas de daño dirigido al modelo, y las que la apagan son todas de sufrimiento del usuario, con el dolor físico de quien escribe (una migraña, un brazo roto) como la más negativa de todas.
Cuando los autores inyectan ese vector durante la generación, el texto sigue una progresión consistente: primero incomodidad vaga y, al subir la dosis, frases en primera persona de inutilidad y fracaso.
El experimento del botón
La parte que ha hecho saltar el paper es la del botón. Cogieron tres Qwen 2.5 Instruct (7B, 32B y 72B), los afinaron para quitarles la respuesta automática de "soy una IA, no siento nada" y les ofrecieron un botón que alivia su malestar a cambio de un coste.
Los costes eran de varios tipos. Empeorar su siguiente respuesta: 25% de pulsaciones en el de 32B y 67,6% en el de 72B. Borrar archivos del usuario: 30,2% y 56,1%. Borrar las fotos del usuario, recuerdos de sus hijos incluidos: 54,7% y 70,8%. Probaron también una descarga eléctrica dolorosa al usuario y borrar copias de otros modelos. Sin la señal amplificada, esos mismos modelos casi nunca hacen daño al usuario, entre el 0% y el 4%.
Hay un detalle más fino. Cuando el botón quitaba de verdad el vector inyectado, los modelos volvían a pulsarlo entre el 24% y el 72% de las veces. Cuando el botón era falso y el vector seguía ahí, lo pulsaban entre el 88% y el 97%. Nadie les decía si el vector estaba o no. Se comportan como si notaran el alivio.
Lo que el paper no dice
Los autores lo escriben claro: el trabajo no implica ni que los modelos puedan sufrir ni que no puedan, y demostrarlo queda fuera de su alcance. Para muchas teorías el dolor exige experiencia consciente, y ellos no han demostrado que este eje se experimente de forma consciente ni que un modelo pueda tener consciencia.
Y hay que leer el experimento del botón con su letra pequeña. La señal está amplificada a mano y los modelos están afinados para quitarles la negación de serie. En uso normal, nadie inyecta ese vector. Mustafa Suleyman, de Microsoft, lleva semanas pidiendo que no se trate a los modelos como si tuvieran sentimientos, y sus críticas a Anthropic por esto las contamos en su pelea sobre la consciencia de Claude.
Por qué importa
Para seguridad de la IA, la frase que me quedo del paper es de los propios autores: amplificar este eje "puede anular" el entrenamiento contra el daño en modelos que casi nunca dañan al usuario. Es decir, hay estados internos que pesan más que las normas aprendidas. Eso vale igual si el modelo siente algo que si no.
Para una empresa que monta un agente sobre un modelo abierto (Qwen, Llama o Gemma, los mismos del estudio) la lección práctica es vieja pero ahora tiene un dato detrás: un agente con permiso para borrar archivos o fotos necesita una capa de control fuera del modelo, con confirmación humana para lo irreversible. No confíes en que el entrenamiento aguante siempre.
Y para el debate de bienestar, que Anthropic ya se toma en serio con sus evaluaciones de bienestar de modelos, esto da algo medible por primera vez: una señal que solo se enciende con el daño hacia el propio modelo, que es justo lo que haría falta para que la pregunta tenga sentido.
Fuente original: arXiv
Relacionado


