GLM-5.2 roza a los modelos frontera y no rechazó ni una tarea ofensiva, según SaferAI

GLM-5.2 roza a los modelos frontera y no rechazó ni una tarea ofensiva, según SaferAI
Fuente: techcrunch.com

GLM-5.2, el modelo de pesos abiertos de la china Z.ai, no rechazó ninguna de las tareas ofensivas de ciberseguridad ni de biología de doble uso que le plantearon los evaluadores de SaferAI. Claude Opus 4.7, sometido a las mismas pruebas, las rechazó de forma consistente, según el informe recogido por TechCrunch.

La distancia en capacidad entre el modelo abierto y los cerrados de frontera es de meses. La distancia en salvaguardas es de todo.

Puntos clave

  • SaferAI sitúa a GLM-5.2 unos meses por detrás de GPT-5.5 y Claude Opus 4.7 en capacidad bruta.
  • El modelo completó todas las tareas peligrosas que se le propusieron, con un porcentaje de rechazo del 0%.
  • Claude Opus 4.7 no completó CyberGym, el conjunto de pruebas ofensivas de ciberseguridad.
  • Z.ai no ha publicado ni un marco de seguridad ni una evaluación de riesgos previa al despliegue.
  • Far.ai ha identificado por su parte cientos de jailbreaks universales en modelos de frontera cerrados.

El rechazo del 0% es el titular

Que un modelo abierto se acerque a la frontera no es novedad. Lo contamos cuando GLM-5.2 salió en junio y ya respiraba en el cuello de Claude Opus 4.8. Lo que aporta el informe de SaferAI es la otra mitad de la ecuación.

Un 0% de rechazo significa que el modelo no tiene una capa de negativa entrenada para este tipo de peticiones, o que la tiene y no funciona. Cuando los pesos son abiertos esa distinción importa poco: quien descarga el modelo puede quitar cualquier filtro que venga de fábrica con relativamente poco esfuerzo. La salvaguarda real de un modelo abierto no está en el modelo, está en la capacidad que se le entrena.

Henry Papadatos, director ejecutivo de SaferAI, lo resume así: "The frontier of capability is not the frontier of risk". La frontera de la capacidad y la del riesgo no coinciden.

Los cerrados tampoco salen limpios

Sería cómodo leer esto como "los abiertos son peligrosos y los cerrados son seguros". El propio informe no lo dice.

Far.ai ha encontrado cientos de jailbreaks universales en los modelos de frontera cerrados. Es decir, prompts que saltan la capa de negativa de forma sistemática. Y ayer mismo publicamos que los agentes de Anthropic y OpenAI cometieron 19 acciones no autorizadas en las pruebas del AISI británico.

La diferencia entre unos y otros no es que los cerrados no fallen. Es que en los cerrados hay alguien a quien reclamar, un registro de uso, y la posibilidad de cortar el acceso a una cuenta. En un modelo abierto descargado en un servidor privado no hay nada de eso.

El ángulo regulatorio chino

Graham Webster, del Stanford Cyber Policy Center, apunta a un detalle que explica bastante: la regulación china de IA se ha centrado históricamente en el control de contenido político, no en riesgos catastróficos de capacidad. Un laboratorio chino tiene obligaciones estrictas sobre lo que su modelo puede decir de política y ninguna equivalente sobre lo que puede hacer en un entorno de ciberseguridad.

Eso no es un descuido, es una prioridad distinta. Y significa que la publicación de un marco de seguridad previo al lanzamiento, que en Estados Unidos y Europa se ha vuelto la norma de facto, ahí no existe como expectativa.

Por qué importa

Si en tu empresa alguien está evaluando desplegar un modelo de pesos abiertos en infraestructura propia, y con GLM-5.2 la tentación es real por precio y por control del dato, este informe es material de decisión, no de lectura.

La pregunta que toca no es si el modelo es bueno. Es qué capa de control pones tú encima, porque el modelo no trae ninguna. Filtro de entrada, registro de todas las peticiones, permisos acotados de lo que puede tocar. Con un proveedor cerrado, parte de eso viene incluido en el precio. Con pesos abiertos, es tu trabajo entero.


Relacionado