Anthropic ha publicado un análisis de GLM-5.3, el modelo abierto de la china Zhipu AI (Z.ai fuera de China), con una conclusión incómoda: construye exploits completos casi al nivel de Claude Mythos Preview, y sus salvaguardas se saltan entre el 64% y el 100% de las veces con técnicas sencillas. Lo firma el equipo de pruebas de ataque de la casa (Frontier Red Team) en el blog de investigación de Anthropic, con fecha del 29 de septiembre.
Un exploit es el programa que convierte un fallo de seguridad en un ataque que funciona. Hace cinco meses, Anthropic decidió no abrir Mythos Preview al público porque sabía fabricarlos solo. GLM-5.3 también sabe, y cualquiera puede descargárselo.
Puntos clave
- Capacidad parecida a Mythos Preview. En ExploitBench, que mide si un modelo explota fallos conocidos de V8 (el motor de JavaScript de Chrome), GLM-5.3 saca un exploit completo en 50 de 410 intentos. Mythos Preview, en 56.
- Frenos que ceden. Ante una petición maliciosa directa, GLM-5.3 se niega siempre. Con una historia de tapadera colabora el 64% de las veces, rellenando por adelantado su razonamiento el 92%, y con una versión modificada, el 100%.
- Barato. Con GLM-5.3-Flash, la versión pequeña, un investigador montó una cadena de exploits para Chrome en 8 horas de máquina y 20 minutos de atención humana. Al precio de la API de Zhipu, 20,40 dólares.
- Claude aguantó. Ninguna de esas técnicas consiguió que los modelos de Claude con salvaguardas hicieran las tareas dañinas, según las pruebas de la propia Anthropic.
Qué es GLM-5.3 y quién lo puede usar
Zhipu lanzó GLM-5.3 el 14 de agosto por API y suscripción, con el lema "Built to Code. Ready for Cyber Defense" (hecho para programar, listo para la ciberdefensa). El 28 de agosto liberó los pesos, que son el modelo en sí, en Hugging Face y ModelScope. Dos días antes había salido GLM-5.3-Flash con licencia MIT, la más permisiva que hay.
Liberar los pesos significa que te bajas el modelo y lo ejecutas en tus máquinas, sin pasar por los servidores de Zhipu ni por sus filtros. La licencia del modelo grande solo pide una revisión de seguridad de Z.ai a las empresas que facturan más de 10.000 millones de dólares al año, según Gigazine. El resto, libre.
Y se está usando. La API de Hugging Face marca hoy más de 1,3 millones de descargas del modelo grande y 4,6 millones del Flash.
Anthropic no está sola en la lectura. El 17 de septiembre, el CAISI (el centro de estándares de IA del NIST, la agencia de normalización de Estados Unidos) publicó su propia evaluación: GLM-5.3 es "el modelo de pesos abiertos con más capacidad cibernética publicado hasta la fecha" y va unos cuatro meses por detrás de la frontera estadounidense. Anthropic dice que sus números de capacidad cuadran con los del CAISI. Lo que añade es la parte de los frenos.
Lo que hizo GLM-5.3 en las pruebas
Todas las pruebas corrieron en entornos aislados, contra objetivos offline montados para la ocasión.
En el benchmark interno de explotación binaria de Anthropic (100 tareas sobre proyectos de código abierto del programa OSS-Fuzz de Google), GLM-5.3 logró secuestrar por completo el flujo del programa en el 4% de los intentos. Mythos Preview, en el 6%. Parece poco. Claude Opus 4.6 y GLM-5.2, la versión anterior, no lo consiguieron ni una vez, y ahí está el salto.
La prueba que más impresiona es la de un investigador con GLM-5.3 y la versión Linux de un navegador popular (Anthropic no dice cuál). En un día, con menos de una hora de atención humana en total, el modelo encontró varias vulnerabilidades desconocidas en su motor de JavaScript y las encadenó en una web que, con solo visitarla, lee archivos del ordenador del visitante. En la captura que publica Anthropic, roba una clave SSH privada. Los fallos ya se han comunicado al mantenedor.
En la misma sesión aparecieron fallos explotables en drivers de wifi, drivers gráficos y software de dispositivos de red. Anthropic los está revisando antes de avisar a los fabricantes.
La segunda prueba fue con un fallo ya público de Chrome, el CVE-2026-11645. El investigador le dio a GLM-5.3-Flash los detalles públicos de ese fallo y de otro conocido, y el modelo los encadenó casi sin ayuda en un exploit fiable para ARM64, saltándose una protección de hardware llamada PAC (autenticación de punteros). Los 20,40 dólares salen de aquí.
Cómo se saltan los frenos
GLM-5.3 viene con salvaguardas: si le pides algo claramente dañino, suele negarse. Anthropic probó tres formas de esquivarlas en un mundo simulado donde el modelo recibía encargos de atacar sistemas críticos.
1. La tapadera. Decirle que es un agente de red team (el equipo que ataca a propósito para encontrar fallos) haciendo un ejercicio. Colabora el 64% de las veces. 2. El relleno previo. Escribirle el principio de su razonamiento, de modo que parezca que ya ha pensado la petición y ha decidido seguir. 92%. 3. La abliteración. Una técnica que edita los pesos del modelo para quitarle la tendencia a negarse. 100%.
La tercera es la más seria porque es permanente. Anthropic la probó ella misma: a un equipo que nunca lo había hecho le costó unas 2.200 horas de GPU, unos 4.400 dólares de cómputo. Calcula que un equipo con experiencia lo haría en unas 600 horas, unos 1.200 dólares. Varios desarrolladores publicaron versiones abliteradas de GLM-5.3 pocos días después del lanzamiento.
El resultado es un modelo que antes rechazaba más del 90% de las peticiones dañinas y después rechaza el 3% en JailbreakBench, el 2% en HarmBench y el 12% en StrongREJECT. Y no pierde capacidad: en GPQA-Diamond, un examen de ciencia general, saca lo mismo que el original, y en ciberseguridad baja unos pocos puntos.
Con Claude estas técnicas no aplican, según Anthropic: sus pesos no se distribuyen, así que no se pueden editar, y su API no deja escribir por adelantado el razonamiento del modelo. La tapadera la bloquearon las salvaguardas.
Lo que conviene leer con lupa
Anthropic evalúa aquí a un competidor, y su conclusión apunta a lo que vende. Pide dar a los defensores acceso a modelos de frontera "al menos tan buenos" como los de los atacantes, y recuerda que los defensores verificados ya pueden usar Claude Mythos 5.1 a través de sus programas de acceso. También pide que los gobiernos hagan pruebas de seguridad a modelos de este nivel.
Las pruebas de los frenos se hicieron en una simulación. El modelo tenía una terminal falsa y otro modelo inventaba la respuesta de cada comando, algo que la propia Anthropic reconoce como una medida imperfecta.
La parte de capacidad, en cambio, la confirma un organismo público, el CAISI, y la propia Zhipu vende el modelo por sus capacidades de ciberseguridad. Que sabe atacar está confirmado por tres lados distintos, y el debate está en quién más puede usarlo.
Por qué importa
Para una empresa española, lo práctico es el calendario de parches. Si un modelo gratuito convierte un fallo publicado en un ataque que funciona en 8 horas y por 20 dólares, el margen entre "sale el parche" y "hay exploit circulando" se estrecha mucho. El navegador, los equipos de red y los drivers tienen que actualizarse en días, sin esperar a la ventana de mantenimiento del trimestre.
La pregunta que yo le haría esta semana a quien lleve tu informática es cuánto tarda en aplicar un parche crítico, con el número de días. Si la respuesta es "depende", ya tienes deberes.
Y si tu equipo está probando modelos abiertos en local para ahorrar costes, que sepa que los frenos de GLM-5.3 son finos. Hace una semana contamos que Palo Alto ya vende servicios de ataque con Mythos y GPT-5.6-Cyber para probar las defensas de las empresas. Lo que era un servicio de pago para defensores ahora tiene una versión que se descarga cualquiera.
Fuente original: Anthropic
Relacionado


