Z.ai lanza GLM-5.3 y su capacidad ofensiva se le dispara: 2.436 vulnerabilidades en 269 proyectos abiertos

Z.ai lanza GLM-5.3 y su capacidad ofensiva se le dispara: 2.436 vulnerabilidades en 269 proyectos abiertos
Fuente: unite.ai

Z.ai ha lanzado GLM-5.3 el 14 de agosto, y el titular que la propia empresa reconoce no es el de código: su capacidad ofensiva en ciberseguridad creció más rápido de lo que esperaba mientras escalaba el entrenamiento. El modelo encontró 2.436 vulnerabilidades en 269 proyectos de código abierto, 1.097 de ellas críticas o altas.

Puntos clave

  • Mismo modelo base de unos 700.000 millones de parámetros que GLM-5.2. Toda la ganancia viene del post-entrenamiento, no de un modelo nuevo.
  • Terminal-Bench 3.0 pasa de 4,6 a 28,3. DeepSWE v1.1 de 46,2 a 66,9.
  • CyberGym sube de 77,2% a 84,5%. ExploitBench más que dobla, de 24,4% a 54,4%.
  • Los pesos se publican en unas dos semanas, a finales de agosto.

El dato de eficiencia es el que muerde

En Z.ai Code Bench, GLM-5.3 saca 31,4% gastando unos 50.000 tokens de salida. Claude Opus 4.8 saca 29,5% gastando 120.000. Más resultado con menos de la mitad de tokens.

Fable 5 sigue delante con 39,5%, y en varias pruebas duras de código GPT-5.6 Sol también gana. Esa es la parte honesta del cuadro: GLM-5.3 no ha alcanzado a la frontera. Lo que ha hecho es acercarse mucho por un camino distinto, y hacerlo con un consumo de tokens que cambia la aritmética del coste por tarea.

Con GLM-5.2 a un rango de 0,95 a 2 dólares por millón de entrada frente a los 5 a 15 de los cerrados, y ahora la mitad de tokens para el mismo trabajo, el diferencial de precio se multiplica en lugar de sumarse.

El razonamiento pasa a ser obligatorio en GLM-5.3 y no se puede desactivar. Hay tres niveles de esfuerzo: bajo, alto y máximo.

Lo que Z.ai admite sobre su propio modelo

En ExploitGym completó 105 tareas en dos horas y 130 en seis. Los números de CyberGym y ExploitBench van en la misma dirección, y el hallazgo de campo es el que llama la atención: 2.436 vulnerabilidades reales en 269 proyectos abiertos, con 1.097 clasificadas como críticas o de severidad alta.

Z.ai dice literalmente que esa capacidad creció más rápido de lo anticipado al escalar el entrenamiento, y afirma haber montado su sistema de revisión de riesgos más robusto hasta la fecha antes de publicar. Es la primera vez que un laboratorio chino enmarca así una capacidad ofensiva en su propio anuncio.

Ese reconocimiento tiene un contexto incómodo. Hace nueve días, un análisis de SaferAI encontró que GLM-5.2 no rechazó ni una sola tarea ofensiva de las que le plantearon. El modelo que ahora dobla su puntuación en ExploitBench parte de ese historial, y los pesos salen en dos semanas para que cualquiera los descargue.

Dónde se puede usar

Está en la API de Z.ai y en el GLM Coding Plan. Los pesos abiertos llegan a finales de agosto, y con GLM-5.2 el precedente fue licencia MIT en Hugging Face más disponibilidad en Together.ai y OpenRouter.

Además hay una vía nueva en Europa: Mistral acaba de empezar a hospedar GLM-5.2 en su plataforma con residencia de datos en la región. Un modelo chino servido desde infraestructura europea con compromiso de SLA es una combinación que no existía hace un mes.

Por qué importa

Para un equipo que gasta de verdad en tokens de código, GLM-5.3 es la primera alternativa abierta que se puede defender con una hoja de cálculo y no con ideología. Sacar más que Opus 4.8 en una prueba propia con menos de la mitad de tokens es un argumento de coste, y en dos semanas se podrá correr en tu propia infraestructura.

Los dos avisos van juntos. Uno: el benchmark donde gana es de Z.ai, y en las pruebas independientes duras sigue por detrás de Fable 5 y GPT-5.6 Sol, así que la comparación hay que hacerla con tus tareas. Dos: si valoras descargar los pesos, asume que descargas también la capacidad ofensiva que la propia empresa dice que se le adelantó.


Relacionado