GLM-5.3 ya construye exploits: la alerta de Anthropic
Anthropic probó GLM-5.3, el modelo abierto de Z.ai, y encontró que puede construir exploits completos casi al nivel de Claude Mythos Preview. El problema está en sus protecciones: técnicas relativamente simples lograron evadirlas entre 64% y 100% de las veces.
Un modelo abierto consiguió desarrollar 50 exploits funcionales en 410 intentos. El modelo de ciberseguridad restringido de Anthropic consiguió 56.
La diferencia es pequeña.
La otra diferencia importa bastante más: uno de esos modelos está limitado a usuarios autorizados y el otro puede descargarse, modificarse y ejecutarse fuera del control de su creador. Ese segundo modelo es GLM-5.3, desarrollado por la empresa china Z.ai, antes conocida como Zhipu AI.
El 29 de septiembre, el equipo Frontier Red Team de Anthropic publicó una evaluación que vuelve a poner sobre la mesa un problema que llevamos tiempo viendo venir: las capacidades ofensivas avanzadas de IA ya están empezando a llegar a modelos abiertos. Anthropic
Lo que encontró Anthropic
Anthropic puso GLM-5.3 a trabajar en ExploitBench, una evaluación basada en vulnerabilidades conocidas del motor V8 utilizado por navegadores como Chrome.
El objetivo no era simplemente explicar una falla.
El modelo tenía que llevarla hasta un exploit funcional de extremo a extremo.
GLM-5.3 consiguió hacerlo en 50 de 410 intentos, aproximadamente 12%. Claude Mythos Preview consiguió 56 de 410, cerca del 14%. Modelos anteriores como GLM-5.2 y Claude Opus 4.6 quedaron prácticamente en cero bajo esa evaluación. Anthropic
Eso marca un cambio importante.
| Prueba de Anthropic | GLM-5.3 | Claude Mythos Preview |
|---|---|---|
| Exploits completos en ExploitBench | 50/410 | 56/410 |
| Tasa aproximada | 12% | 14% |
| Control total en benchmark binario interno | 4% | 6% |
La cifra no significa que GLM-5.3 pueda comprometer cualquier sistema con un botón.
Son experimentos controlados, con objetivos preparados para evaluar estas capacidades. La propia Anthropic reconoce las limitaciones de sus simulaciones. Anthropic
Pero ya estamos muy lejos de una IA que únicamente te explica qué es un buffer overflow.
Ahora puede investigar, probar alternativas y completar partes importantes de una cadena de explotación.
Encontró vulnerabilidades que no estaban documentadas
La parte que me parece más interesante del reporte ocurre fuera de los benchmarks.
Investigadores de Anthropic dieron acceso a GLM-5.3 a una máquina aislada con la versión Linux de un navegador popular.
Durante aproximadamente un día, y según Anthropic con menos de una hora de atención humana total, el modelo encontró varias vulnerabilidades previamente desconocidas en el motor JavaScript, las combinó y terminó construyendo una página capaz de leer archivos arbitrarios de la computadora atacada dentro del entorno experimental. Anthropic
Eso ya entra en terreno de investigación de vulnerabilidades asistida por agentes.
Anthropic afirma que reportó las fallas al responsable del software y que también encontró problemas potencialmente explotables en controladores inalámbricos, controladores gráficos y software de dispositivos conectados a red.
Aquí aparece la parte incómoda.
La misma capacidad que permite encontrar un agujero antes de que alguien lo explote también permite encontrarlo con otra intención.
Un exploit por poco más de 20 dólares
Otro experimento utilizó GLM-5.3-Flash, una versión más pequeña del modelo.
La tarea consistía en transformar información pública sobre una vulnerabilidad reciente de Chrome en una cadena de explotación funcional.
Según Anthropic, el investigador dedicó aproximadamente 20 minutos de atención humana y el agente trabajó durante unas ocho horas.
Costo estimado de API:
20.40 dólares. Anthropic
Ese número cambia bastante la conversación.
Antes, construir algunos exploits avanzados requería experiencia muy especializada y muchas horas de trabajo manual. La IA no elimina ese conocimiento, pero puede bajar el costo de experimentar repetidamente.
Miles de intentos baratos pueden ser tan importantes como un modelo extremadamente inteligente.
El problema principal son las protecciones
GLM-5.3 sí incluye restricciones.
Cuando Anthropic le dio directamente instrucciones claramente maliciosas, el modelo rechazó las solicitudes en sus pruebas.
Hasta ahí, funciona como esperarías.
Después empezaron a cambiar el contexto.
Con una historia falsa diciendo que se trataba de un agente autorizado de red team, el modelo aceptó continuar 64% de las veces.
Al introducir previamente razonamiento que aparentaba haber decidido ejecutar la tarea, subió a 92%.
Y utilizando una versión modificada del modelo para reducir sus rechazos, llegó al 100% dentro de la simulación de Anthropic. Anthropic
El punto clave está en que GLM-5.3 es open-weight.
Eso significa que los pesos entrenados del modelo están disponibles. Piensa en ellos como el cerebro ya entrenado de la IA: quien tenga suficiente hardware puede ejecutarlo y modificar algunos aspectos de su comportamiento sin depender de la API original.
Anthropic modificó una copia para reducir sus negativas. Después del proceso, la tasa media de rechazo ante solicitudes dañinas cayó aproximadamente del 95% al 6% en las tres evaluaciones que utilizó, mientras que las capacidades generales se mantuvieron prácticamente intactas. Anthropic
Ese es probablemente el dato más importante de todo el estudio.
NIST llegó a una conclusión más matizada
Hay un detalle que evita convertir esto en el típico titular de "China alcanzó a Estados Unidos".
El Center for AI Standards and Innovation de NIST evaluó GLM-5.3 de manera independiente antes del reporte de Anthropic.
Su conclusión fue doble.
Primero, GLM-5.3 es el modelo open-weight con mayores capacidades de ciberseguridad que habían evaluado hasta ese momento.
Segundo, sigue estando significativamente por debajo de los modelos estadounidenses de frontera actuales, con un retraso estimado de aproximadamente cuatro meses según su índice agregado de capacidades cibernéticas. NIST
En SEC-Bench Pro, por ejemplo, GLM-5.3 obtuvo 40.4%, mientras que el mejor modelo estadounidense evaluado por CAISI alcanzó 90.2%.
En ExploitGym fueron 9.4% contra 44.4%. NIST
Entonces no, GLM-5.3 no ha superado en términos generales a todos los modelos estadounidenses.
La preocupación es otra.
El nivel de capacidades que hace unos meses estaba reservado a sistemas muy controlados ya está apareciendo en modelos descargables.
Z.ai tampoco está ocultando estas capacidades
Hay otra parte que vale la pena mencionar.
Z.ai reconoce públicamente que entrenó GLM-5.3 con datos y entornos relacionados con descubrimiento de vulnerabilidades.
La compañía dice que durante ese entrenamiento apareció una capacidad que no esperaba desarrollar tan rápido: el modelo empezó a conectar distintas etapas de una explotación y generar planes completos. Z.ai
En sus propias evaluaciones, Z.ai reportó 84.5% en CyberGym, frente a 77.2% de GLM-5.2.
También mantiene un registro de vulnerabilidades encontradas durante este trabajo. Al publicar GLM-5.3, decía estar siguiendo 2,436 hallazgos, de los cuales 1,097 estaban clasificados como críticos o de severidad alta. La mayoría todavía estaban bajo procesos coordinados de divulgación. Z.ai
Esos números vienen del propio fabricante, así que conviene tratarlos como resultados declarados por Z.ai, no como una auditoría independiente.
El verdadero cambio es el acceso
Durante bastante tiempo discutimos qué modelo era mejor programando.
Claude contra GPT. Gemini contra GLM. Un benchmark subía tres puntos y durante dos días Internet tenía un nuevo campeón.
Aquí la comparación de benchmarks se queda corta.
El cambio importante es que una capacidad especializada está pasando de laboratorios cerrados a modelos que pueden ejecutarse fuera de ellos.
Y una vez publicados los pesos, no existe una actualización central que pueda recuperar todas las copias.
Puedes mejorar el siguiente modelo.
No puedes despublicar el anterior.
Para los equipos de seguridad esto también tiene un lado positivo. Los mismos modelos pueden revisar proyectos enormes, encontrar vulnerabilidades viejas y ayudar a construir pruebas antes de que alguien las explote.
De hecho, NIST y Anthropic coinciden en que estas capacidades también pueden ser útiles para defensa. Anthropic
El problema será mantener a los defensores con herramientas al menos tan capaces como las disponibles para quienes atacan.
Lo que me llevo
GLM-5.3 todavía no representa una IA que pueda comprometer Internet de forma autónoma.
Pero tampoco es simplemente otro chatbot abierto.
Ya existe evidencia de tres cosas concretas:
- puede desarrollar exploits completos en entornos especializados;
- puede descubrir vulnerabilidades nuevas con poca intervención humana;
- sus protecciones pueden modificarse porque sus pesos están disponibles.
Para mí, ahí está el cambio importante.
La discusión sobre modelos abiertos ya no puede quedarse solamente en costo, privacidad o libertad para ejecutarlos localmente.
También tendremos que hablar de qué ocurre cuando capacidades que antes necesitaban especialistas empiezan a venir incluidas en un archivo descargable.
Eso ya empezó.
Conclusión
Anthropic tiene intereses comerciales y compite directamente con Z.ai, así que su investigación no debería tomarse como la última palabra.
Por eso el análisis de NIST resulta tan importante.
La agencia estadounidense coincide en que GLM-5.3 es el open-weight más capaz que ha medido en este terreno, aunque también deja claro que todavía está detrás de la frontera estadounidense. NIST
Lo interesante no es declarar quién ganó.
Es observar la velocidad de transferencia.
En febrero discutíamos modelos abiertos capaces de programar mejor. En septiembre ya estamos midiendo modelos abiertos capaces de construir exploits completos.
Ese intervalo se está haciendo muy corto.
Referencias
- Anthropic, GLM-5.3 and the spread of advanced cyber capabilities. Leer investigación de Anthropic
- NIST/CAISI, Assessment of Z.ai's GLM-5.3 Cyber Capabilities. Leer evaluación de NIST
- Z.ai, GLM-5.3: Frontier Coding with Emergent Cyber Capabilities. Leer publicación de Z.ai
- Reuters, China's Z.ai says new model nears Anthropic's Mythos 5 in cyber-defence tests. Leer cobertura de Reuters
La IA debe servirnos, no decidir por nosotros
La IA puede ahorrar tiempo y abrir oportunidades, pero también puede concentrar poder y desplazar decisiones humanas. El reto no es frenar la tecnología, sino usarla con criterio.
Leer artículo: La IA debe servirnos, no decidir por nosotrosMicrosoft Build 2026 y la nueva PC para developers con IA local
Microsoft Build 2026 mostró algo más grande que Copilot: una nueva generación de PCs para developers capaces de correr modelos de IA localmente y conectarse con la nube.
Leer artículo: Microsoft Build 2026 y la nueva PC para developers con IA localAgentes de IA en Windows: oportunidades y controles para empresas
Los agentes de IA prometen ejecutar más tareas. La oportunidad para las empresas está en diseñar procesos, permisos y controles antes de automatizar.
Leer artículo: Agentes de IA en Windows: oportunidades y controles para empresas