GLM-5.3: Mejora del 50% en programación sin cambiar el modelo base y aplazamiento por riesgos de ciberseguridad

GLM-5.3: Mejora del 50% en programación sin cambiar el modelo base y aplazamiento por riesgos de ciberseguridad

IALLM Chinos

Fuentes:Blog oficial de Z.ai + IT Home + HN

Sin cambiar el modelo base: primer puesto basado exclusivamente en el posentrenamiento

El 14 de agosto de 2026, Zhipu lanzó oficialmente GLM-5.3, su modelo de lenguaje especializado en programación. El modelo logra una mejora del 50% en la experiencia global de programación con respecto a su predecesor. La clave radica en que todos los avances provienen exclusivamente del escalado en la fase de posentrenamiento (Post-Training), sin haber realizado ningún cambio en el modelo base subyacente.

En el paradigma técnico tradicional, lograr un salto generacional en el rendimiento del modelo solía depender de acumular una potencia de cálculo masiva para ampliar los parámetros del modelo base. GLM-5.3 ha elegido una ruta de ingeniería radicalmente distinta: comparte el mismo cerebro base con la generación anterior (GLM-5.2) y concentra el esfuerzo de entrenamiento en entornos de tareas de larga duración decenas de veces más complejos, escenarios de simulación más ricos y meses de ajuste mediante aprendizaje por refuerzo (RL). Esta estrategia de maximizar el posentrenamiento sin cambiar el modelo base demuestra que los modelos chinos pueden encontrar una vía pragmática de equiparación mediante ingeniería de alta precisión, incluso bajo restricciones objetivas de potencia de cálculo.

Los datos reales confirman el sorprendente impacto de esta estrategia de posentrenamiento. En la prueba de referencia Terminal Bench 3.0, que evalúa la interacción compleja en línea de comandos, la puntuación de GLM-5.3 experimentó un crecimiento vertiginoso pasando de 4,6 puntos (en GLM-5.2) a 28,3 puntos. En el exigente benchmark de programación DeepSWE v1.1, la calificación subió de 46,2 a 66,9 puntos. Esto indica que el modelo ha alcanzado el umbral de los modelos comerciales cerrados de vanguardia en la refactorización de código de secuencias largas y en el despliegue en entornos reales, demostrando que los límites del posentrenamiento son mucho más amplios de lo que la industria estimaba.

Para respaldar este entrenamiento de alta intensidad, Zhipu ha publicado de forma abierta la infraestructura de posentrenamiento slime, combinada con el algoritmo de aprendizaje por refuerzo para tareas de larga duración SAO y la tecnología de optimización de memoria VRAM IndexShare, lo que ha incrementado la capacidad de rendimiento del entrenamiento por refuerzo en más de 2,3 veces. En un contexto real donde la oferta de hardware tiene un techo claro, aumentar la eficiencia de rendimiento por GPU se está convirtiendo en el factor decisivo en la carrera de los LLM.

Tabla comparativa de GLM-5.3 con modelos principales Figura: Tabla comparativa de GLM-5.3 frente a los principales modelos globales en benchmarks de programación y seguridad. Fuente: Blog oficial de Z.ai

Resolviendo los mismos problemas difíciles con un tercio de tokens

Durante el despliegue de modelos de lenguaje en la productividad empresarial, los elevados costes de consumo de tokens han sido siempre un obstáculo importante para la aplicación a gran escala. GLM-5.3 muestra un marcado utilitarismo de ingeniería en su diseño, omitiendo salidas prolijas de cadenas de pensamiento (Chain-of-Thought) para centrarse en encontrar el camino más corto para resolver el problema.

Los datos de evaluación reflejan con claridad esta diferencia de enfoque: en la configuración High, GLM-5.3 obtuvo una precisión del 31,4% con una media de solo unos 50.000 tokens por tarea. En comparación, el modelo competidor Claude Opus 4.8 alcanzó un 29,5% de precisión consumiendo 120.000 tokens. Esto significa que GLM-5.3 logró una tasa de éxito superior utilizando menos de la mitad de la longitud de salida, reduciendo directamente en un 60% los costes de ancho de banda e inferencia en la nube.

Incluso al cambiar al modo Max de máximo rendimiento, GLM-5.3 ofreció una precisión del 34,5% con 75.000 tokens, lo que supone un salto de calidad frente a GLM-5.2 (23,4% de precisión con 96.000 tokens). Aunque Fable 5 de Anthropic sigue liderando con un 39,5% de precisión, GLM-5.3 proporciona una ventana de contexto de 1M de tokens y una salida única máxima de 128K en el procesamiento de textos largos, imponiendo además el modo de pensamiento profundo de forma obligatoria (thinking no se puede desactivar). Este mecanismo que vincula estrechamente la lógica de pensamiento evita que los usuarios provoquen el colapso de la lógica compleja al desactivar accidentalmente el razonamiento profundo.

Zhipu ya ha integrado el modelo en ZCode, AutoClaw y el plan de facturación GLM Coding Plan, ofreciendo un 50% de descuento en horas no pico. Asimismo, plataformas destacadas como Trae, Coze, Qoder y CodeBuddy han completado la primera fase de integración. Para el ecosistema de desarrolladores, la extrema eficiencia de tokens combinada con la programación flexible de recursos de cálculo reducirá drásticamente las barreras de despliegue de herramientas de automatización de código en los flujos de trabajo diarios.

Comparativa de rendimiento y eficiencia de tokens en Z.ai Code Bench Figura: Gráfico comparativo de rendimiento y eficiencia de tokens en Z.ai Code Bench. Fuente: Blog oficial de Z.ai

Una vulnerabilidad de hace 45 años vulnerada por la IA en dos horas

De forma sorprendente, cuando Zhipu sometió el modelo a un entrenamiento de refuerzo ambiental profundo para mejorar la generación de código, GLM-5.3 demostró una capacidad emergente asombrosa en el ámbito de la ciberseguridad. Escribir código de alta calidad y descomponer vulnerabilidades de software comparten la misma lógica de ingeniería: al comprender la trayectoria de ejecución del código, el modelo aprende de forma natural a detectar fallos en los sistemas.

En la prueba de referencia especializada en ciberseguridad CyberGym, GLM-5.3 logró un 84,5% de puntuación, obteniendo la primera posición entre los modelos de código abierto y superando a Mythos 5 (83,8%) y GPT-5.6 Sol (83,6%). En ExploitBench, su puntuación se disparó del 24,4% anterior al 54,4%. En ExploitGym, GLM-5.3 completó 105 tareas de explotación en solo 2 horas, casi cuatro veces más que las 29 tareas completadas por GLM-5.2 en el mismo periodo. Este impresionante conjunto de datos demuestra que la ciberseguridad ofensiva y defensiva automatizada ha pasado de ser un concepto teórico a una herramienta de alta eficiencia con amenazas reales.

En colaboraciones prácticas con múltiples equipos de seguridad en China, GLM-5.3 analizó 269 proyectos de código abierto de referencia, descubriendo de golpe 2.436 vulnerabilidades reales, de las cuales 107 eran críticas y 990 de alto riesgo. Lo más inquietante es que la vulnerabilidad más antigua se introdujo en el código en 1981 y permaneció oculta a la vista de la comunidad de código abierto durante 45 años. El tiempo medio de latencia de todas las vulnerabilidades encontradas alcanzó los 26,6 años. Cuando esquinas oscuras que los auditores humanos no detectaron durante décadas son expuestas masivamente por la IA, el sistema tradicional de defensa de la cadena de suministro de software se enfrenta a una presión de reestructuración sin precedentes.

Gráfico de evaluación de capacidades de ciberseguridad Figura: Evaluación del rendimiento de GLM-5.3 en entornos de prueba de ciberseguridad. Fuente: Blog oficial de Z.ai

Ataques demasiado rápidos: los defensores se ven obligados a pausar el lanzamiento

Esta capacidad destructiva en el descubrimiento de fallos sumió rápidamente al equipo de desarrollo en un dilema. La naturaleza de doble uso de la IA se amplificó al máximo en este momento: la misma capacidad lógica que sirve para reparar fallos de software puede ser utilizada por atacantes maliciosos para automatizar ataques de día cero.

Ante los riesgos potenciales de ciberseguridad, Zhipu tomó una decisión poco habitual: posponer el lanzamiento de los pesos en código abierto y el despliegue de las API. De las 2.436 vulnerabilidades descubiertas, solo 53 se han divulgado públicamente, mientras que las 2.383 restantes siguen en un periodo de reparación estrictamente confidencial. La liberación de los pesos del modelo se ha aplazado dos semanas y la apertura de las API se realizará de forma gradual. La compañía declaró explícitamente que es necesario completar el reforzamiento de seguridad esencial para preservar el valor defensivo de la IA al tiempo que se limitan las posibles capacidades de ataque, lo que marca la primera vez que la evolución de la IA se frena activamente debido a sobrecarga de seguridad.

Revisando el contexto previo, Tang Jie, científico jefe de Zhipu, ya había solicitado públicamente sugerencias sobre GLM-5.3 en la red social X el 29 de junio. Además, el ritmo de lanzamientos en la comunidad china de modelos de lenguaje ha sido excepcionalmente intenso, con modelos punteros como Qwen3.8 y DeepSeek V4 Pro apareciendo de forma consecutiva. En un entorno de competencia feroz, la decisión de Zhipu de retener los pesos aun a costa de perder velocidad de lanzamiento sienta un precedente que sitúa el cumplimiento de la seguridad por encima del avance técnico acelerado.

El paradigma de captura bajo el techo de capacidad de cómputo

El lanzamiento de GLM-5.3 muestra la perspicacia de los modelos chinos para romper barreras en entornos complejos. Observamos que, en una situación en la que no resulta sencillo expandir la potencia de cómputo para el preentrenamiento de vanguardia, los equipos de ingeniería son capaces de exprimir al máximo el potencial de los modelos base existentes mediante posentrenamiento fino y aprendizaje por refuerzo en tareas de larga duración, alcanzando el nivel de los mejores modelos globales en escenarios específicos de productividad.

Sin embargo, cuando la capacidad de comprensión de código de un modelo cruza involuntariamente el umbral de seguridad, la competición tecnológica deja de limitarse a las puntuaciones en las tablas de clasificación. Cómo liberar los beneficios de la programación automatizada evitando al mismo tiempo que la IA se transforme en una herramienta ofensiva incontrolable es un desafío que todos los equipos líderes deben afrontar.

GLM-5.3 ha demostrado una vía viable para acortar distancias basada en el escalado del posentrenamiento. A medida que las capacidades avanzan a mayor velocidad, aplicar frenos de forma proactiva para gestionar el riesgo es la única garantía para que los grandes modelos avancen con firmeza en los entornos de producción.


Enlaces de referencia:

  • Blog oficial de Z.ai
  • IT Home
  • Science and Technology Daily
  • Discusión en HN (item?id=49353407)