Muchas demostraciones de programación terminan antes de la parte difícil. El modelo dibuja una interfaz limpia o escribe una función plausible, se corta la cámara y nadie pregunta qué ocurre cuando falla la tercera dependencia. GLM-5.3 apunta a lo que viene después: leer el error, cambiar el plan, volver a experimentar y mantener la orientación hasta entregar un resultado comprobado.
Z.ai no construyó una base mayor. Conservó GLM-5.2 y escaló el postentrenamiento: más entornos ejecutables, más trabajos profesionales y más aprendizaje sobre trayectorias largas. La base se parece a un graduado brillante; el postentrenamiento, a su aprendizaje en el taller. Uno conoce la teoría y el otro enseña cuándo inspeccionar, probar o abandonar una mala idea.
Las cifras forman un relato coherente aunque procedan del proveedor. Terminal-Bench 3.0 sube de 4,6 a 28,3, DeepSWE de 46,2 a 66,9, SWE-Marathon de 19,4 a 42,5 y AutomationBench de 26,2 a 48,2. ALE-CLI alcanza 28,5. La amplitud importa más que proclamar una cifra como verdad total.
Code Bench añade la economía. En Max, 5.3 completa 34,5 % con unos 75.000 tokens por tarea, frente a 23,4 % con 96.000 de 5.2. En High llega a 31,4 % con 50.000, sobre el punto citado de Opus 4.8; Fable 5 conserva 39,5 %. Nadie fuera de Z.ai puede reproducir tareas privadas, pero la pregunta es correcta: cuánto trabajo verificado produce el agente por tiempo y tokens.
La segunda historia es cibernética. 84,5 % en CyberGym y 54,4 % en ExploitBench muestran un gran salto, aunque los líderes cerrados mantienen ventaja en explotación profunda. Para un equipo normal, el uso adecuado es defensivo: código autorizado en una caja aislada, reproducción, parche y regresiones. No concede permiso para probar sistemas ajenos.
El acceso es fácil e incompleto. Todos los Coding Plan y ZCode incluyen 5.3 desde 18 dólares de lista al mes; los puntos varían por entrada, caché, salida y horario. La API general sigue «próximamente», así que todavía no se compara bien por consumo.
El pensamiento es obligatorio. Low, high y max regulan el esfuerzo, pero una petición antigua con pensamiento apagado falla. Sumando falta de visión nativa y de pruebas independientes, el #6 es apropiado: un contendiente serio para sesiones largas, que debe competir con el agente actual bajo exactamente las mismas herramientas y pruebas.