Imagine mejorar un gran taller sin agrandar el edificio. Las herramientas siguen donde estaban; los trabajadores aprenden a ordenar un encargo difícil, comprobar avances y cambiar de plan tras un fallo. Esa es la idea central de GLM-5.3: la misma base de GLM-5.2, con un mes de postentrenamiento escalado para ingeniería e investigación prolongadas.
La diferencia importa para la IA privada. El tamaño del modelo se parece a un alquiler: cada parámetro adicional exige almacenamiento, ancho de banda y operación. 5.3 no abarata el enorme «alquiler» de 5.2, pero promete más capacidad dentro del mismo edificio. Z.ai habla de 744.000 millones de parámetros, unos 40.000 millones activos y más entornos, tareas y RL mediante SAO y slime.
El patrón de resultados encaja, de forma provisional. Terminal-Bench 3.0 pasa de 4,6 a 28,3, DeepSWE de 46,2 a 66,9 y AutomationBench de 26,2 a 48,2. No son exámenes de completar una línea: exigen usar herramientas, leer resultados y corregir el rumbo. Un modelo puede brillar una vez y perderse tras veinte llamadas; este entrenamiento combate precisamente esa deriva.
Los datos de seguridad impresionan y también se prestan a exageración. 84,5 % en CyberGym lidera el descubrimiento y la validación en la tabla de Z.ai. La explotación profunda es otra montaña: 54,4 % en ExploitBench duplica a 5.2, pero Fable 5 alcanza 78,0 y Sol 76,5. Encuentra mejor las puertas peligrosas; los mejores cerrados recorren mejor el laberinto posterior.
Z.ai publica además un registro de 2.436 hallazgos en 269 proyectos tras revisión y deduplicación, con 53 casos públicos al lanzar. Sigue siendo evidencia dirigida por el proveedor, pero un registro vivo con proyectos y casos inspeccionables vale más que una frase triunfal.
La palabra local exige precisión. En el día del lanzamiento no hay descarga. Los pesos llegarían en dos semanas después de endurecimiento; no hay licencia anunciada y la API general también está pendiente. El acceso actual es Coding Plan y ZCode. «Pesos pendientes» es la descripción honesta.
Si Z.ai cumple, el despliegue debería parecerse a GLM-5.2: muchísima memoria, software de servicio maduro y cuantización cuidadosa. Los operadores de 5.2 tendrán ventaja, pero nadie puede validar memoria o pérdida de calidad sin archivos. Por eso ocupa el #2 provisional; DeepSeek V4 Flash conserva el primer consejo porque hoy sí se puede descargar y ejecutar.