Puesto #6 Programación — IA que Escribe Software de Producción
Z.ai (Zhipu AI)

GLM-5.3

Un salto de postentrenamiento sobre la misma base, pensado para lo que ocurre después de la primera respuesta. GLM-5.3 intenta planificar, editar, probar y recuperarse durante trabajos largos. Sus cifras y capacidad cibernética son fuertes, pero casi toda la evidencia es del día de lanzamiento.

Actualizado 14 de agosto de 2026 Coding AgentLong-Horizon1M Context Evals
Ideal para

Un salto de postentrenamiento sobre la misma base, pensado para lo que ocurre después de la primera respuesta. GLM-5.3 intenta planificar, editar, probar y recuperarse durante trabajos largos. Sus cifras y capacidad cibernética son fuertes, pero casi toda la evidencia es del día de lanzamiento.

Por qué gana

Z.ai informa 28,3 en Terminal-Bench 3.0, 66,9 en DeepSWE, 42,5 en SWE-Marathon, 48,2 en AutomationBench y 28,5 en ALE-CLI. Su Code Bench privado muestra más finalización con menos tokens que 5.2 y que Opus 4.8 en puntos concretos.

Ten en cuenta

Aún no hay pruebas independientes ni API general y Coding Plan es el acceso principal. Es texto primero, no permite apagar el razonamiento y sigue detrás de sistemas cerrados en varias pruebas profundas.

01

Lo que realmente es

Muchas demostraciones de programación terminan antes de la parte difícil. El modelo dibuja una interfaz limpia o escribe una función plausible, se corta la cámara y nadie pregunta qué ocurre cuando falla la tercera dependencia. GLM-5.3 apunta a lo que viene después: leer el error, cambiar el plan, volver a experimentar y mantener la orientación hasta entregar un resultado comprobado.

Z.ai no construyó una base mayor. Conservó GLM-5.2 y escaló el postentrenamiento: más entornos ejecutables, más trabajos profesionales y más aprendizaje sobre trayectorias largas. La base se parece a un graduado brillante; el postentrenamiento, a su aprendizaje en el taller. Uno conoce la teoría y el otro enseña cuándo inspeccionar, probar o abandonar una mala idea.

Las cifras forman un relato coherente aunque procedan del proveedor. Terminal-Bench 3.0 sube de 4,6 a 28,3, DeepSWE de 46,2 a 66,9, SWE-Marathon de 19,4 a 42,5 y AutomationBench de 26,2 a 48,2. ALE-CLI alcanza 28,5. La amplitud importa más que proclamar una cifra como verdad total.

Code Bench añade la economía. En Max, 5.3 completa 34,5 % con unos 75.000 tokens por tarea, frente a 23,4 % con 96.000 de 5.2. En High llega a 31,4 % con 50.000, sobre el punto citado de Opus 4.8; Fable 5 conserva 39,5 %. Nadie fuera de Z.ai puede reproducir tareas privadas, pero la pregunta es correcta: cuánto trabajo verificado produce el agente por tiempo y tokens.

La segunda historia es cibernética. 84,5 % en CyberGym y 54,4 % en ExploitBench muestran un gran salto, aunque los líderes cerrados mantienen ventaja en explotación profunda. Para un equipo normal, el uso adecuado es defensivo: código autorizado en una caja aislada, reproducción, parche y regresiones. No concede permiso para probar sistemas ajenos.

El acceso es fácil e incompleto. Todos los Coding Plan y ZCode incluyen 5.3 desde 18 dólares de lista al mes; los puntos varían por entrada, caché, salida y horario. La API general sigue «próximamente», así que todavía no se compara bien por consumo.

El pensamiento es obligatorio. Low, high y max regulan el esfuerzo, pero una petición antigua con pensamiento apagado falla. Sumando falta de visión nativa y de pruebas independientes, el #6 es apropiado: un contendiente serio para sesiones largas, que debe competir con el agente actual bajo exactamente las mismas herramientas y pruebas.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Entrenado para encargos completos: Los entornos imitan días de trabajo: diagnosticar, cambiar una pila real, experimentar, conservar corrección y entregar una mejora medible.
  • Mejoras públicas amplias: Terminal-Bench, DeepSWE, SWE-Marathon, AutomationBench y ALE-CLI suben. Varias familias de tareas largas pesan más que un único arnés afortunado.
  • Curva privada de eficiencia prometedora: Max logra 34,5 % con ~75K tokens frente a 23,4 % con 96K de 5.2; High consigue 31,4 % con 50K y supera el punto citado de Opus 4.8. Fable 5 aún gana en calidad máxima.
  • La habilidad cibernética ayuda a la defensa: Encontrar, validar y parchear fallos sirve para revisión segura. El 84,5 % de CyberGym y 2.436 hallazgos revisados son señal seria si se usa con autorización y aislamiento.
  • Funciona con agentes conocidos: Todos los niveles de Coding Plan y ZCode lo ofrecen; Z.ai anuncia compatibilidad con Claude Code, OpenCode y otros clientes. Low, high y max gradúan el esfuerzo.

Limitaciones honestas

  • Las tablas de lanzamiento no son consenso: Z.ai documenta arneses y límites, pero ejecutó o reunió la mayoría. Faltan pruebas públicas con igual coste y repositorio.
  • No barre a la frontera: Fable 5 y Sol lideran Terminal-Bench 3.0, Sol DeepSWE, Kimi K3 y Opus SWE-Marathon, y Fable el Code Bench privado en Max.
  • Acceso incompleto: Coding Plan parte de 18 dólares, pero usa puntos según token y horario. Sin API general no hay comparación limpia por uso.
  • Pensar es obligatorio: thinking.type: disabled falla. Es un cambio incompatible y añade latencia incluso cuando solo se desea una edición sencilla.
  • No se anuncia flujo visual nativo: Capturas, diagramas y vídeos de interfaz requieren una herramienta de visión externa o un modelo multimodal.
03

Resumen de Benchmarks

Terminal-Bench 3.0 — 28,3 (Z.ai)

Más de seis veces 4,6, pero bajo Fable 5 con 33,7 y Sol con 34,6.

DeepSWE v1.1 — 66,9 (Z.ai)

20,7 puntos sobre 5.2, cerca de Kimi K3 con 67,5 y bajo Sol con 72,7.

SWE-Marathon v1.1 — 42,5 (Z.ai)

Más del doble de 19,4 y empatado con Sol; Kimi K3 y Opus 4.8 quedan delante.

AutomationBench v1.0.6 — 48,2 (Z.ai)

Mayor cifra de la tabla y buena señal de automatización, pendiente de réplica.

Z.ai Code Bench — 34,5 % en Max (privado)

Más finalización con menos tokens que 5.2; al ser privado es evidencia de producto, no récord reproducible.

04

El Veredicto

GLM-5.3 entra #6 en Programación con 9,2. La posición queda deliberadamente por debajo de su mejor cifra: la evidencia es amplia y documentada, pero todavía no independiente. Es gran candidato para repositorios largos, terminal y revisión defensiva. Compárelo con el agente actual usando el mismo repositorio, herramientas, tiempo, pruebas y revisión. Si entrega más trabajo verificado por token, la mejora es real para su equipo.

05

Preguntas frecuentes