Puesto #7 Programación — IA que Escribe Software de Producción
Z.ai (Zhipu AI)

GLM-5.3

Un agente de programación de pesos abiertos y gran tamaño, entrenado para la parte que viene después de la primera respuesta: planificar, editar, probar, recuperarse y mantener la orientación durante trabajos largos en repositorios.

Actualizado 30 de agosto de 2026 Coding AgentLong-Horizon1M Context

Actualización de la clasificación La clasificación de Programación se ha revisado desde la última actualización de esta reseña (30 de agosto de 2026). El puesto que aparece arriba siempre está al día. N.º 1 actual: GPT-6 Astra

Ideal para

Un agente de programación de pesos abiertos y gran tamaño, entrenado para la parte que viene después de la primera respuesta: planificar, editar, probar, recuperarse y mantener la orientación durante trabajos largos en repositorios.

Por qué gana

Artificial Analysis puntúa a GLM-5.3 con 59,5 en Inteligencia, 74,8 en Programación y 59,1 en trabajo agéntico, por encima de Qwen3.8-Max en los tres apartados. La clasificación pública más reciente de Terminal-Bench 4.0 sitúa a GLM tercero con 41,8%.

Ten en cuenta

El checkpoint oficial tiene aproximadamente 753B de parámetros totales y 40B activos, solo admite texto, razona siempre y ocupa unos 756 GB incluso en FP8. Muchas puntuaciones detalladas de programación y ciberseguridad siguen procediendo de pruebas de Z.ai, y la licencia personalizada no es MIT.

01

Lo que realmente es

La demostración de programación más fácil es la primera respuesta. Se pide una función, se observa cómo el modelo produce código ordenado y se detiene la grabación antes de que entren en conflicto las dependencias o las pruebas revelen una suposición equivocada. La ingeniería real comienza donde termina esa demostración. GLM-5.3 está construido para la segunda, la vigésima y la centésima acción: leer lo ocurrido, revisar el plan y conservar suficiente estado para terminar.

Z.ai afirma que el modelo fundacional es la misma base utilizada por GLM-5.2. La mejora procede del postentrenamiento en más entornos ejecutables y a lo largo de tareas profesionales más extensas. Imagina a un graduado con muchos conocimientos que empieza un periodo de aprendizaje. Quizá los datos que tiene en la cabeza no cambien demasiado, pero la práctica repetida le enseña cuándo medir, cuándo desconfiar de una hipótesis y cuándo deshacer un trabajo que cinco minutos antes parecía ingenioso.

Ese relato cuenta ahora con dos clases de respaldo. Z.ai comunica grandes avances en Terminal-Bench, DeepSWE, AutomationBench y baterías de seguridad. Más importante aún, Artificial Analysis sitúa de forma independiente a GLM-5.3 en 59,5 en Inteligencia, 74,8 en Programación y 59,1 en trabajo agéntico, por delante de Qwen3.8-Max, que obtiene 58,1, 71,8 y 58,4. La conclusión estable es que GLM debe estar por encima de Qwen para programar, aunque cada repositorio sigue mereciendo una prueba en igualdad de condiciones.

La publicación de los pesos el 28 de agosto cambia sustancialmente esta reseña. Antes de esa fecha, «pesos abiertos» describía una intención. Ahora se pueden inspeccionar los archivos FP8 y BF16, la configuración, la plantilla de chat y las recetas de servicio. Por fin es posible reproducir el modelo. No es una reproducibilidad barata: el checkpoint FP8 ocupa aproximadamente tres cuartos de terabyte y las recetas oficiales apuntan a máquinas con varias GPU de clase H200. Un modelo puede ser descargable y seguir necesitando una pequeña sala de máquinas.

La licencia merece la misma claridad. GLM-5.3 no es MIT. Su licencia personalizada permite de forma amplia usar, modificar, ajustar, desplegar y vender. La cláusula poco habitual se aplica cuando un licenciatario o una afiliada opera un negocio de Model-as-a-Service y supera los diez mil millones de dólares de ingresos agregados durante un periodo consecutivo de doce meses; ese operador debe superar la revisión de seguridad de Z.ai antes del uso comercial. La mayoría de las personas y los equipos de producto corrientes están muy lejos de ese umbral, pero aun así sería inexacto decir «código abierto sin condiciones».

Las etiquetas de los benchmarks importan. El 88,2 de Z.ai en Terminal-Bench 2.1 y la prueba independiente más baja pueden ser honestos a la vez, porque el modelo solo es uno de los participantes de un sistema agéntico. En la batería continua más reciente, Terminal-Bench 4.0, GLM-5.3 ocupa el tercer puesto con 41,8% ±3,2, por detrás de Opus 5 y Fable 5, pero por delante de GPT-5.6 Sol y Grok 4.6. Qwen3.8-Max no tiene ningún resultado publicado en la versión 4.0, así que esa ausencia refuerza la confianza en GLM sin convertirse en una comparación directa entre ambos.

En la práctica, el modelo alojado resulta más fácil de probar que los pesos. Acepta esfuerzo de razonamiento low, high o max y utiliza max de manera predeterminada. No se puede desactivar el pensamiento. Eso favorece los trabajos difíciles, pero también puede encarecer una ruta equivocada: un agente persistente solo es útil si persiste en dirección a las pruebas. Transmite las ejecuciones largas, limita los bucles, conserva correctamente el estado de razonamiento y exige pruebas antes de aceptar un mensaje de finalización.

Por tanto, GLM-5.3 merece una recomendación más firme que el día de su lanzamiento, aunque no una recomendación mágica. Es un motor serio de programación con pesos abiertos para equipos con trabajo exigente de terminal, contextos largos y presupuesto para una API o infraestructura de clúster. No es el mejor depurador visual ni el modelo privado más sencillo, y tampoco demuestra que todos los benchmarks del proveedor se trasladen a tu repositorio. Dale las mismas herramientas, presupuesto, pruebas y criterios de revisión que a tu modelo actual; después compara trabajo verificado, no prosa segura de sí misma.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Los trabajos largos son precisamente su razón de ser: GLM-5.3 está entrenado para diagnosticar, editar, usar herramientas, inspeccionar fallos y recuperarse a lo largo de trayectorias extensas. Eso se parece más al mantenimiento de una base de código real que a ganar un concurso de escribir funciones con un solo prompt.
  • La evidencia agregada independiente ya es sólida: Artificial Analysis lo sitúa en 59,5 en Inteligencia, 74,8 en Programación y 59,1 en trabajo agéntico. Qwen3.8-Max queda por detrás con 58,1, 71,8 y 58,4, respectivamente.
  • Los pesos están disponibles de verdad: Z.ai publicó checkpoints FP8 y BF16 el 28 de agosto. Ahora los equipos pueden inspeccionar, servir y reproducir el modelo, en lugar de tratar los pesos abiertos como una promesa futura.
  • La vía alojada es sencilla: Z.ai ofrece un contexto de 1M, niveles low/high/max de esfuerzo de razonamiento, interfaces compatibles con OpenAI y Anthropic, y precios de $1.40/M de entrada, $0.26/M de entrada en caché y $4.40/M de salida.

Limitaciones honestas

  • Pesos abiertos no significa tamaño de estación de trabajo: El repositorio FP8 oficial ocupa unos 756 GB, BF16 alrededor de 1,51 TB y los despliegues documentados emplean sistemas con varias GPU de clase H200. Es un modelo para un clúster privado, no una descarga para portátil.
  • La mayoría de los titulares sobre tareas concretas siguen siendo pruebas del proveedor: Terminal-Bench 3.0, DeepSWE, AutomationBench, CyberGym y el Code Bench privado de Z.ai utilizan arneses descritos, pero sensibles a la configuración. Son pruebas útiles, no puntuaciones universales.
  • Solo admite texto y siempre está pensando: El modelo no puede inspeccionar de forma nativa capturas de pantalla ni interfaces grabadas, y las solicitudes que desactivan el pensamiento fallan. El esfuerzo low ayuda en trabajos sencillos, pero cada petición sigue pagando cierta latencia de razonamiento.
  • La licencia exige leerla de verdad: El uso comercial está permitido de forma amplia, pero un operador de MaaS y sus afiliadas que superen $10B de ingresos durante cualquier periodo consecutivo de 12 meses deben pasar una revisión de seguridad de Z.ai. Conviene llamarlo modelo de pesos abiertos, no código abierto sin matices.
03

Resumen de Benchmarks

Artificial Analysis Intelligence / Coding / Agentic — 59,5 / 74,8 / 59,1

La evidencia compuesta independiente sitúa a GLM-5.3 por delante de Qwen3.8-Max, que obtiene 58,1 / 71,8 / 58,4, y respalda el nuevo orden de esta guía.

Terminal-Bench 2.1 — 88,2 del proveedor; aproximadamente 83,9 independiente

La diferencia enseña una lección útil sobre la sensibilidad al arnés. Hay que indicar el ejecutor y la configuración, en lugar de presentar una cifra como propiedad permanente del modelo.

Terminal-Bench 4.0 — 41,8% ±3,2, #3

La clasificación pública más reciente de terminal sitúa a GLM por detrás de Opus 5 y Fable 5, pero por delante de GPT-5.6 Sol y Grok 4.6. Qwen3.8-Max no tiene ningún resultado publicado, por lo que su ausencia aporta contexto, pero no constituye una comparación directa.

DeepSWE v1.1 — 66,9 (prueba de Z.ai)

Es una señal sólida para trabajos prolongados en repositorios con mini-swe-agent y un presupuesto de seis horas, aunque todavía no se ha reproducido de forma independiente en el artefacto público oficial.

GDPval-AA v2 — grupo líder, Elo en vivo

Capturas recientes sitúan a GLM-5.3 alrededor de la zona media de los 1700, con intervalos de confianza que se solapan con GLM Flash y otros líderes. Hay que fechar la consulta porque el Elo se recalcula.

04

El Veredicto

GLM-5.3 sube al puesto #5 de Programación con un 9,2, por detrás de Grok 4.6 en el #4 y por delante de Qwen3.8-Max en el #6 y GLM-5.3-Flash en el #7. El cambio se apoya en la evidencia: GLM supera a Qwen en los índices de Inteligencia, Programación y trabajo agéntico de Artificial Analysis, además de en los resultados de Terminal-Bench 2.1 y DeepSWE de la misma tabla de Z.ai. Elígelo para trabajos difíciles y prolongados de texto y terminal cuando puedas asumir el coste de la API o del clúster; elige Flash cuando importen más la entrada multimodal y el coste.

05

Preguntas frecuentes