Puesto #3 IA Local / Privada — Tu Cerebro en tu Hardware
Z.ai (Zhipu AI)

GLM-5.3

El modelo local más interesante que todavía no se puede descargar. GLM-5.3 conserva la base MoE de 744B de GLM-5.2 y obtiene un gran salto en programación y agentes solo mediante postentrenamiento. Z.ai promete los pesos unas dos semanas después del lanzamiento; hasta entonces es un servicio alojado con futuro local creíble.

Actualizado 14 de agosto de 2026 Weights Pending1M Context Evals744B MoE
Ideal para

El modelo local más interesante que todavía no se puede descargar. GLM-5.3 conserva la base MoE de 744B de GLM-5.2 y obtiene un gran salto en programación y agentes solo mediante postentrenamiento. Z.ai promete los pesos unas dos semanas después del lanzamiento; hasta entonces es un servicio alojado con futuro local creíble.

Por qué gana

Z.ai informa 28,3 en Terminal-Bench 3.0, 66,9 en DeepSWE v1.1, 48,2 en AutomationBench y 84,5 % en CyberGym. Afirma que toda la mejora viene de escalar entornos de RL de largo recorrido, no de ampliar la base de 744B/~40B activos.

Ten en cuenta

En el lanzamiento no hay pesos públicos, licencia anunciada ni API general; el acceso pasa por Coding Plan y ZCode. La mayoría de cifras son del proveedor, el modelo sigue exigiendo hardware de centro de datos y no se anuncia visión nativa.

01

Lo que realmente es

Imagine mejorar un gran taller sin agrandar el edificio. Las herramientas siguen donde estaban; los trabajadores aprenden a ordenar un encargo difícil, comprobar avances y cambiar de plan tras un fallo. Esa es la idea central de GLM-5.3: la misma base de GLM-5.2, con un mes de postentrenamiento escalado para ingeniería e investigación prolongadas.

La diferencia importa para la IA privada. El tamaño del modelo se parece a un alquiler: cada parámetro adicional exige almacenamiento, ancho de banda y operación. 5.3 no abarata el enorme «alquiler» de 5.2, pero promete más capacidad dentro del mismo edificio. Z.ai habla de 744.000 millones de parámetros, unos 40.000 millones activos y más entornos, tareas y RL mediante SAO y slime.

El patrón de resultados encaja, de forma provisional. Terminal-Bench 3.0 pasa de 4,6 a 28,3, DeepSWE de 46,2 a 66,9 y AutomationBench de 26,2 a 48,2. No son exámenes de completar una línea: exigen usar herramientas, leer resultados y corregir el rumbo. Un modelo puede brillar una vez y perderse tras veinte llamadas; este entrenamiento combate precisamente esa deriva.

Los datos de seguridad impresionan y también se prestan a exageración. 84,5 % en CyberGym lidera el descubrimiento y la validación en la tabla de Z.ai. La explotación profunda es otra montaña: 54,4 % en ExploitBench duplica a 5.2, pero Fable 5 alcanza 78,0 y Sol 76,5. Encuentra mejor las puertas peligrosas; los mejores cerrados recorren mejor el laberinto posterior.

Z.ai publica además un registro de 2.436 hallazgos en 269 proyectos tras revisión y deduplicación, con 53 casos públicos al lanzar. Sigue siendo evidencia dirigida por el proveedor, pero un registro vivo con proyectos y casos inspeccionables vale más que una frase triunfal.

La palabra local exige precisión. En el día del lanzamiento no hay descarga. Los pesos llegarían en dos semanas después de endurecimiento; no hay licencia anunciada y la API general también está pendiente. El acceso actual es Coding Plan y ZCode. «Pesos pendientes» es la descripción honesta.

Si Z.ai cumple, el despliegue debería parecerse a GLM-5.2: muchísima memoria, software de servicio maduro y cuantización cuidadosa. Los operadores de 5.2 tendrán ventaja, pero nadie puede validar memoria o pérdida de calidad sin archivos. Por eso ocupa el #2 provisional; DeepSeek V4 Flash conserva el primer consejo porque hoy sí se puede descargar y ejecutar.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Mejora real sobre la misma base: Más entornos, tareas variadas y cómputo de postentrenamiento con SAO y slime producen el salto. Eso promete más capacidad sin aumentar el tamaño que deberá alojarse.
  • La programación prolongada es el centro: Terminal-Bench 3.0 sube de 4,6 a 28,3, DeepSWE de 46,2 a 66,9 y AutomationBench de 26,2 a 48,2; son trabajos donde hay que actuar, comprobar y corregir.
  • La futura ruta de despliegue debería resultar familiar: La base sin cambios permite usar la infraestructura de GLM-5.2 como estimación: mucha memoria unificada o varias GPU, no un portátil corriente.
  • La evidencia de seguridad es concreta: Z.ai declara 84,5 % en CyberGym y 54,4 % en ExploitBench. Su registro público sigue 2.436 hallazgos revisados en 269 proyectos, 53 ya divulgados al lanzar.
  • Se puede probar alojado mientras llegan los pesos: Todos los niveles de Coding Plan y ZCode ofrecen 5.3, de modo que un equipo puede evaluarlo con sus repositorios antes de pagar el hardware.

Limitaciones honestas

  • Hoy no es local: Z.ai promete publicar los pesos unas dos semanas después del 14 de agosto. Hasta entonces, «pesos abiertos» es una promesa, no el producto disponible.
  • La licencia se desconoce: Que 5.2 tuviera términos permisivos no garantiza los de 5.3. Hay que esperar la ficha del modelo y la licencia real.
  • El coste de hardware sigue siendo enorme: 744B parámetros totales y unos 40B activos apuntan a memoria de clase 256GB o varias GPU incluso con cuantización agresiva.
  • Falta reproducción independiente: Z.ai documenta bien los arneses, pero ejecutó o recopiló casi todas las cifras. La participación externa en pruebas concretas no valida todavía el conjunto.
  • Texto primero y razonamiento obligatorio: No se anuncia visión nativa y ya no se puede apagar el pensamiento. Low, high y max permiten graduarlo, no eliminar su latencia.
03

Resumen de Benchmarks

Terminal-Bench 3.0 — 28,3 (prueba de Z.ai)

Gran salto desde 4,6; Fable 5 con 33,7 y GPT-5.6 Sol con 34,6 siguen por delante.

DeepSWE v1.1 — 66,9 (prueba de Z.ai)

Sube desde 46,2 y roza a Kimi K3 con 67,5; Sol lidera la comparación con 72,7.

AutomationBench v1.0.6 — 48,2 (prueba de Z.ai)

El salto desde 26,2 respalda la tesis de trabajo prolongado.

CyberGym — 84,5 % (prueba de Z.ai)

Mejor valor de descubrimiento en la tabla; no mide toda la cadena de explotación.

ExploitBench — 54,4 % (prueba de Z.ai)

Más del doble de 24,4, pero lejos de Fable 5 con 78,0 y Sol con 76,5.

04

El Veredicto

GLM-5.3 entra #2 en IA local/privada: por encima de GLM-5.2, pero debajo del más pequeño DeepSeek V4 Flash, que sí puede descargarse. Su trayectoria es magnífica, pero local significa posesión, no intención. Sin pesos ni licencia no merece el #1. Conviene probarlo en Coding Plan y decidir el despliegue solo cuando existan ficha, licencia, sumas, soporte y pruebas independientes cuantizadas.

05

Preguntas frecuentes