تنتهي عروض برمجة كثيرة قبل الجزء الصعب. يرسم النموذج واجهة نظيفة أو يكتب دالة مقنعة، ثم تتوقف الكاميرا ولا يسأل أحد ماذا يحدث عندما يفشل اختبار الاعتماد الثالث. يستهدف GLM-5.3 ما بعد ذلك: قراءة الخطأ، وتغيير الخطة، وإجراء تجربة أخرى، والحفاظ على الاتجاه حتى تسليم نتيجة مختبرة.
لم تبن Z.ai قاعدة أكبر. احتفظت بقاعدة 5.2 ووسعت ما بعد التدريب: بيئات قابلة للتنفيذ أكثر، وأنواع عمل مهني أكثر، وحوسبة لمسارات طويلة. تشبه القاعدة خريجًا موهوبًا، ويشبه ما بعد التدريب فترة التدريب المهني. الأول يعرف لغة الهندسة؛ والثاني يتعلم متى يفحص ويختبر ويتخلى عن فكرة سيئة.
ترسم الأرقام قصة متماسكة وإن كانت من المورّد. يرتفع Terminal-Bench من 4.6 إلى 28.3، وDeepSWE من 46.2 إلى 66.9، وSWE-Marathon من 19.4 إلى 42.5، وAutomationBench من 26.2 إلى 48.2. يصل ALE-CLI إلى 28.5. التنوع أهم من إعلان رقم واحد حقيقة كاملة.
يضيف Code Bench الخاص زاوية التكلفة. عند Max ينجز 5.3 نسبة 34.5% بنحو 75 ألف توكن، مقابل 23.4% و96 ألفًا لـ5.2. عند High يبلغ 31.4% بنحو 50 ألفًا، فوق نقطة Opus المذكورة، بينما يبقى Fable 5 عند 39.5%. لا يمكن للخارج إعادة الاختبار، لكن السؤال صحيح: كم عملًا متحققًا ينتجه الوكيل لكل وقت وتوكن؟
القصة الثانية هي الأمن. يسجل 84.5% في CyberGym و54.4% في ExploitBench، مع بقاء النماذج المغلقة متقدمة في الاستغلال العميق. الاستخدام المناسب دفاعي: كود مصرح به داخل عزل، إعادة إنتاج، إصلاح، واختبارات رجوع. لا يمنح ذلك إذنًا لاختبار أنظمة الآخرين.
يتاح 5.3 في كل Coding Plan وZCode بدءًا من 18 دولارًا شهريًا، لكن النقاط تختلف للمدخل والكاش والمخرج والوقت. API العامة قادمة، لذا المقارنة حسب الاستخدام غير واضحة.
وأخيرًا، التفكير إجباري. تضبط low وhigh وmax الجهد، لكن الطلب القديم الذي يعطله يفشل. مع غياب رؤية أصلية واختبارات مستقلة، يناسبه المركز السادس: منافس جاد للجلسات الطويلة يجب اختباره أمام الوكيل الحالي بالأدوات والاختبارات نفسها.