تخيل ورشة قوية تتحسن من دون أن تكبر مساحتها. تبقى الأدوات في أماكنها، لكن العاملين يتعلمون تنظيم مهمة صعبة، وفحص التقدم، وتغيير الخطة بعد الفشل. هذه هي فكرة GLM-5.3 الأساسية: قاعدة GLM-5.2 نفسها، مع شهر من توسيع ما بعد التدريب لمهام الهندسة والبحث الطويلة.
هذا الفرق مهم للذكاء الخاص. حجم النموذج يشبه الإيجار؛ كل معلمة إضافية تحتاج تخزينًا وعرض نطاق وتشغيلًا. لا يخفض 5.3 إيجار 5.2 المرتفع، لكنه يعد بقدرة أكبر داخل المبنى نفسه. تتحدث Z.ai عن 744 مليار معلمة إجمالية ونحو 40 مليارًا نشطة، مع بيئات أكثر وتنوع أكبر وتعلم معزز عبر SAO وslime.
يتوافق نمط النتائج مع هذه الرواية مبدئيًا. يرتفع Terminal-Bench 3.0 من 4.6 إلى 28.3، وDeepSWE من 46.2 إلى 66.9، وAutomationBench من 26.2 إلى 48.2. هذه ليست أسئلة إكمال سطر؛ على الوكيل استخدام الأدوات وقراءة النتيجة وتصحيح المسار. قد يبدو نموذج ذكيًا في جواب واحد ثم يضيع بعد عشرين خطوة، والتدريب يستهدف هذا الانحراف.
نتائج الأمن مثيرة لكنها سهلة المبالغة. يحقق 84.5% في CyberGym ليتصدر الاكتشاف والتحقق في جدول Z.ai. أما الاستغلال العميق فجبل آخر: يضاعف 54.4% في ExploitBench نتيجة 5.2، بينما يصل Fable 5 إلى 78.0 وSol إلى 76.5. صار أفضل في العثور على الأبواب الخطرة، لكن أفضل النماذج المغلقة ما زالت أفضل في عبور المتاهة وراءها.
تنشر Z.ai أيضًا سجلًا يتابع 2,436 اكتشافًا في 269 مشروعًا بعد المراجعة وإزالة التكرار، منها 53 حالة عامة عند الإطلاق. يظل الدليل بقيادة المورّد، لكن سجلًا حيًا يمكن فحصه أفضل من جملة انتصار مبهمة.
تحتاج كلمة محلي إلى الدقة. لا يوجد تنزيل يوم الإطلاق. الأوزان موعودة بعد أسبوعين، ولم تُذكر الرخصة، والـAPI العامة قادمة لاحقًا. الوصول الحالي هو Coding Plan وZCode. وعد بملف ليس ملفًا موجودًا على خادمك.
إذا نفذت Z.ai وعدها، فسيشبه النشر GLM-5.2: ذاكرة هائلة وبرامج تشغيل ناضجة وتكميم حذر. من يشغّل 5.2 سيبدأ أسرع، لكن لا يمكن قياس الذاكرة أو خسارة الجودة قبل وصول الملفات. لذلك يحتل المركز الثاني مؤقتًا؛ يبقى DeepSeek V4 Flash التوصية الأولى الصادقة لأنه قابل للتنزيل والتشغيل الآن.