الترتيب #6 البرمجة — ذكاء اصطناعي يكتب شيفرة إنتاجية
Z.ai (Zhipu AI)

GLM-5.3

قفزة ما بعد تدريب على القاعدة نفسها، مصممة للجزء الذي يأتي بعد الإجابة الأولى. يخطط GLM-5.3 ويعدل ويختبر ويتعافى خلال مهام طويلة. نتائج الإطلاق والقدرة السيبرانية قوية، لكن الأدلة كلها تقريبًا من يوم الإطلاق.

تم التحديث 14 أغسطس 2026 Coding AgentLong-Horizon1M Context Evals
الأفضل لـ

قفزة ما بعد تدريب على القاعدة نفسها، مصممة للجزء الذي يأتي بعد الإجابة الأولى. يخطط GLM-5.3 ويعدل ويختبر ويتعافى خلال مهام طويلة. نتائج الإطلاق والقدرة السيبرانية قوية، لكن الأدلة كلها تقريبًا من يوم الإطلاق.

لماذا تفوز

تعلن Z.ai عن 28.3 في Terminal-Bench 3.0 و66.9 في DeepSWE و42.5 في SWE-Marathon و48.2 في AutomationBench و28.5 في ALE-CLI. ويظهر Code Bench الخاص إنجازًا أعلى بتوكنات أقل من 5.2 ومن Opus 4.8 في نقاط مختارة.

انتبه إلى

لا توجد اختبارات مستقلة أو API عامة بعد، وCoding Plan هو المدخل الأساسي. النموذج نصي، ولا يسمح بتعطيل التفكير، وما زال خلف نماذج مغلقة في عدة اختبارات عميقة.

01

ما هو في الواقع

تنتهي عروض برمجة كثيرة قبل الجزء الصعب. يرسم النموذج واجهة نظيفة أو يكتب دالة مقنعة، ثم تتوقف الكاميرا ولا يسأل أحد ماذا يحدث عندما يفشل اختبار الاعتماد الثالث. يستهدف GLM-5.3 ما بعد ذلك: قراءة الخطأ، وتغيير الخطة، وإجراء تجربة أخرى، والحفاظ على الاتجاه حتى تسليم نتيجة مختبرة.

لم تبن Z.ai قاعدة أكبر. احتفظت بقاعدة 5.2 ووسعت ما بعد التدريب: بيئات قابلة للتنفيذ أكثر، وأنواع عمل مهني أكثر، وحوسبة لمسارات طويلة. تشبه القاعدة خريجًا موهوبًا، ويشبه ما بعد التدريب فترة التدريب المهني. الأول يعرف لغة الهندسة؛ والثاني يتعلم متى يفحص ويختبر ويتخلى عن فكرة سيئة.

ترسم الأرقام قصة متماسكة وإن كانت من المورّد. يرتفع Terminal-Bench من 4.6 إلى 28.3، وDeepSWE من 46.2 إلى 66.9، وSWE-Marathon من 19.4 إلى 42.5، وAutomationBench من 26.2 إلى 48.2. يصل ALE-CLI إلى 28.5. التنوع أهم من إعلان رقم واحد حقيقة كاملة.

يضيف Code Bench الخاص زاوية التكلفة. عند Max ينجز 5.3 نسبة 34.5% بنحو 75 ألف توكن، مقابل 23.4% و96 ألفًا لـ5.2. عند High يبلغ 31.4% بنحو 50 ألفًا، فوق نقطة Opus المذكورة، بينما يبقى Fable 5 عند 39.5%. لا يمكن للخارج إعادة الاختبار، لكن السؤال صحيح: كم عملًا متحققًا ينتجه الوكيل لكل وقت وتوكن؟

القصة الثانية هي الأمن. يسجل 84.5% في CyberGym و54.4% في ExploitBench، مع بقاء النماذج المغلقة متقدمة في الاستغلال العميق. الاستخدام المناسب دفاعي: كود مصرح به داخل عزل، إعادة إنتاج، إصلاح، واختبارات رجوع. لا يمنح ذلك إذنًا لاختبار أنظمة الآخرين.

يتاح 5.3 في كل Coding Plan وZCode بدءًا من 18 دولارًا شهريًا، لكن النقاط تختلف للمدخل والكاش والمخرج والوقت. API العامة قادمة، لذا المقارنة حسب الاستخدام غير واضحة.

وأخيرًا، التفكير إجباري. تضبط low وhigh وmax الجهد، لكن الطلب القديم الذي يعطله يفشل. مع غياب رؤية أصلية واختبارات مستقلة، يناسبه المركز السادس: منافس جاد للجلسات الطويلة يجب اختباره أمام الوكيل الحالي بالأدوات والاختبارات نفسها.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • مُدرّب لإنهاء العمل: تحاكي البيئات أيامًا من العمل الخبير: تشخيص عنق الزجاجة، تعديل منظومة حقيقية، التجربة، الحفاظ على الصحة، وتسليم تحسن قابل للقياس.
  • مكاسب واسعة: تتحسن Terminal-Bench وDeepSWE وSWE-Marathon وAutomationBench وALE-CLI؛ تنوع المهام الطويلة أقوى من نتيجة واحدة مواتية.
  • منحنى كفاءة واعد: يحقق Max نسبة 34.5% عند ~75K توكن مقابل 23.4% عند 96K لـ5.2؛ ويحقق High نسبة 31.4% عند 50K ويتجاوز نقطة Opus المذكورة، مع بقاء Fable 5 أعلى جودة.
  • المهارة السيبرانية تخدم الدفاع: اكتشاف الثغرة والتحقق منها وإصلاحها مفيد للمراجعة الآمنة. 84.5% في CyberGym و2,436 اكتشافًا مراجعًا إشارة جدية عند الاستخدام المصرح والمعزول.
  • يعمل مع وكلاء مألوفين: يتاح في كل Coding Plan وZCode، وتعلن Z.ai دعم Claude Code وOpenCode وغيرهما. تضبط low وhigh وmax الجهد.

قيود صادقة

  • جداول الإطلاق ليست إجماعًا: توثق Z.ai الإعدادات، لكنها نفذت أو جمعت معظم النتائج. نحتاج اختبارات عامة بالمستودع والتكلفة نفسيهما.
  • لا يفوز بكل شيء: يتقدم Fable 5 وSol في Terminal-Bench 3.0، وSol في DeepSWE، وKimi K3 وOpus في SWE-Marathon، وFable في Code Bench الخاص.
  • الوصول غير مكتمل: يبدأ Coding Plan من 18 دولارًا، لكن النقاط تختلف حسب نوع التوكن والوقت. بلا API عامة لا توجد مقارنة دفع واضحة.
  • التفكير إلزامي: يفشل thinking.type: disabled. إنه تغيير كاسر يزيد زمن المهام البسيطة ويتطلب ترحيل التكامل.
  • لا توجد رؤية أصلية معلنة: تحتاج لقطات الشاشة والمخططات وتسجيلات الواجهة إلى أداة رؤية خارجية أو نموذج متعدد الوسائط.
03

لمحة عن المعايير

Terminal-Bench 3.0 — 28.3 (Z.ai)

أكثر من ستة أضعاف 4.6، لكنه تحت Fable 5 عند 33.7 وSol عند 34.6.

DeepSWE v1.1 — 66.9 (Z.ai)

+20.7 نقطة، قريب من Kimi K3 عند 67.5 وتحت Sol عند 72.7.

SWE-Marathon v1.1 — 42.5 (Z.ai)

أكثر من ضعف 19.4 ومتعادل مع Sol؛ Kimi K3 وOpus 4.8 أعلى.

AutomationBench v1.0.6 — 48.2 (Z.ai)

أعلى رقم في الجدول وإشارة أتمتة مفيدة تنتظر التكرار.

Z.ai Code Bench — 34.5% عند Max (خاص)

إنجاز أعلى بتوكنات أقل من 5.2؛ دليل منتج لا سجل عام قابل للتكرار.

04

الحكم

يدخل GLM-5.3 المركز السادس في البرمجة بتقييم 9.2. رتبته أقل عمدًا من أفضل أرقامه: الأدلة واسعة وموثقة، لكنها ليست مستقلة بعد. إنه مرشح ممتاز للمستودعات الطويلة والطرفية والمراجعة الدفاعية. قارنه على المستودع والأدوات والوقت والاختبارات والمراجعة نفسها. إذا أنجز عملًا متحققًا أكثر لكل توكن، فالقفزة حقيقية لفريقك.

05

الأسئلة الشائعة