الترتيب #3 ذكاء اصطناعي محلي / خاص — عقلك، جهازك، قواعدك
Z.ai (Zhipu AI)

GLM-5.3

أكثر نموذج محلي إثارة للاهتمام لا يمكنك تنزيله بعد. يحتفظ GLM-5.3 بقاعدة GLM-5.2 ذات بنية MoE وحجم 744B، ويستخرج قفزة كبيرة في البرمجة والوكلاء عبر ما بعد التدريب فقط. تعد Z.ai بنشر الأوزان بعد نحو أسبوعين؛ وحتى ذلك الوقت هو نموذج مستضاف بمستقبل محلي واعد.

تم التحديث 14 أغسطس 2026 Weights Pending1M Context Evals744B MoE
الأفضل لـ

أكثر نموذج محلي إثارة للاهتمام لا يمكنك تنزيله بعد. يحتفظ GLM-5.3 بقاعدة GLM-5.2 ذات بنية MoE وحجم 744B، ويستخرج قفزة كبيرة في البرمجة والوكلاء عبر ما بعد التدريب فقط. تعد Z.ai بنشر الأوزان بعد نحو أسبوعين؛ وحتى ذلك الوقت هو نموذج مستضاف بمستقبل محلي واعد.

لماذا تفوز

تعلن Z.ai عن 28.3 في Terminal-Bench 3.0 و66.9 في DeepSWE v1.1 و48.2 في AutomationBench و84.5% في CyberGym. وتقول إن المكاسب كلها جاءت من توسيع بيئات التعلم المعزز طويلة المدى، لا من تكبير قاعدة 744B/~40B النشطة.

انتبه إلى

عند الإطلاق لا توجد أوزان عامة ولا رخصة معلنة ولا API عامة؛ الوصول عبر Coding Plan وZCode. معظم النتائج نفذها المورّد، والنموذج ما زال بحجم مركز بيانات، ولم تُعلن رؤية أصلية.

01

ما هو في الواقع

تخيل ورشة قوية تتحسن من دون أن تكبر مساحتها. تبقى الأدوات في أماكنها، لكن العاملين يتعلمون تنظيم مهمة صعبة، وفحص التقدم، وتغيير الخطة بعد الفشل. هذه هي فكرة GLM-5.3 الأساسية: قاعدة GLM-5.2 نفسها، مع شهر من توسيع ما بعد التدريب لمهام الهندسة والبحث الطويلة.

هذا الفرق مهم للذكاء الخاص. حجم النموذج يشبه الإيجار؛ كل معلمة إضافية تحتاج تخزينًا وعرض نطاق وتشغيلًا. لا يخفض 5.3 إيجار 5.2 المرتفع، لكنه يعد بقدرة أكبر داخل المبنى نفسه. تتحدث Z.ai عن 744 مليار معلمة إجمالية ونحو 40 مليارًا نشطة، مع بيئات أكثر وتنوع أكبر وتعلم معزز عبر SAO وslime.

يتوافق نمط النتائج مع هذه الرواية مبدئيًا. يرتفع Terminal-Bench 3.0 من 4.6 إلى 28.3، وDeepSWE من 46.2 إلى 66.9، وAutomationBench من 26.2 إلى 48.2. هذه ليست أسئلة إكمال سطر؛ على الوكيل استخدام الأدوات وقراءة النتيجة وتصحيح المسار. قد يبدو نموذج ذكيًا في جواب واحد ثم يضيع بعد عشرين خطوة، والتدريب يستهدف هذا الانحراف.

نتائج الأمن مثيرة لكنها سهلة المبالغة. يحقق 84.5% في CyberGym ليتصدر الاكتشاف والتحقق في جدول Z.ai. أما الاستغلال العميق فجبل آخر: يضاعف 54.4% في ExploitBench نتيجة 5.2، بينما يصل Fable 5 إلى 78.0 وSol إلى 76.5. صار أفضل في العثور على الأبواب الخطرة، لكن أفضل النماذج المغلقة ما زالت أفضل في عبور المتاهة وراءها.

تنشر Z.ai أيضًا سجلًا يتابع 2,436 اكتشافًا في 269 مشروعًا بعد المراجعة وإزالة التكرار، منها 53 حالة عامة عند الإطلاق. يظل الدليل بقيادة المورّد، لكن سجلًا حيًا يمكن فحصه أفضل من جملة انتصار مبهمة.

تحتاج كلمة محلي إلى الدقة. لا يوجد تنزيل يوم الإطلاق. الأوزان موعودة بعد أسبوعين، ولم تُذكر الرخصة، والـAPI العامة قادمة لاحقًا. الوصول الحالي هو Coding Plan وZCode. وعد بملف ليس ملفًا موجودًا على خادمك.

إذا نفذت Z.ai وعدها، فسيشبه النشر GLM-5.2: ذاكرة هائلة وبرامج تشغيل ناضجة وتكميم حذر. من يشغّل 5.2 سيبدأ أسرع، لكن لا يمكن قياس الذاكرة أو خسارة الجودة قبل وصول الملفات. لذلك يحتل المركز الثاني مؤقتًا؛ يبقى DeepSeek V4 Flash التوصية الأولى الصادقة لأنه قابل للتنزيل والتشغيل الآن.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • ترقية حقيقية على القاعدة نفسها: بيئات أكثر، ومهام أكثر تنوعًا، وحوسبة إضافية لما بعد التدريب باستخدام SAO وslime تعني قدرة أكبر من دون زيادة البصمة التي ستستضيفها.
  • البرمجة طويلة المدى هي المحور: يقفز Terminal-Bench من 4.6 إلى 28.3 وDeepSWE من 46.2 إلى 66.9 وAutomationBench من 26.2 إلى 48.2؛ وهي مهام تتطلب الفعل والفحص والتصحيح.
  • مسار النشر المنتظر مألوف: لأن القاعدة لم تتغير، تُعد بنية GLM-5.2 تقديرًا منطقيًا: ذاكرة موحدة كبيرة جدًا أو عدة بطاقات GPU، لا حاسوبًا محمولًا عاديًا.
  • أدلة الأمن ملموسة: تعلن Z.ai عن 84.5% في CyberGym و54.4% في ExploitBench، ويسجل دفترها العام 2,436 ثغرة مراجعة في 269 مشروعًا، منها 53 منشورة عند الإطلاق.
  • يمكن الاختبار مستضافًا أثناء الانتظار: يتاح 5.3 لكل خطط Coding Plan وفي ZCode، فيستطيع الفريق اختباره على مستودعاته قبل شراء العتاد.

قيود صادقة

  • ليس محليًا اليوم: تقول Z.ai إن الأوزان ستصل بعد نحو أسبوعين من 14 أغسطس. حتى ذلك الحين، «أوزان مفتوحة» وعد لا منتج متاح.
  • الرخصة مجهولة: رخصة 5.2 المتساهلة لا تضمن رخصة 5.3. ينبغي انتظار بطاقة النموذج والشروط الفعلية.
  • فاتورة العتاد ضخمة: 744B معلمة إجمالية ونحو 40B نشطة تشير إلى ذاكرة من فئة 256GB أو عدة GPU حتى مع التكميم.
  • لا يوجد تحقق مستقل: توثق Z.ai إعدادات الاختبارات جيدًا، لكنها نفذت أو جمعت معظم الأرقام. مشاركة جهات خارجية في اختبارات محددة لا تثبت القصة كلها.
  • نصي والتفكير إلزامي: لم تُعلن رؤية أصلية، ولا يمكن تعطيل التفكير. تسمح low وhigh وmax بتحديد الدرجة فقط.
03

لمحة عن المعايير

Terminal-Bench 3.0 — 28.3 (تشغيل Z.ai)

قفزة من 4.6، لكن Fable 5 عند 33.7 وGPT-5.6 Sol عند 34.6 ما زالا متقدمين.

DeepSWE v1.1 — 66.9 (تشغيل Z.ai)

صعود من 46.2 واقتراب من Kimi K3 عند 67.5، بينما Sol يتصدر بـ72.7.

AutomationBench v1.0.6 — 48.2 (تشغيل Z.ai)

الزيادة من 26.2 تدعم ادعاء العمل طويل المدى.

CyberGym — 84.5% (تشغيل Z.ai)

أفضل نتيجة اكتشاف في الجدول، لكنها لا تقيس سلسلة الاستغلال كاملة.

ExploitBench — 54.4% (تشغيل Z.ai)

أكثر من ضعف 24.4، لكنه بعيد عن Fable 5 عند 78.0 وSol عند 76.5.

04

الحكم

يدخل GLM-5.3 المركز الثاني في الذكاء المحلي/الخاص، فوق GLM-5.2 وتحت DeepSeek V4 Flash الأصغر والمتاح للتنزيل. مساره قوي، لكن «محلي» يعني امتلاك الأوزان. لا يستحق المركز الأول بلا ملفات أو رخصة. اختبره عبر Coding Plan، ثم انتظر بطاقة النموذج والرخصة والبصمات ودعم التشغيل واختبارات التكميم المستقلة قبل النشر.

05

الأسئلة الشائعة