الترتيب #8 البرمجة — ذكاء اصطناعي يكتب شيفرة جاهزة للإنتاج
Alibaba / Qwen Team

Qwen3.8-Max

منافس ذو قيمة عالية لبرمجة السياق الطويل والمهام البصرية، يحتل الآن المرتبة السادسة بعد أن وضعته الاختبارات المستقلة خلف النموذج الرائد GLM-5.3. يظل نقطة الفحص (checkpoint) القابلة للتنزيل من فئة Max استثنائية، لكن 2.4 تريليون معلمة تجعل الاستضافة الذاتية مشروعاً بحجم مركز بيانات.

تم التحديث 30 أغسطس 2026 Agentic CodingVision + Video1M Context

تحديث الترتيب رُوجِع ترتيب فئة «البرمجة» منذ آخر تحديث لهذه المراجعة (30 أغسطس 2026). الترتيب المعروض أعلاه محدَّث دائمًا. الأول حاليًا: GPT-6 Astra

الأفضل لـ

منافس ذو قيمة عالية لبرمجة السياق الطويل والمهام البصرية، يحتل الآن المرتبة السادسة بعد أن وضعته الاختبارات المستقلة خلف النموذج الرائد GLM-5.3. يظل نقطة الفحص (checkpoint) القابلة للتنزيل من فئة Max استثنائية، لكن 2.4 تريليون معلمة تجعل الاستضافة الذاتية مشروعاً بحجم مركز بيانات.

لماذا تفوز

سجل Artificial Analysis 71.8 في البرمجة و58.4 في المهام الوكيلة؛ وأبلغت Alibaba عن 86.6 في Terminal Bench 2.1 و93.0 في PaperBench. يضيف إصدار Max المستضاف الرؤية، والأدوات، وسياقاً افتراضياً بمليون رمز، ووصولاً إلى واجهة برمجة التطبيقات (API) بتكلفة 2 دولار/6 دولارات، بينما تتيح الأوزان المفتوحة النشر الخاص للنصوص فقط.

انتبه إلى

يتصدر GLM-5.3 الآن Qwen في المؤشرات المستقلة للذكاء، والبرمجة، والعمل الوكيل، فضلاً عن مقارنات Terminal-Bench و DeepSWE من Z.ai في نفس الجدول. لا تزال أقوى النتائج التفصيلية لـ Qwen مبلّغاً عنها من قِبل المُصدِر، وتجارب إصلاح الأخطاء في العالم الحقيقي متباينة.

01

ما هو في الواقع

الجزء المثير للاهتمام في Qwen3.8-Max ليس أنه يمتلك أكبر رقم في كل صف. فهو لا يفعل ذلك. الجزء المثير للاهتمام هو المزيج: نموذج مع نافذة سياق كبيرة جداً، وإدخال بصري، وطموحات جادة كوكيل، وسعر يجعل المحاولات المتكررة في المتناول. فالبرمجة في الغالب هي عملية تجربة، وفحص، ثم محاولة مرة أخرى؛ وفاتورة الرموز الأقل تجعل هذه العملية أقل نظرية وأكثر واقعية.

تُدرج Alibaba النموذج بـ 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج. للمقارنة، كان السعر السابق لـ Kimi K3 في هذا الدليل 3 دولارات/15 دولاراً. يكون التوفير مفيداً بشكل خاص عندما يحتاج وكيل البرمجة إلى إعادة قراءة سياق المستودع أو عندما تريد من نموذج ثانٍ مراجعة التصحيح البرمجي (patch). الرخيص لا يعني الجيد، ولكنه يمكن أن يجعل تطبيق العادات الهندسية الجيدة—مثل الاختبارات، والمحاولات المتكررة، والمراجعة المستقلة—أقل تكلفة.

الأدلة المبكرة في الواجهة الأمامية تستحق الاهتمام. في لقطة مبكرة لـ Frontend Code Arena، احتل Qwen3.8-Max المركز الرابع عند 1668 Elo. تستند هذه التصنيفات إلى تفضيل الأشخاص لواجهة مكتملة على أخرى دون معرفة النموذج الذي صنعها. هذا يجعل الاختبار أقرب إلى السؤال الحقيقي وراء أي نموذج أولي لمنتج: هل تبدو الصفحة متماسكة وتعمل كما يتوقع المستخدم؟ قد تتغير النتيجة، وقد تستمر واجهة جميلة في إخفاء تعليمات برمجية هشة، لكنها بداية ذات مغزى.

تتناسب مدخلات نموذج Max المستضاف جيداً مع التطوير البصري: لقطة الشاشة، والمرجع التصميمي، وتسجيل المتصفح، والملخص، ونص المستودع يمكن أن تتشارك في محادثة واحدة. يختلف الإصدار المفتوح: فهو نصي فقط مع سياق محلي يبلغ 262K، قابل للتوسيع إلى حوالي 1.01M. يجب أن تختار الفرق بين الإصدار المستضاف أو المفتوح بناءً على النوعية الفعلية والبنية التحتية التي يحتاجونها.

يُغير الإصدار المفتوح طرق النشر بدلاً من أن يُغيّر فجأة اليقين المعياري. يمكن للفرق الاحتفاظ بالكود في بيئتهم الخاصة وتشغيل النموذج من خلال حزم البرمجيات المدعومة. ومع ذلك، لا تزال 2.4 تريليون معلمة تتطلب حجم مركز بيانات، ويُضيف الترخيص المخصص شروطاً لتسمية النموذج وتراخيص منفصلة عند تخطي حدود عالية للمستخدمين أو الإيرادات. إن الأوزان المفتوحة تنقل ببساطة القفل من باب المُصدِر إلى غرفة الخوادم الخاصة بك؛ فهي لا تجعل غرفة الخوادم صغيرة.

أبلغت Alibaba عن 86.6 في Terminal Bench 2.1، وهي نتيجة قوية لوكيل يعمل من خلال مهام سطر الأوامر. وأبلغت Z.ai عن 88.2 لنموذج GLM-5.3 في نفس جدول الإطلاق و66.9 مقابل 56.6 لـ Qwen في DeepSWE. يضع Artificial Analysis بشكل مستقل GLM في المقدمة بنتيجة 74.8 مقابل 71.8 في البرمجة و59.1 مقابل 58.4 في العمل الوكيل. كما جاء GLM في المركز الثالث بنسبة 41.8% في أحدث لوحة متصدرين عامة لـ Terminal-Bench 4.0، حيث لم يكن لـ Qwen أي إدخال. لا تزال بيئات الاختبار المختلفة تهم، لكن الأدلة تشير الآن باتساق كافٍ لتغيير الترتيب.

أكثر ما يجب الحذر منه هو إصلاح المستودعات. إن نتيجة 67.7 في SWE-bench Pro من Alibaba محترمة ولكنها أقل من النتائج الرائدة، والتقارير المستقلة المبكرة لإصلاح الأخطاء غير متساوية. هذا اختلاف معروف في تطوير الذكاء الاصطناعي: إن بناء واجهة جديدة مقنعة وإصلاح قاعدة تعليمات برمجية قديمة وغريبة يتشاركان في الأدوات، لكن ليس بالضرورة في نفس النوع من الانضباط. استخدم Qwen لكليهما إذا أثبت جدارته في اختباراتك؛ لا تستنتج النصر الثاني من الأول تلقائياً.

في الوقت الحالي، يحتل Qwen3.8-Max المركز السادس بنتيجة 9.2. ويظل خياراً جذاباً لعمل الواجهة الأمامية عبر إصدار Max المستضاف متعدد الوسائط، ولبرمجة السياق الطويل الخاصة عبر نقطة فحص النص المفتوح، لكن النموذج الرائد GLM-5.3 يجلس الآن فوقه في قائمة البرمجة. حافظ على نطاق وصول محدود وقِس النتيجة الكاملة: اجتياز الاختبارات، واختلافات الكود المُراجعة (diffs)، والسلوك المفيد، وتكلفة البنية التحتية، والملاءمة مع الترخيص.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • السعر يغيّر ما يستحق التجربة: بتكلفة 2 دولار للمُدخلات / 6 دولارات للمُخرجات لكل مليون رمز (token)، يُعد Qwen3.8-Max أرخص بكثير من أغلى وكلاء البرمجة وأقل من السعر السابق لـ Kimi K3 البالغ 3 دولارات/15 دولاراً. هذا يجعل تصحيح الأخطاء التكراري، والسياق الطويل، والمراجعة المستقلة الثانية أمراً واقعياً من الناحية المالية.
  • يبدأ بنتيجة مشجعة في الواجهة الأمامية: يضع Frontend Code Arena نموذج Qwen3.8-Max عند 1668 Elo (المركز الرابع) في لقطة مبكرة، بما في ذلك التصنيفات القوية للمنتجات الاستهلاكية. التفضيل الأعمى للواجهة الناتجة هو إشارة مفيدة لعمل واجهة المستخدم، حتى وإن لم يثبت مهارة هندسية على مستوى المستودع بأكمله.
  • المهام الطويلة والبصرية تتناسب مع تصميم الإدخال الخاص به: يمكن للنموذج أخذ النصوص، ولقطات الشاشة، والمخططات، ومقاطع الفيديو من خلال نافذة سياق بمليون رمز. يعد هذا مفيداً للغاية لتحويل تصميم إلى كود، أو تشخيص عطل مُسجل في واجهة المستخدم، أو الاحتفاظ بمستودع كبير ومتطلبات منتجه في جلسة عمل واحدة.
  • نتيجة الوكيل الطرفي (terminal) للمُصدِر قوية: تُبلغ Alibaba عن 86.6 في Terminal Bench 2.1، بالقرب من قمة مقارناتها. هذا دليل على أن نظام Qwen يمكنه التنقل في مهام سطر الأوامر، وكتابة الملفات، والتفاعل مع ردود فعل الأدوات.
  • يُقدّم ضوابط مدروسة للتفكير المنطقي: يدعم إعداد reasoning_effort (جهد التفكير) مستويات عالية ومتوسطة ومنخفضة، في حين أن preserve_thinking (الاحتفاظ بالتفكير) مفعّل افتراضياً. يمكن للمطورين قضاء المزيد من الوقت في تصميم صعب أو تقليل زمن الوصول لتعديل صغير ومحدد جيداً.
  • يمكن للفرق استضافة فئة Max بأنفسهم: تتوفر نقطة الفحص المفتوحة على Hugging Face و ModelScope، وتُدرج بطاقتها التوافق مع vLLM، وSGLang، وTokenSpeed. يتيح ذلك التقييم الخاص والضبط الدقيق—بشرط أن يمتلك الفريق أجهزة بحجم مراكز البيانات.

قيود صادقة

  • تضع الأدلة المستقلة الآن سقفاً أقل: يُقيّم Artificial Analysis نموذج Qwen3.8-Max بـ 71.8 في البرمجة و58.4 في العمل الوكيل، خلف GLM-5.3 الذي سجل 74.8 و59.1. تظل الصفوف التفصيلية لـ Terminal Bench و PaperBench من Alibaba مفيدة لكنها تعتمد على إعداد الاختبار.
  • إصلاح المستودعات لا يزال الفجوة الأوضح: أبلغت Alibaba عن 67.7 في SWE-bench Pro، متأخرة عن أقوى نتائج الحدود التقنية. كما أن التقارير المستقلة المبكرة عن مجموعات الأخطاء متباينة، لذا لا ينبغي الخلط بين العرض الجيد للواجهة الأمامية والصيانة الموثوقة لقاعدة تعليمات برمجية كبيرة قيد الإنتاج.
  • السياق الضخم قد يجعل الخطة السيئة تدوم لفترة أطول: يتيح المليون رمز للنموذج رؤية الكثير، ولكنه قد يخطئ في قراءة افتراض معماري أو يتجاهل حقيقة في منتصف النص. استخدم التزامات (commits) صغيرة، واختبارات، ونقاط فحص بدلاً من تسليم مهمة غير محدودة لجلسة عمل واحدة طويلة.
  • جودة التفكير، والسرعة، والتكلفة تشكل مقايضة ثلاثية: يمكن أن يساعد الجهد العالي في حل مشكلة معقدة، لكن رموز التفكير تُحسب كمُخرجات ويبلغ المستخدمون الأوائل عن استهلاك مرتفع للحصة أو الرموز. استخدم الجهد المتوسط أو المنخفض للتعديلات الروتينية وقِس التكلفة لكل تغيير مدمج ومختبر.
  • الوصول إلى الخدمة وعمليات الدمج قد تختلف حسب الموقع: واجهات برمجة التطبيقات سهلة الوصول، لكن التوافر، والدفع، والحصص، وزمن الوصول قد تختلف باختلاف المنطقة. تأكد من أن النموذج متاح بشكل موثوق حيث يعمل فريقك وتطبيقاتك قبل توحيد استخدامه.
  • الترخيص والأجهزة لا تزال تضع الحدود: تقديم 2.4 تريليون معلمة هو مشروع لمركز بيانات، ويتطلب الترخيص المخصص عرض اسم النموذج للمنتجات الكبيرة جداً بالإضافة إلى إذن منفصل لخدمات النماذج الكبيرة أو شركات المساعدة في البرمجة/المكاتب التي تتجاوز حد الإيرادات الخاص بها.
03

لمحة عن المعايير

Frontend Code Arena — 1668 Elo (المركز الرابع، مبكراً)

نتيجة تفضيل بشري مبكرة للعمل المكتمل للواجهة الأمامية. إنها دليل قوي على إنتاج واجهة المستخدم، وليست تصنيفاً كاملاً لهندسة البرمجيات.

Terminal Bench 2.1 — 86.6 (أبلغت عنها Alibaba)

نتيجة عالية لوكيل طرفي مُبلّغ عنها من قِبل المُصدِر، خلف درجة GPT-5.6 Sol المُشار إليها والبالغة 88.8. أدوات الاختبار المختلفة للوكلاء تجعل المقارنات المباشرة بين النماذج غير مكتملة.

SWE-bench Pro — 67.7 (أبلغت عنها Alibaba)

درجة محترمة لإصلاح المستودعات لا تزال متأخرة عن أقوى نتائج عائلة Claude في جدول المُصدِر.

PaperBench — 93.0 (أبلغت عنها Alibaba)

إشارة قوية للعمل البحثي، وسياق مفيد للتخطيط والتفكير الموسع ولكن ليس معياراً مباشراً للبرمجة.

Artificial Analysis Programming / Agentic — 71.8 / 58.4

تتأخر الأدلة المستقلة المركبة عن GLM-5.3 (74.8 / 59.1) وتدعم وضع النموذج الرائد GLM فوق Qwen. لا يزال Qwen يتقدم قليلاً على GLM-5.3-Flash في هذه المؤشرات الخام.

04

الحكم

يتراجع Qwen3.8-Max إلى المركز السادس في البرمجة بنتيجة 9.2 المصححة بالمعادلة. ويظل منافساً ممتازاً في المهام البصرية، وذا سياق طويل، ومراعياً للتكلفة، لكن أحدث الأدلة المستقلة لم تعد تدعم وضعه فوق النموذج الرائد GLM-5.3. يحتل Grok 4.6 المركز الرابع، وGLM-5.3 المركز الخامس، وQwen المركز السادس، وGLM-5.3-Flash المركز السابع. استخدم Qwen حيث يتناسب منتجه المستضاف متعدد الوسائط وسعره مع الوظيفة، ثم دع التكامل المستمر (CI) ومراجعة الكود يُقرران ما إذا كان سيتفوق بالفعل على هذه النماذج في مستودعك.

05

الأسئلة الشائعة