الترتيب #8 المنظومة اليومية — مساعدات الذكاء الاصطناعي الرائدة
Alibaba / Qwen Team

Qwen3.8-Max

يتوفر Qwen3.8 الآن في شكلين مهمين: منتج Qwen3.8-Max المستضاف مع الرؤية، والأدوات المدمجة، وسياق افتراضي بـ 1 مليون رمز، وأول نموذج قابل للتنزيل من فئة Max لـ Qwen. النموذج المفتوح عبارة عن نموذج نصي يحتوي على 2.4 تريليون معلمة إجمالية و 95 مليار معلمة نشطة مع سياق أصلي يبلغ 262 ألفًا يمتد إلى ما يقرب من مليون رمز.

تم التحديث 30 أغسطس 2026 Multimodal1M ContextDeep Research

تحديث الترتيب رُوجِع ترتيب فئة «النظام البيئي اليومي» منذ آخر تحديث لهذه المراجعة (30 أغسطس 2026). الترتيب المعروض أعلاه محدَّث دائمًا. الأول حاليًا: Claude Opus 5.5

الأفضل لـ

يتوفر Qwen3.8 الآن في شكلين مهمين: منتج Qwen3.8-Max المستضاف مع الرؤية، والأدوات المدمجة، وسياق افتراضي بـ 1 مليون رمز، وأول نموذج قابل للتنزيل من فئة Max لـ Qwen. النموذج المفتوح عبارة عن نموذج نصي يحتوي على 2.4 تريليون معلمة إجمالية و 95 مليار معلمة نشطة مع سياق أصلي يبلغ 262 ألفًا يمتد إلى ما يقرب من مليون رمز.

لماذا تفوز

يتوفر Qwen3.8-2.4T-A95B على Hugging Face و ModelScope، مع توافق رسمي مع vLLM و SGLang و TokenSpeed. أبلغت علي بابا (Alibaba) عن 93.0 في PaperBench و 86.6 في Terminal Bench 2.1. يضيف Max المستضاف إدخال الصور/الفيديو، ووضع عدم التفكير (non-thinking)، والأدوات المدمجة، وسياق افتراضي بـ 1 مليون، وأسعار API تبلغ 2 دولار / 6 دولارات.

انتبه إلى

هذا إصدار حديث للغاية. يأتي جدول المعايير الواسع والمثير للإعجاب من شركة علي بابا، وليس من مختبر مستقل؛ التقارير المستقلة المبكرة للبرمجة متباينة، وقد يكون الوصول والحصص والفوترة أمراً غير مريح. يعتبر Qwen نظاماً بيئياً متكاملاً بشكل متزايد، ولكن تكامله مع الخدمات التي يستخدمها العديد من القراء بالفعل لا يزال أقل سلاسة من جوجل أو مايكروسوفت أو OpenAI - خاصة خارج آسيا.

01

ما هو في الواقع

من الأسهل فهم Qwen3.8-Max كمحرك جديد وقوي متوقف في ورشة عمل مزدحمة. المحرك هو النموذج الرائد لشركة علي بابا: تصميم خليط من الخبراء المتناثر (sparse Mixture-of-Experts) بإجمالي 2.4 تريليون معلمة و 95 مليار معلمة نشطة في كل طلب. الورشة هي Qwen Studio، حيث يقع هذا المحرك بجوار الدردشة، والبحث العميق (Deep Research)، وإنشاء الصور، وإنشاء الفيديو، وأدوات بناء مخرجات الويب. بالنسبة للمستخدم العادي، قد تكون الورشة بنفس أهمية المحرك.

الجاذبية العملية الفورية هي القيمة المادية. السعر المُدرج في QwenCloud هو 2 دولار لكل مليون رمز إدخال و 6 دولارات لكل مليون رمز إخراج، مع الإدخال المخزن مؤقتاً بـ 0.25 دولار. هذا لا يجعل كل وظيفة رخيصة - فالتفكير الطويل يُحسب كإخراج - لكنه يجعل تحليل السياقات الكبيرة والتجريب المتكرر أسهل بكثير في التبرير من الأسعار المميزة لقادة السوق الأغلى. إذا كان Kimi K3 هو النموذج المتكامل القادر الذي يحتاج إلى ميزانية دقيقة، فإن Qwen3.8-Max هو البديل الطموح الذي يترك مساحة أكبر في الميزانية لمحاولة ثانية ومراجعة مناسبة.

وهو مصمم أيضاً للنظر إلى المشكلة، وليس مجرد القراءة عنها. يقبل النموذج النص والصور والفيديو بسياق يصل إلى مليون رمز. تخيل أنك تبحث في إطلاق منتج باستخدام مستند الاستراتيجية الخاص به، وجدول البيانات، والنموذج المبدئي، ولقطة شاشة للوحة القيادة، وتسجيل لسير عمل معطل، وكل ذلك على نفس المكتب. لا يمنح هذا النموذج ذاكرة أو تقييماً مثالياً بسحر، لكنه يزيل العديد من خطوات الترجمة المربكة التي عادة ما تفصل بين البحث والعمل المرئي.

قصة مجموعة المنتجات مفيدة بشكل غير عادي للعمل اليومي. يقدم Qwen Studio الدردشة، والبحث العميق، وإنشاء الصور، وإنشاء الفيديو، ومخرجات التطوير. لا يتطابق النموذج القابل للتنزيل مع هذا المنتج المستضاف: فهو نصي فقط، ويستخدم سياقاً أصلياً يبلغ 262 ألفاً، ويمكن أن يمتد إلى حوالي 1.01 مليون؛ بينما يضيف Max المستضاف الرؤية، ودعم وضع عدم التفكير، والأدوات المدمجة، وسياقاً افتراضياً بمليون رمز. يمنع هذا التمييز أن تصبح الميزة المُعلن عنها في بطاقة النموذج مفاجأة مزعجة عند النشر.

الإصدار المفتوح الموعود أصبح الآن حقيقة واقعة. يمكن تنزيل Qwen3.8-2.4T-A95B من Hugging Face و ModelScope، بوجود 512 خبيراً مع 10 خبراء مُخصصين بالإضافة إلى خبير مشترك واحد نشط لكل رمز. لا يزال ليس نموذجاً لأجهزة الكمبيوتر المحمولة: فتخزين وتشغيل 2.4 تريليون معلمة يعد مشروعاً بحجم مركز بيانات. الترخيص المخصص واسع للاستخدام العادي، ولكن يجب أن تعرض المنتجات الكبيرة جداً اسم النموذج، وقد تحتاج شركات خدمات النماذج الكبيرة أو مساعدات البرمجة/المكاتب إلى ترخيص تجاري منفصل.

قصة الأداء واعدة، ولكنها ليست مكتملة. أبلغت علي بابا عن نتائج ممتازة في PaperBench و IFBench و OSWorld-Verified و Terminal Bench 2.1، وجدول واسع للوسائط المتعددة. وفي أول لقطة لـ Frontend Code Arena، يحل Qwen3.8-Max في المرتبة 4 بـ 1668 Elo. والأمر الأكثر إثارة للاهتمام، تصف علي بابا العديد من عروض العمل المستقل الملموسة بشكل غير معتاد: تشغيل دون مراقبة لمدة تتراوح بين 10 و 16 يوماً من مجلد فارغ حيث بنى بيئة اختبار ذاتية التطور، وقام بعمل 265 commit، وفتح 127 pull request، وسجل 151 issue؛ ومسابقة لنية الحوار متعدد الوسائط ارتفعت فيها الدقة من 0.60 إلى 0.853 على مدار 45 تقديماً؛ ومحاكاة ممتدة لتصميم الرقائق والتجارة الإلكترونية. هذه هي تقارير علي بابا الخاصة، وليست تقييماً مستقلاً، لكنها تقدم صورة مفيدة للعمل الاحترافي متعدد الخطوات الذي يستهدفه الفريق. لا يزال التقييم المستقل بحاجة إلى القيام بالعمل البطيء والممل بعض الشيء الذي يجعل لوحة المتصدرين جديرة بالثقة.

هذا الحذر هو الأكثر أهمية في البرمجة. نتيجة Terminal Bench التي أبلغ عنها Qwen قوية، ومع ذلك فإن 67.7 في SWE-bench Pro لا تضعه بين قادة الواجهة في حل المشكلات في المستودعات الحقيقية. بعض الاختبارات العملية المبكرة لإصلاح الأخطاء متباينة أيضاً. يمكن للمعيار إظهار أن النموذج يمتلك صندوق أدوات قوي؛ ولكن التشغيل المتكرر فقط على مستودعك الخاص يوضح ما إذا كان يتذكر الهدف، ويستخدم الأوامر الصحيحة، ويصلح الخطأ بدلاً من كتابة خطأ جديد يتم شرحه ببراعة.

هناك أيضاً قيود على المنتج. التوافر، والحصص، والفوترة، والسرعة تختلف باختلاف المنطقة، بينما يتطلب الاستضافة الذاتية (self-hosting) بنية تحتية جادة ومراجعة للترخيص. في الوقت الحالي، يحصل Qwen3.8-Max على المرتبة 6 بنتيجة 9.0، مباشرة خلف Grok 4.6. استخدمه في مهمة محدودة، وتحقق من حقائقه والكود الذي ينتجه، ودع النتائج المستقلة - وليس الحماس خلال أسبوع الإطلاق - تقرر ما إذا كان سيصبح خيارك الافتراضي.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • الكثير من القدرات الرائدة مقابل تكلفة الـ API: يُدرج QwenCloud مبلغ 2 دولار لكل مليون رمز إدخال و 6 دولارات لكل مليون رمز إخراج، مع إدخال مخزن مؤقتاً بسعر 0.25 دولار. وهذا يمثل تقريباً نصف سعر الإخراج لـ Kimi K3 في التصنيف السابق، وأقل بكثير من أعلى أسعار Claude، مما يجعل التجريب الجاد أقل إيلاماً للميزانية.
  • يمكنه فحص ما هو أكثر من مجرد نصوص: يتعامل Qwen3.8-Max بشكل أصلي مع النصوص والصور والفيديو ويحتوي على نافذة سياق بمليون رمز. وبالتالي يمكن أن يكون التقرير الطويل، ولقطة شاشة لواجهة المستخدم، ومخطط، وتسجيل شاشة قصير جزءاً من تحقيق واحد بدلاً من عمليات تسليم منفصلة تفقد بعض المعلومات.
  • عائلة Qwen تقدم للمستخدمين العاديين أكثر من مجرد روبوت محادثة: يجمع Qwen Studio بين الدردشة، والبحث العميق (Deep Research)، ومخرجات تطوير الويب، وإنشاء الصور، وإنشاء الفيديو، ويتوفر على الويب بالإضافة إلى منصات أجهزة سطح المكتب والأجهزة المحمولة الرئيسية. أدوات الوسائط التوليدية هذه هي منتجات عائلية؛ ولا ينبغي الخلط بين ذلك وبين الادعاء بأن نموذج Max وحده هو من ينتج كل تلك المخرجات.
  • عروض العمل المستقل ملموسة بشكل غير معتاد: تقول علي بابا إن Qwen3.8-Max عمل دون مراقبة لمدة تتراوح بين 10 و 16 يوماً بدءاً من مجلد فارغ، وبنى بيئة اختبار ذاتية التطور قامت بعمل 265 commit، و 127 pull request، و 151 issue. كما تشير إلى تحدي نية متعدد الوسائط بـ 45 تقديماً تحسنت فيه الدقة من 0.60 إلى 0.853. هذه عروض من الشركة المصنعة، لكنها تُظهر نوع سير العمل الاحترافي المستمر الذي تستهدفه علي بابا.
  • إشارته العامة الأولى في الواجهة الأمامية (Frontend) تنافسية حقاً: تضع Frontend Code Arena النموذج في المرتبة 4 بدرجة 1668 Elo في لقطة مبكرة، مع نتائج قوية بشكل خاص في المنتجات الاستهلاكية. لا يعد هذا حكماً نهائياً على البرمجة، ولكنه دليل مفيد على أن Qwen يمكنه تصميم واجهات يفضلها الناس.
  • أصبحت فئة Max قابلة للتنزيل أخيراً: يتوفر Qwen3.8-2.4T-A95B على Hugging Face و ModelScope مع 2.4 تريليون معلمة إجمالية / 95 مليار نشطة، وسياق أصلي يبلغ 262,144 رمزاً، وتمديد يصل إلى حوالي 1.01 مليون. تم تحديد vLLM و SGLang و TokenSpeed كبيئات تشغيل (runtimes) متوافقة.

قيود صادقة

  • تعامل مع جدول المعايير الرئيسي كأدلة من الشركة المصنعة، وليس كحقائق محسومة: أرقام علي بابا مفيدة، لكن العديد من المقارنات تستخدم بيئات وكلاء وإعدادات قد تغير النتيجة. لم تواكب المجموعات المستقلة ذلك تماماً بعد، لذلك ينبغي أن تُوجه ادعاءات PaperBench و Terminal Bench تجربتك، لا أن تحل محلها.
  • حل المشكلات في المستودعات الحقيقية ليس انتصاراً واضحاً بعد: أبلغت علي بابا عن 67.7 في SWE-bench Pro، خلف أقوى نتائج Claude، وكانت التقارير المستقلة المبكرة لإصلاح الأخطاء أضعف بكثير من جدول الإطلاق. للحصول على تصحيح إنتاجي، قم بتمرير المشكلة نفسها عبر Qwen والنموذج الرائد الحالي لديك قبل تغيير خيارك الافتراضي.
  • النظام البيئي واسع، لكنه ليس مدمجاً عالمياً: يمتلك Qwen Studio مجموعة جذابة من الأدوات، ومع ذلك فهو لا يتواجد تلقائياً داخل Gmail أو ملفات Office أو المتصفحات أو التقويمات أو أذونات الشركة لمعظم القراء. يمكن أن يكون وصول علي بابا وتوافر خدماتها أكثر ملاءمة في آسيا من أي مكان آخر.
  • نافذة سياق بمليون رمز تعني سعة استيعاب، وليس ذاكرة مثالية: يمكنها استيعاب كمية هائلة من المواد، لكن الصفحات غير ذات الصلة والأهداف الغامضة والحقائق المدفونة في المنتصف يمكن أن تضلل النموذج. قسّم المشاريع الكبيرة إلى نقاط تحقق واحتفظ بالمستندات المصدرية متاحة للتحقق.
  • الوصول المبكر قد يكون غير مكتمل: أبلغ المختبرون عن بعض الصعوبات في الحصص والفوترة وسرعة المعالجة (throughput)، بينما يمكن أن يستهلك إعداد التفكير العالي للنموذج عدداً كبيراً من رموز الإخراج. ابدأ بمهمة محدودة وتتبع تكلفة نتيجة نهائية ومفحوصة - وليس فقط معدل الرموز المُعلن عنه.
  • مفتوح لا يعني أنه بلا مجهود أو خالي من القيود: إن نموذجاً بحجم 2.4 تريليون معلمة هو بحجم مركز بيانات حتى مع وجود 95 مليار معلمة نشطة لكل رمز. يتطلب الترخيص المخصص ذكر اسم النموذج إذا تم تجاوز 100 مليون مستخدم شهرياً أو إيرادات شهرية قدرها 20 مليون دولار، وترخيصاً منفصلاً لخدمات النماذج الكبيرة أو شركات المساعد الذكي للعمل التي تتجاوز إيراداتها السنوية 50 مليون دولار.
03

لمحة عن المعايير

Frontend Code Arena — 1668 Elo (المرتبة 4، مبكر)

إشارة مبكرة لتفضيلات البشر للأعمال النهائية في الواجهة الأمامية. إنه أمر مشجع، لكن الترتيب والـ Elo سيتغيران مع وصول المزيد من المقارنات.

PaperBench — 93.0 (تقرير علي بابا)

نتيجة أبلغ عنها المزود لعمل بحثي معقد. وهي تدعم طموح النموذج، وليست ضماناً مستقلاً.

IFBench — 82.8 (تقرير علي بابا)

درجة قوية أبلغ عنها المزود في اتباع التعليمات، وهي مهمة عندما تحتوي المهمة على العديد من القيود والخطوات.

Terminal Bench 2.1 — 86.6 (تقرير علي بابا)

نتيجة عالية كوكيل طرفية، أقل من درجة GPT-5.6 Sol المذكورة وأعلى من العديد من المنافسين في جدول علي بابا؛ تُحدث اختلافات بيئات الوكلاء فرقاً هنا.

SWE-bench Pro — 67.7 (تقرير علي بابا)

أداء محترم في هندسة البرمجيات، لكنه ليس النتيجة الرائدة في الفئة لإصلاح المستودعات.

04

الحكم

يحتل Qwen3.8-Max المرتبة السادسة بدرجة 9.0 المصححة بالمعادلة في فئة النظام البيئي اليومي. يتفوق عليه Grok 4.6 لأن درجته البالغة 9.5 تجمع بين أدلة مستقلة أقوى وتوزيع أوسع للوكلاء الجاهزين للاستخدام. يظل Qwen جذاباً للأشخاص الذين يتنقلون بين المستندات، والإدخال المرئي، والبحث، والصور، والفيديو، والبرمجة بتكلفة تشغيل أقل. جرّبه على مهمة محدودة وحافظ على المصادر والاختبارات والمراجعة البشرية في دائرة العمل.

05

الأسئلة الشائعة