الترتيب #5 المنظومة اليومية — مساعدات الذكاء الاصطناعي الرائدة
Alibaba / Qwen Team

Qwen3.8-Max

يجمع Qwen3.8-Max نموذجًا قريبًا من الصدارة مع عائلة Qwen الأوسع: الدردشة والبحث العميق وتوليد الصور والفيديو والتطبيقات وواجهات API. يفهم نموذج Alibaba الجديد النص والصور والفيديو، ويملك سياقًا بطول مليون رمز وتكلفة أقل بكثير من أغلى واجهات النماذج المتقدمة. Max هو المحرك، وQwen Studio هي الورشة المحيطة به.

تم التحديث 14 أغسطس 2026 Multimodal1M ContextDeep Research
الأفضل لـ

يجمع Qwen3.8-Max نموذجًا قريبًا من الصدارة مع عائلة Qwen الأوسع: الدردشة والبحث العميق وتوليد الصور والفيديو والتطبيقات وواجهات API. يفهم نموذج Alibaba الجديد النص والصور والفيديو، ويملك سياقًا بطول مليون رمز وتكلفة أقل بكثير من أغلى واجهات النماذج المتقدمة. Max هو المحرك، وQwen Studio هي الورشة المحيطة به.

لماذا تفوز

لدى Qwen3.8-Max إجمالي 2.4T مع 95B معامل نشط وسياق 1M، وتسعير $2 للإدخال / $6 للإخراج لكل مليون رمز. تعلن Alibaba عن 93.0 في PaperBench و82.8 في IFBench و86.6 في Terminal Bench 2.1. وفي لقطة مبكرة من Frontend Code Arena يحتل #4 عند 1668 Elo؛ ويضيف Qwen Studio البحث وأدوات الصور والفيديو.

انتبه إلى

الإصدار جديد جدًا. جدول المقارنات الكبير من Alibaba نفسها، واختبارات البرمجة المستقلة الأولى متباينة، وقد توجد صعوبات في الحصص أو الفوترة. منظومة Qwen واسعة، لكنها لا تزال أقل اندماجًا في الخدمات اليومية المعتادة من Google وMicrosoft وOpenAI، خاصة خارج آسيا.

01

ما هو في الواقع

من المفيد تصور Qwen3.8-Max كمحرك جديد قوي في ورشة مجهزة جيدًا. المحرك هو نموذج Alibaba الرائد: 2.4 تريليون معامل إجمالًا، ينشط منها 95 مليارًا في الطلب. والورشة هي Qwen Studio، حيث الدردشة والبحث العميق والصور والفيديو وقطع الويب. في مهمة يومية قد تكون الورشة مهمة بقدر أهمية المحرك.

أول ما يلفت الانتباه هو القيمة. سعر $2 للإدخال و$6 للإخراج لكل مليون رمز، مع $0.25 للذاكرة المؤقتة، يترك مجالًا للتحليل الطويل ولمراجعة ثانية. التفكير الطويل ما زال يُحاسب كمخرجات، لذلك ليست كل مهمة رخيصة. لكنه يسمح بعادة جيدة: تدقيق الإجابة بدل تصديق أول جملة مصقولة.

يمكن للنموذج النظر إلى النص والصورة والفيديو ضمن سياق يصل إلى مليون رمز. يمكن أن تبقى وثيقة الاستراتيجية والجدول والنموذج المرئي ولقطة لوحة التحكم وفيديو العملية المعطلة على الطاولة نفسها. ليست هذه ذاكرة أو حكمًا مثاليين، لكنها تقلل عمليات النقل غير الدقيقة بين البحث والعمل البصري.

النتائج واعدة وليست نهائية. تعلن Alibaba نتائج قوية في PaperBench وIFBench وOSWorld-Verified وTerminal Bench؛ وتضعه اللقطة الأولى من Frontend Code Arena في #4 عند 1668 Elo. والأكثر إثارة عروض الاستقلالية الملموسة: بحسب Alibaba، عمل النموذج 10–16 يومًا بلا إشراف من مجلد فارغ، وبنى harness يتطور ذاتيًا وأنجز 265 commit و127 pull request و151 issue. وتصف الشركة أيضًا تحديًا حواريًا متعدد الوسائط ارتفعت دقته من 0.60 إلى 0.853 خلال 45 إرسالاً، ومحاكاة طويلة لتصميم الرقاقات والتجارة الإلكترونية. هذه تقارير Alibaba وليست تحققًا مستقلاً، لكنها ترسم بوضوح الهدف: سلسلة عمل مهني طويلة لا مجرد إجابة جيدة.

الحذر أهم في البرمجة: 67.7 في SWE-bench Pro لا يضع النموذج بين القادة في حل المشكلات داخل مستودعات حقيقية، واختبارات الأخطاء المبكرة مختلطة. بناء واجهة مقنعة وإصلاح مشروع قديم بموثوقية مهارتان مختلفتان. لذلك يستحق Qwen3.8-Max المرتبة #5 كبديل متعدد الاستخدامات واقتصادي: اختبره في مهمة حقيقية محدودة، وتحقق من المصادر والنتائج، ودع الأدلة المستقلة تقرر هل يصبح أداتك الافتراضية.

وللاختيار اليومي سؤال أنفع من «هل هو أذكى نموذج؟»: أين يضيع وقت العمل الآن؟ من ينقل معلوماته باستمرار بين ملفات PDF والجداول ولقطات الشاشة وتسجيلات قصيرة قد يستفيد من مساحة واحدة تفهم هذه المواد معًا. أما من يعمل أصلًا داخل Gmail أو Google Docs أو Outlook أو بيئة شركة ذات صلاحيات منظمة، فقد يوفر وقتًا أكبر مع المساعد المدمج هناك. المنظومة ليست قائمة مزايا فحسب؛ إنها أيضًا عدد عمليات التسليم التي تزيلها من الطريق.

ينبغي قراءة عروض الاستقلالية كدراسات حالة لا كوعد جاهز. فـ265 commit لا تثبت أن كل تغيير صحيح وآمن وقابل للصيانة. القيمة هي صورة أسلوب العمل الذي تحاول Alibaba إظهاره: تقسيم الهدف، استخدام الأدوات، فحص النتيجة، ثم متابعة المهمة من دون فقدان الخيط. التجربة المعقولة للفريق هي عملية صغيرة قابلة للعكس—بحث بمصادر أو نموذج أولي أو تحليل بقائمة تدقيق—قبل تسليم مهمة حرجة إلى وكيل.

وتوجد فائدة عملية أخرى من عائلة Qwen: لا يلزم أن تختار حسابًا منفصلًا لكل خطوة في المهمة. يمكن البدء بالبحث، ثم فحص لقطة شاشة، ثم إنتاج مسودة أو مادة بصرية داخل بيئة واحدة. مع ذلك، لا ينبغي أن تتحول السهولة إلى ثقة عمياء؛ احتفظ بالوثائق الأصلية، واطلب مراجع قابلة للفحص، وراجع ما سيؤثر في مال أو سمعة أو قرار مهم.

ومنذ 14 أغسطس أصبحت أوزان Max الأولى متاحة فعلاً. النموذج القابل للتنزيل نصي، بسياق أصلي 262,144 رمزاً قابل للتمديد إلى نحو 1.01M؛ أما Max المستضاف فيضيف الرؤية والأدوات وسياق مليون افتراضياً. تظل 2.4T من المعاملات مشروع مركز بيانات، ويجب فحص حدود الترخيص التجارية قبل النشر.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • قدرة رائدة مقابل سعر API مناسب: السعر $2 للإدخال و$6 للإخراج لكل مليون رمز، وذاكرة التخزين $0.25؛ أي قرابة نصف سعر إخراج Kimi K3 السابق.
  • يفحص أكثر من النص: يقبل النص والصورة والفيديو مع سياق 1M، فيجتمع التقرير ولقطة الواجهة والرسم وتسجيل الشاشة في تحقيق واحد.
  • عائلة Qwen أكبر من نافذة دردشة: يجمع Qwen Studio البحث العميق وقطع الويب وتوليد الصور والفيديو وتطبيقات الويب والهاتف وسطح المكتب.
  • عروض العمل الذاتي ملموسة على نحو غير معتاد: تقول Alibaba إن Qwen3.8-Max عمل من مجلد فارغ بلا إشراف لمدة 10–16 يومًا، وبنى harness يتطور ذاتيًا أنجز 265 commit و127 pull request و151 issue. كما تعلن صعود الدقة من 0.60 إلى 0.853 عبر 45 إرسالاً في تحدي نوايا حواري متعدد الوسائط. هذه عروض Alibaba، لكنها توضح حجم العمل المهني الذي تستهدفه.
  • إشارة الواجهة الأولى تنافسية: تسجل Frontend Code Arena في لقطة مبكرة 1668 Elo (#4)؛ دليل مفيد على تفضيل الواجهات لا حكم كامل على الهندسة.
  • الانتقال من الدردشة إلى المنتج عملي: توفر Qwen Studio والسحابة واجهات متوافقة مع OpenAI وAnthropic، فلا يلزم إعادة بناء الوكيل بالكامل.

قيود صادقة

  • الأرقام الرئيسية دليل من الشركة: تغير أدوات الاختبار والإعدادات والمحاولات النتيجة؛ ينبغي أن تدفع إلى تجربة لا أن تحل محلها.
  • حل المشكلات في مستودعات حقيقية ليس فوزًا واضحًا بعد: نتيجة 67.7 في SWE-bench Pro أقل من أفضل Claude، واختبارات الأخطاء المبكرة مختلطة.
  • الاتساع لا يعني الاندماج في كل مكان: لا يعيش Qwen Studio تلقائيًا داخل Gmail وOffice والتقويم والمتصفح وصلاحيات الشركة لدى أغلب الناس.
  • سياق 1M سعة لا ذاكرة مثالية: الصفحات غير المهمة والهدف الغامض قد يربكان النموذج؛ قسّم العمل الكبير إلى مراحل.
  • قد يكون الوصول المبكر خشنًا: أبلغ مستخدمون عن حصص وفوترة وأداء؛ قس مهمة محدودة أولاً.
  • المفتوح لا يعني صغيراً أو بلا شروط: يتوافر Qwen3.8-2.4T-A95B على Hugging Face وModelScope، لكنه يحتاج مركز بيانات. ويضيف الترخيص إظهار الاسم وتصريحاً منفصلاً عند تجاوز عتبات تجارية كبيرة.
03

لمحة عن المعايير

Frontend Code Arena — 1668 Elo (#4، مبكر)

إشارة مبكرة لتفضيل البشر لواجهة مكتملة، وقد يتغير الترتيب.

PaperBench — 93.0 (معلن من Alibaba)

نتيجة بحث معقدة أعلنها المزود، وليست ضمانًا مستقلاً.

IFBench — 82.8 (معلن من Alibaba)

اتباع قوي للتعليمات بحسب الشركة.

Terminal Bench 2.1 — 86.6 (معلن من Alibaba)

نتيجة عالية لوكيل طرفي؛ اختلاف أدوات الاختبار مهم.

SWE-bench Pro — 67.7 (معلن من Alibaba)

إصلاح محترم لكنه ليس متصدرًا.

04

الحكم

يحل Qwen3.8-Max محل Kimi K3 في المرتبة #5 لفئة Everyday Ecosystem: وعد مبكر قريب من الصدارة بتكلفة أقل وعائلة أوسع للبحث والإبداع. وهو جذاب لمن ينتقل بين الوثائق والمدخلات البصرية والبحث والصور والفيديو والبرمجة. يبقى الترتيب مؤقتًا عمدًا؛ فالادعاءات الأوسع تحتاج تحققًا مستقلاً والاندماج اليومي لم يلحق بالقادة بعد. راجع الحقائق والكود والنتائج المهمة.

05

الأسئلة الشائعة