الترتيب #4 البرمجة — ذكاء اصطناعي يكتب شيفرة إنتاجية
Alibaba / Qwen Team

Qwen3.8-Max

يأخذ Qwen3.8-Max المرتبة #4 للبرمجة كمنافس ذي قيمة عالية: سياق 1M ومدخلات صور وفيديو وإشارة مبكرة قوية للواجهة وأسعار API أقل كثيرًا من النماذج الممتازة. الترتيب مؤقت لأن الأرقام الرئيسية من المزود، وأدلة إصلاح المستودعات المستقلة لا تزال قليلة ومتباينة.

تم التحديث 14 أغسطس 2026 Agentic CodingVision + Video1M Context
الأفضل لـ

يأخذ Qwen3.8-Max المرتبة #4 للبرمجة كمنافس ذي قيمة عالية: سياق 1M ومدخلات صور وفيديو وإشارة مبكرة قوية للواجهة وأسعار API أقل كثيرًا من النماذج الممتازة. الترتيب مؤقت لأن الأرقام الرئيسية من المزود، وأدلة إصلاح المستودعات المستقلة لا تزال قليلة ومتباينة.

لماذا تفوز

تعلن Alibaba عن 86.6 في Terminal Bench 2.1، وتضع لقطة مبكرة من Frontend Code Arena Qwen3.8-Max في #4 عند 1668 Elo. يقبل النموذج النص والصورة والفيديو، ويملك 2.4T إجمالًا / 95B نشطًا وسياق 1M وAPI متوافقة بسعر $2/$6 لكل مليون رمز إدخال/إخراج.

انتبه إلى

المنافس السريع والرخيص ليس بطل البرمجة تلقائيًا. النتائج تعتمد على harness، و67.7 في SWE-bench Pro خلف القادة وبعض اختبارات الأخطاء المبكرة ضعيفة. يجب أن يحسم CI الخاص بك قبل منحه وصول الإنتاج.

01

ما هو في الواقع

المثير في Qwen3.8-Max ليس فوزه بكل صف. المهم هو اجتماع السياق الكبير والمدخل البصري وطموح الوكيل وسعر يسمح بالتكرار. البرمجة هي المحاولة والفحص ثم المحاولة من جديد؛ فاتورة رموز أصغر تجعل هذه الدورة أكثر عملية.

بسعر $2 للإدخال و$6 للإخراج لكل مليون رمز، تقل تكلفة API كثيرًا عن $3/$15 السابق لـ Kimi. يفيد ذلك عندما يعيد الوكيل قراءة المستودع أو يراجع نموذج ثانٍ تصحيحًا. الرخص لا يعني الصحة، لكنه يجعل الاختبارات والإعادات والمراجعة المستقلة أقل كلفة.

في لقطة مبكرة من Frontend Code Arena، يقف Qwen3.8-Max في #4 عند 1668 Elo. يفضل الناس واجهة مكتملة من دون معرفة النموذج الذي صنعها. هذا مهم للنموذج الأولي، لكن صفحة جميلة قد تخفي كودًا هشًا وسيتحرك الترتيب مع مزيد من الأصوات.

يتسع سياق 1M للنص واللقطة والتصميم والتسجيل وكمية كبيرة من المستودع: طاولة عمل كبيرة لا ضمان. تعلن Alibaba 86.6 في Terminal Bench 2.1، لكن أدوات الاختبار والأدوات والإعادات تؤثر في الرقم. وتدعو 67.7 في SWE-bench Pro واختبارات الأخطاء المختلطة إلى الحذر مع الكود القديم.

لهذا تبقى #4 مؤقتة: قوية للواجهة والتصحيح البصري والتحقيقات الطويلة. تتيح الأوزان المفتوحة الآن نشراً خاصاً للنموذج النصي، لكن CI وكلفة البنية والترخيص ومراجعة الفروق تظل الحكم.

وفي أعمال الواجهة، ترتيب Arena أنفع مما يبدو. المستخدم لا يرى إن كان لدى النموذج تفسير داخلي جميل؛ بل يرى هل التنقل والمسافات وحالات الخطأ والخطوة التالية مفهومة. لذلك يكون تفضيل الناس لواجهة مكتملة من دون معرفة النموذج إشارة جيدة للنموذج الأولي والعمل المنتج. لكنه لا يغني عن فحص الإتاحة والاستجابة للهاتف وسرعة التحميل والكود تحت الشاشة. ينبغي أن تكون هذه العناصر الأربعة جزءًا من الطلب ومعيار القبول.

ولا ينبغي أن يصبح مليون رمز دعوة لرمي المستودع كله بلا ترتيب. الأفضل إعداد ملف عمل: الهدف والملفات ذات الصلة والخطأ القابل لإعادة الإنتاج والاختبارات وقرارات البنية أولاً، ثم التاريخ الإضافي عند الحاجة. بهذه الطريقة يستطيع الوكيل بناء فرضية واختبارها بدل المرور الصامت على آلاف الصفحات. يمكن لـQwen أن يقدم تحقيقًا أوليًا قويًا في خطأ صعب، لكن الإنسان يبقى من يقرر أي تغيير صغير بما يكفي لدمجه بأمان.

ولمقارنته بالوكيل الحالي بعدل، استخدم المهمة والأدوات والحد الزمني والاختبارات نفسها. لا تسجل فقط هل نجح التصحيح في النهاية، بل كم محاولة وكم رمز وكم دقيقة بشرية احتاج. اقتصاد Qwen له معنى حين يزيد عدد المحاولات الجيدة التي تم فحصها، لا حين ينتج نصًا أكثر فحسب.

أفضل تجربة أولى ليست مشروعًا بلا حدود، بل مشكلة لها اختبار فاشل ومعيار قبول واضح. اطلب من Qwen شرح خطته قبل التعديل، وشغّل الاختبار بعده، ثم قارنه بمساعدك الحالي على المشكلة نفسها. بهذه الطريقة يقيس الفريق جودة الإصلاح والوقت واستهلاك الرموز معًا، بدلاً من الانبهار برقم لوحة ترتيب واحد.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • السعر يتيح محاولات حقيقية أكثر: $2/$6 لكل مليون رمز يجعل التنقيح المتكرر والمراجعة الثانية أيسر من سعر Kimi السابق $3/$15.
  • البداية قوية في الواجهة: 1668 Elo (#4) في Frontend Code Arena إشارة UI جيدة، لا برهان كامل على هندسة المستودع.
  • المهام المرئية والطويلة مناسبة للمدخلات: النص واللقطات والمخططات والفيديو مع سياق 1M مفيد لتحويل التصميم إلى كود والتصحيح.
  • نتيجة الطرفية المعلنة مرتفعة: 86.6 في Terminal Bench 2.1 تشير إلى أن نظام Qwen يعمل مع الأدوات والتغذية الراجعة.
  • يمكن ضبط التفكير: لدى reasoning_effort ثلاث درجات، وpreserve_thinking مفعّل افتراضيًا.
  • التبني لا يحتاج تكاملاً خاصًا: واجهات OpenAI وAnthropic المتوافقة تسمح بتجربة النموذج داخل الوكيل الحالي.

قيود صادقة

  • أهم دليل برمجي غير مؤكد مستقلاً: تتغير النتيجة مع harness والموجه والإعادات والأدوات.
  • إصلاح المستودع هو الفجوة الواضحة: 67.7 في SWE-bench Pro ومجموعات أخطاء مختلطة لا تكفي لفوز.
  • السياق الكبير قد يطيل خطة خاطئة: ما زالت الالتزامات الصغيرة والاختبارات ونقاط التحقق ضرورية.
  • الجودة والسرعة والتكلفة مثلث: التفكير العالي يستهلك المخرجات والحصة؛ قس حسب التصحيح المختبر.
  • الوصول والتأخير يختلفان إقليميًا: تحقق من الدفع والحصص والتوفر حيث يعمل فريقك.
  • الأوزان المفتوحة لا تحل العتاد والترخيص: النموذج النصي 2.4T/95B النشط متاح الآن، لكن استضافته تحتاج مركز بيانات، ويضيف الترخيص شروطاً للمنتجات والخدمات الضخمة.
03

لمحة عن المعايير

Frontend Code Arena — 1668 Elo (#4، مبكر)

إشارة بشرية قوية للواجهة، وليست ترتيب هندسة كامل.

Terminal Bench 2.1 — 86.6 (Alibaba)

نتيجة طرفية عالية؛ أدوات الاختبار تحد المقارنة المباشرة.

SWE-bench Pro — 67.7 (Alibaba)

محترمة لكنها أقل من أفضل الإصلاحات.

PaperBench — 93.0 (Alibaba)

إشارة للتخطيط وليست اختبار كود مباشر.

IFBench — 82.8 (Alibaba)

اتباع جيد لمعايير قبول مفصلة.

04

الحكم

يحل Qwen3.8-Max محل Kimi K3 في #4 للبرمجة لأن إشارات الواجهة والطرفية المبكرة تجتمع مع اقتصاد API أفضل كثيرًا. إنه مرشح ممتاز بجانب الوكيل الحالي للعمل البصري وتصحيح السياق الطويل والتكرار الحساس للتكلفة. لا يرتفع بعد: نتائج المزود وSWE-bench Pro غير المتصدر وتقارير الأخطاء المختلطة تتطلب تجربة مباشرة مع CI ومراجعة.

05

الأسئلة الشائعة