الترتيب #1 ذكاء اصطناعي محلي / خاص — عقلك، جهازك، قواعدك
Alibaba (Qwen Team)

Qwen3.8-27B

Qwen3.8-27B من النماذج المحلية النادرة التي تتوافق تنازلاتها مع عتاد يملكه الناس فعلاً: نقطة تحقق كثيفة واحدة بحجم 27B للنصوص والصور والفيديو والبرمجة والوكلاء الذين يستخدمون الأدوات. تلائم نسخة 4 بت معالجاً رسومياً من فئة 24 جيجابايت، فيما يُبقي ترخيص Apache 2.0 العمل خاصاً ومتاحاً للاستخدام التجاري.

تم التحديث 26 أغسطس 2026 Open WeightsApache 2.027B Dense
الأفضل لـ

Qwen3.8-27B من النماذج المحلية النادرة التي تتوافق تنازلاتها مع عتاد يملكه الناس فعلاً: نقطة تحقق كثيفة واحدة بحجم 27B للنصوص والصور والفيديو والبرمجة والوكلاء الذين يستخدمون الأدوات. تلائم نسخة 4 بت معالجاً رسومياً من فئة 24 جيجابايت، فيما يُبقي ترخيص Apache 2.0 العمل خاصاً ومتاحاً للاستخدام التجاري.

لماذا تفوز

تمنح الاختبارات المستقلة الآن رواية الإطلاق سنداً حقيقياً: يسجل Qwen3.8-27B نتيجة 52 على Intelligence Index من Artificial Analysis و51 على Agentic Index، فيما يضعه تصنيف Image-to-WebDev من Arena في المركز #7 بين أنظمة رائدة أكبر بكثير. وتظل نتائج Qwen الذاتية في البرمجة واستخدام الحاسوب قوية، ويجمع النموذج بين سياق 262K واستدلال قابل للضبط ورؤية وفيديو أصليين وترخيص Apache 2.0.

انتبه إلى

تدعم المؤشرات المركبة المستقلة قدرة النموذج العامة والوكيلة، لكن معظم نتائج البرمجة واستخدام الحاسوب المحددة لا تزال تأتي من بيئات اختبار Qwen نفسها. قد يكون إعداد الاستدلال الافتراضي xhigh بطيئاً ومفرطاً في الإسهاب على العتاد المحلي؛ ابدأ بـlow أو medium، أو عطّل التفكير في العمل التفاعلي العادي. ولا تزال حدود تكميم Q4 وذاكرة KV تفصل بين تنزيل بحجم 18 جيجابايت والاستخدام العملي لسياق 262K.

01

ما هو في الواقع

تخيل أنك تختار ورشة كاملة، لا مطرقة واحدة. يجب أن يدخل نموذج الذكاء الاصطناعي المحلي من الباب، ويترك مساحة على طاولة العمل، ويفهم المادة أمامه، ويستخدم الأدوات المتاحة من دون إرسال العمل الخاص إلى مكان آخر. يجذب Qwen3.8-27B الاهتمام لأن هذه المتطلبات تجتمع في نقطة تحقق واحدة. إنه نموذج كثيف للرؤية واللغة بحجم 27 مليار معامل، مبني على الأساس الهجين لـQwen3.5: تتبع ثلاث طبقات Gated DeltaNet طبقة انتباه كامل في نمط متكرر. تساعد أقسام الانتباه الخطي على الكفاءة، بينما يسمح الانتباه الكامل الدوري للنموذج بربط التفاصيل المتباعدة.

لكلمة «متعدد الوسائط» وزن حقيقي هنا. فهذا ليس نموذجاً نصياً أضيف إليه زر مزخرف لرفع الصور. تدربه Qwen وتوزعه كنموذج يحول الصورة والنص إلى نص، مع إدخال أصلي للصور والفيديو. يستطيع وكيل برمجة محلي فحص لقطة شاشة وقراءة مربع خطأ ومقارنته بملفات المصدر وتشغيل الأدوات، من دون إرسال الصورة أولاً إلى خدمة رؤية سحابية منفصلة. وتصف بطاقة النموذج أيضاً مهام المستندات والرسوم والمتصفحات والهواتف والفيديو الممتد لساعات. لذلك يبدو Qwen3.8-27B أقرب إلى منضدة عمل خاصة للأغراض العامة منه إلى محرك متخصص للإكمال التلقائي.

تفسر أرقام الإطلاق الحماس. تعلن Qwen عن 61.7 في SWE-bench Pro و73.0 في Terminal Bench 2.1 و42.2 في DeepSWE 1.1 و90.3 في LiveCodeBench v6. وفي أعمال الوكلاء متعددي الوسائط تعلن عن 84.3 في OSWorld-Verified و64.8 في WebArena-Verified و70.7 في CoWorkBench. وبالمقارنة مع Qwen3.6-27B، تظهر المكاسب في إصلاح المستودعات وتشغيل الطرفية والعمل المكتبي واستخدام الحاسوب، لا في اختبار واحد جرى اختياره لملاءمة النتيجة. وهذا الاتساع أهم من أي رقم منفرد.

تشير أولى القياسات الخارجية الآن إلى الاتجاه العام نفسه. تمنح Artificial Analysis إعداد xhigh نتيجة 52 على Intelligence Index و51 على Agentic Index؛ وتتجاوز النتيجة الثانية بقليل نتيجة Opus 4.8 التاريخية عند أقصى جهد في اللقطة المشار إليها. وفي لوحة Image-to-WebDev من Arena، كان Qwen3.8-27B في المركز #7 بنتيجة 1574 و1,686 صوتاً في 25 أغسطس، مع نطاق ترتيب قائم على الثقة من المركز الخامس إلى العاشر. من اللافت أن يتداخل نموذج 27B قابل للتنزيل إحصائياً مع أنظمة سحابية رائدة في تحويل لقطات الشاشة إلى واجهات. لا تعيد هذه الاختبارات إنتاج إعداد Qwen المحلي بدقة، لكنها دليل مستقل على أن جدول الإطلاق لم يكن يصف سراباً.

لكن المعيار جهاز مختبر، لا قانوناً من قوانين الطبيعة. تستخدم نتائج Qwen في SWE-bench Pro وDeepSWE بيئة Claude Code وسياقاً طويلاً وإعدادات أخذ عينات معلنة. كما صححت Qwen مهام إشكالية في SWE-bench Pro وأعادت تقييم خطوط الأساس. أما CoWorkBench وQwenSWEBench فاختباران داخليان. ويستخدم MathVision مطالبة ثابتة وشروحاً مصححة، فيما تعتمد بعض اختبارات الوكلاء البصريين على مقيمين أو هياكل تشغيل محددة. لا يجعل هذا النتائج عديمة الفائدة؛ بل يوضح ما جرى قياسه: Qwen3.8 داخل منظومة منتقاة بعناية. وقد يعطي Ollama أو LM Studio أو llama.cpp أو وكيل منزلي الصنع نتيجة مختلفة.

وتحتاج قصة العتاد إلى القدر نفسه من الصراحة. يبلغ مجموع أجزاء الأوزان الرسمية BF16 نحو 55.6 جيجابايت قبل أعباء التشغيل. ويبلغ ملف Q4_K_M من Unsloth نحو 17.1 جيجابايت، ويضيف عارض الرؤية قرابة 0.93 جيجابايت. وهكذا يمكن لتنزيل حجمه 18 جيجابايت أن يلائم بطاقة 24 جيجابايت، لكن الجيجابايتات الست المتبقية ليست ترفاً فارغاً؛ إذ يجب أن تستوعب المخازن وذاكرة KV التي تتذكر الرموز السابقة. وكلما طال السياق زاد استهلاك الذاكرة. تمثل بطاقة 24 جيجابايت نقطة بداية موثوقة لعمل محلي مفيد، لا وعداً بـ262,144 رمزاً بأقصى سرعة ودقة كاملة للذاكرة المخبأة.

تمنح Qwen المشغلين ضوابط جيدة على نحو غير معتاد. تبلغ النافذة الأصلية 262,144 رمزاً، وتوثق بطاقة النموذج توسيع YaRN نحو مليون في vLLM وSGLang وTokenSpeed. يُفعّل الاستدلال افتراضياً، مع مستويات جهد low وmedium وxhigh، فيما يستطيع preserve_thinking حمل سياق الاستدلال عبر محادثة الوكيل. كما دربت Qwen رأساً لتوقع عدة رموز، يمكن لأنظمة الاستدلال المتوافقة استخدامه لتسريع فك الترميز.

إعداد المصنع هو الإعداد الخطأ لكثير من الأعمال العادية. تعتمد Qwen استدلال xhigh افتراضياً، وسجلت Artificial Analysis مقدار 160 مليون رمز إخراج عبر مؤشرها، مقابل وسيط بلغ 43 مليوناً لنماذج مفتوحة مشابهة. وفي اختبار Simon Willison المحلي، استهلك رسم SVG بسيط لبجع 22,276 رمز استدلال و21 دقيقة؛ وخفض تعطيل التفكير مدة التشغيل إلى 137 ثانية. ليست هذه خسارة في الجودة، بل درس في التشغيل: ابدأ بجهد low أو medium — أو بلا تفكير للتحويلات البسيطة — وارفع المهمة إلى xhigh فقط حين يستحق البحث الإضافي الانتظار. ويحتاج YaRN الثابت وأخذ العينات وحفظ حالة الاستدلال إلى المعالجة المتعمدة نفسها.

ينبغي أن يكون الاختبار الأول عادياً عن قصد. حمّل التكميم الذي يمكنك إبقاؤه في الذاكرة، واختر نافذة سياق تترك هامشاً للذاكرة، ثم أعط Qwen مهمة حقيقية ذات خط نهاية ظاهر: أصلح اختباراً فاشلاً، أو استخرج أرقاماً من تقرير خاص، أو أعد إنتاج واجهة من لقطة شاشة. سجل ما إذا اكتملت المهمة، وعدد المحاولات التي احتاجتها، وسرعة التنفيذ، ومقدار التصحيح البشري المتبقي. ثم شغّل Qwen3.6 أو نموذجك الحالي بالشروط نفسها. تقيس هذه التجربة ورشتك أنت، لا مختبر شخص آخر.

في الوقت الحاضر، يمثل Qwen3.8-27B أفضل خيار افتراضي عند تقاطع الخصوصية والقدرة وتعدد الوسائط والعتاد الممكن اقتناؤه. قد تكون النماذج المفتوحة الأكبر أذكى في مجالات ضيقة أو صعبة، وقد تكون النماذج الأصغر أسرع. يحتل Qwen الوسط المفيد: قوي بما يكفي للعمل الجاد، وصغير بما يكفي ليعيش تحت مكتب واحد، ومفتوح بما يكفي ليبقى ذلك المكتب ملكك بالكامل.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • وكيل محلي متعدد الوسائط عملي بحق: تقرأ نقطة التحقق نفسها النصوص ولقطات الشاشة والرسوم والمستندات والفيديو، ثم تستدل وتستدعي الأدوات. لا حاجة إلى تمرير سير عمل خاص عبر نموذج للرؤية وآخر للبرمجة لمجرد فحص عطل في واجهة أو استخراج جدول قبل تعديل الشفرة.
  • مكاسب الإطلاق تحظى الآن بسند مستقل: يرتفع Qwen3.8-27B في اختبارات Qwen من 53.5 لنموذج Qwen3.6-27B إلى 61.7 في SWE-bench Pro، ومن 63.4 إلى 73.0 في Terminal Bench 2.1، ومن 13.3 إلى 42.2 في DeepSWE 1.1. وتمنحه Artificial Analysis بصورة مستقلة 52 على Intelligence Index و51 على Agentic Index، وهما نتيجتان قويتان على نحو غير معتاد لنموذج مفتوح بحجم 27B.
  • حجم 27B مفيد، لا صغير فحسب: تبلغ أوزان Q4_K_M من Unsloth نحو 17.1 جيجابايت، ويبلغ عارض الرؤية قرابة 0.93 جيجابايت. وهذا يجعل معالجاً رسومياً بسعة 24 جيجابايت أو جهاز Apple Silicon مجهزاً بما يكفي موطناً واقعياً للنموذج، مع اختلاف المساحة المتبقية حسب محرك التشغيل ودقة الذاكرة المخبأة وطول السياق.
  • ضوابط السياق الطويل والتفكير متكاملة على نحو غير معتاد: يبلغ السياق الأصلي 262,144 رمزاً؛ وتوثق Qwen توسيع YaRN إلى 1M في vLLM وSGLang وTokenSpeed. يمكن تعطيل التفكير أو ضبطه على low أو medium أو xhigh، وحفظه بين الجولات في حلقات الوكيل الطويلة. لهذه الضوابط أهميتها لأن xhigh هو الإعداد الافتراضي، لا نقطة البداية المعقولة لكل مهمة.
  • ترخيص مفتوح ومنظومة نشر سريعة: نقطة التحقق الرسمية مرخصة بموجب Apache 2.0. توثق Qwen دعم vLLM وSGLang وTokenSpeed؛ ويعرض Ollama بالفعل نسخة qwen3.8:27b بحجم 18 جيجابايت، فيما ينشر Unsloth تكميمات GGUF من نحو 9 إلى 31.5 جيجابايت.

قيود صادقة

  • التأكيد المستقل واسع، لكنه لا يعيد إنتاج كل ادعاء: تدعم Artificial Analysis وArena الآن الرواية العامة للذكاء والعمل الوكيلي والبرمجة البصرية. لكن Qwen نفذت معظم مقارنات المهام البارزة، وخلطت اختبارات عامة مع QwenSWEBench وCoWorkBench وRecreationBench الداخلية. ويستخدم SWE-bench Pro وDeepSWE بيئة Claude Code، ولذلك يقيسان منظومة نموذج مع هيكل تشغيل، لا الأوزان المجردة في كل تطبيق محلي.
  • أربعة وعشرون جيجابايت لا تشتري سياق 262K كاملاً: أوزان النموذج ليست سوى الحقيبة الأولى. يحتاج عارض الرؤية ومخازن التشغيل وذاكرة KV المتنامية إلى مساحة أيضاً. تستطيع بطاقة 24 جيجابايت تشغيل نسخة 4 بت، لكن المطالبات الطويلة جداً تتطلب ذاكرة مخبأة أصغر أو مكمّمة، أو تفريغاً جزئياً إلى CPU، أو ذاكرة أكبر.
  • التكميم يغير الشيء الذي يجري قياسه: لا يثبت جدول Qwen أن كل ملف GGUF من 4 بت يحافظ على جودة الاستدلال والرؤية واستخدام الأدوات نفسها. قد يكون الفرق صغيراً أو خاصاً بمهمة، لكن خيار الإنتاج ينبغي أن يُختبر عند التكميم وإعداد السياق نفسيهما اللذين تنوي استخدامهما.
  • قد يحوّل الإعداد الافتراضي مهمة سريعة إلى تأمل طويل: تعتمد Qwen الاستدلال xhigh افتراضياً. استغرق اختبار SVG البسيط الذي أجراه Simon Willison مدة 21 دقيقة واستهلك 22,276 رمز استدلال، مقابل 137 ثانية مع تعطيل التفكير. ابدأ بجهد low أو medium في العمل التفاعلي، واحتفظ بـxhigh للمهام الصعبة فعلاً، وتذكر أن إعدادات أخذ العينات ومخططات الأدوات وقوالب المحادثة وYaRN الثابت تؤثر أيضاً في النتيجة.
03

لمحة عن المعايير

إصلاح المستودعات — SWE-bench Pro: 61.7

تعلن Qwen عن 61.7 مقابل 53.5 لنموذج Qwen3.6-27B. اختُبرت النماذج باستخدام بيئة Claude Code ودرجة حرارة 1.0 وtop-p بقيمة 0.95 وسياق 256K، وعلى مجموعة منقحة صُححت فيها المهام الإشكالية.

وكيل الطرفية — Terminal Bench 2.1: 73.0

زيادة قدرها 9.6 نقاط على Qwen3.6-27B في جدول Qwen. إنها إشارة قوية للعمل متعدد الخطوات في سطر الأوامر، وإن ظلت السرعة والنجاح محلياً تابعين لهيكل الوكيل والأدوات المتاحة.

استخدام الحاسوب — OSWorld-Verified: 84.3

هذه أكبر مفاجأة عملية: تسجل نقطة تحقق مفتوحة ومدمجة نتيجة أعلى من كل النماذج المقارنة في جدول Qwen، بما فيها Opus 4.6 Max عند 72.7. وتكتسب إعادة الإنتاج المستقلة أهمية خاصة لأن نتائج استخدام الحاسوب شديدة الحساسية لبيئة التشغيل المحيطة.

البصمة المحلية — Q4_K_M مع عارض الرؤية: نحو 18 جيجابايت

تسجل بيانات المستودع ملف Q4_K_M GGUF بحجم 17.1 جيجابايت وعراض رؤية BF16 بحجم يقارب 0.93 جيجابايت. تتسع الملفات على عتاد من فئة 24 جيجابايت، فيما تحدد الذاكرة المتبقية السياق القابل للاستخدام وعدد العمليات المتزامنة.

المؤشر المركب المستقل — Artificial Analysis Intelligence Index: 52

يسجل إعداد xhigh نتيجة 52، معادلاً GPT-5.6 Luna عند أقصى جهد في اللقطة المشار إليها، ومحتلاً المركز الأول في فئة Artificial Analysis للمقارنة بين النماذج مفتوحة الأوزان من 4B إلى 40B. واستخدم 160 مليون رمز إخراج عبر المؤشر مقابل وسيط قدره 43 مليوناً، ولذلك توثق النتيجة أيضاً إسهاباً استثنائياً.

البرمجة البصرية — Arena Image-to-WebDev: #7، النتيجة 1574

في 25 أغسطس، احتل نموذج 27B المركز السابع بين 44 نظاماً بعد 1,686 صوتاً، مع نطاق ترتيب من 5 إلى 10، وتداخل إحصائياً مع نماذج أكبر وأغلى بكثير. تمثل Arena دليلاً قائماً على التفضيل لا معياراً مضبوطاً لتكميم محلي، لكنها تدعم بصورة مستقلة قوة النموذج العملية في الجمع بين الرؤية والبرمجة.

04

الحكم

يظل Qwen3.8-27B توصيتنا الأولى في فئة الذكاء الاصطناعي المحلي والخاص لأنه يقدم للفرد الحزمة الإجمالية الأكثر فائدة: قدرة جادة في البرمجة والعمل الوكيلي، ورؤية وفيديو أصليان، ونافذة سياق طويلة، وحرية Apache 2.0، وبصمة مكمّمة يمكن أن تلائم معالجاً رسومياً استهلاكياً متطوراً واحداً. تجعل Artificial Analysis وArena هذا الترتيب أقل اعتماداً الآن على جداول إطلاق Qwen. لا يتفوق النموذج على كل نموذج أكبر، ولا تثبت اختبارات API المستقلة أن كل نسخة Q4 محلية تتصرف بالطريقة نفسها. تعامل مع تقييم 9.2 بوصفه توصية قوية لكنها حساسة للإعداد: ابدأ بمستوى أدنى من استدلال xhigh، واختبر التكميم والأدوات والسياق نفسها التي ستنشرها، وأبق المراجعة البشرية ملازمة للأفعال ذات العواقب.

05

الأسئلة الشائعة