الترتيب #2 ذكاء اصطناعي محلي / خاص — عقلك، جهازك، قواعدك
DeepSeek

DeepSeek-V4-Flash-0731

نموذج MoE فعال بشكل ظاهرة بـ 284B/13B معلمة نشطة يهيمن على سير عمل الوكلاء والبرمجة مع ملاءمته بشكل مريح على الأجهزة المتوسطة.

Open WeightsMIT1M Context
الأفضل لـ

نموذج MoE فعال بشكل ظاهرة بـ 284B/13B معلمة نشطة يهيمن على سير عمل الوكلاء والبرمجة مع ملاءمته بشكل مريح على الأجهزة المتوسطة.

لماذا تفوز

قفزات وكيل مذهلة من إصدار المعاينة الخاص به: حقق 82.7 على Terminal Bench 2.1 و 54.4 على DeepSWE. يتميز ببصمة تكميم 4 بت شبه خالية من الضياع تبلغ 155 جيجابايت فقط.

انتبه إلى

نص فقط بدون إمكانات وسائط متعددة أصلية. بينما يتفوق في برمجة الوكيل، فإن درجة ذكائه العام تتخلف قليلاً عن GLM-5.2.

01

ما هو في الواقع

عند مناقشة الذكاء الاصطناعي المحلي، عادة ما تدور المحادثة حول التنازلات. إما أن تحصل على نموذج ضخم يتطلب مزرعة خوادم لتشغيله، أو نموذج صغير يكافح للحفاظ على السياق عبر جلسة برمجة معقدة. يكسر DeepSeek-V4-Flash-0731 هذا الانقسام.

تم إصدار Flash-0731 كترقية خالصة لما بعد التدريب في 31 يوليو 2026، ويشترك تمامًا في نفس بنية MoE التي يبلغ إجماليها 284 مليار / 13 مليار معلمة نشطة مثل المعاينة السابقة. ومع ذلك، فإن القدرات التي تم إطلاقها في هذا التحديث مذهلة. في Terminal Bench 2.1، يقفز إلى 82.7، وهو ما يكاد يتطابق مع الوزن الثقيل مغلق المصدر Opus 4.8. على DeepSWE، يقفز من 7.3 متواضعة إلى 54.4 المهيمنة. يثبت هذا أنك لا تحتاج إلى تريليون معلمة لبناء وكيل بمستوى الحدود؛ تحتاج فقط إلى تعليم نموذج عالي الكفاءة بالضبط كيفية استخدام الأدوات، والتنقل في المحطات، والتعافي من أخطائه.

سحر Flash-0731 يكمن في ندرته (sparsity). نظرًا لأن 13 مليار معلمة فقط نشطة أثناء الاستدلال، فإنها تتطلب عرض نطاق ذاكرة أقل بكثير من النماذج الكثيفة الضخمة أو نماذج MoE الأثقل مثل GLM-5.2. عند تكميمه بعناية باستخدام تنسيقات GGUF الديناميكية لـ Unsloth، يتم ضغط إصدار 3 بت في حوالي 103 جيجابايت من ذاكرة الوصول العشوائي. يتجاوز هذا حدًا حاسمًا: فهو يجعل البرمجة المستقلة على مستوى الحدود في متناول المطورين الأفراد الذين يشغلون أجهزة ذاكرة موحدة سعة 128 جيجابايت، بدلاً من فرق المؤسسات ذات المجموعات متعددة وحدات معالجة الرسومات.

إنه ليس نموذجًا مثاليًا. إنه أعمى تمامًا عن الصور، وإذا اختبرته في أسئلة المعرفة العامة، فإنه يتخلف قليلاً عن GLM-5.2 الأثقل. ولكن بالنسبة لحالة استخدامه المقصودة - العمل كوكيل برمجة لا هوادة فيه وفعال من حيث التكلفة يتدفق عبر مستودعك المحلي - فإنه لا مثيل له.

عندما تأخذ في الاعتبار ترخيص MIT السخي، ونافذة سياق الرمز المميز التي تبلغ 1 مليون، ودعم فك التشفير التخميني DSpark، فإن DeepSeek-V4-Flash-0731 ليس مجرد بديل للنماذج الأكبر؛ إنه مخطط لمستقبل الذكاء الاصطناعي المحلي الفعال. إنه يوفر الذكاء الذي تحتاجه، بالضبط حيث تحتاجه، دون المطالبة بحاسوب عملاق في المقابل.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • هيمنة الوكيل على نظام غذائي: هذا ليس مجرد نموذج مفتوح آخر؛ إنه قوة وكيل متخصصة. بتسجيله 82.7 على Terminal Bench 2.1 (يقترب من Opus 4.8) و 54.4 على DeepSWE، يثبت Flash-0731 أن ما بعد التدريب يمكن أن يطلق العنان لاستخدام أدوات مستوى الحدود والتفكير متعدد الخطوات دون تضخيم حجم النموذج الأساسي.
  • كفاءة أجهزة غير مسبوقة: مع 13 مليار معلمة نشطة فقط من إجمالي 284 مليار، يتطلب جزءًا صغيرًا من النطاق الترددي للذاكرة الخاص بمنافسيه. باستخدام GGUFs الديناميكية من Unsloth، يتسع إصدار 3 بت في حوالي 103 جيجابايت من ذاكرة الوصول العشوائي (RAM)، مما يجعله قابلاً للتشغيل على أجهزة MacBook بذاكرة موحدة 128 جيجابايت. إنه متاح حقًا للمطورين المحليين الجادين.
  • حرية ترخيص MIT: تحافظ DeepSeek على التزامها بالمصدر المفتوح بترخيص MIT. يمكنك تنزيل الأوزان وتكميمها ونشرها تجاريًا دون قيود. لا توجد شروط مخفية، ولا قفل API، فقط قوة محلية نقية.
  • سياق 1M مصمم للتوسع: مع الاحتفاظ بنافذة سياق ضخمة تبلغ مليونًا من المعاينة، تم تصميم Flash-0731 خصيصًا لتحليل قواعد البيانات البرمجية بأكملها. إنه مزود بدعم فك التشفير التخميني DSpark، مما يوفر تعزيزات كبيرة في الإنتاجية عند معالجة ملفات السجل الضخمة أو المستودعات.

قيود صادقة

  • النص والرمز فقط: مثل العديد من نماذج البرمجة المتخصصة، يفتقر إلى الرؤية الأصلية. لا يمكنك إطعامه بلقطات شاشة لواجهة المستخدم أو المخططات للتصحيح. إذا كان سير عملك يعتمد بشكل كبير على المدخلات متعددة الوسائط، فستحتاج إلى نموذج رؤية منفصل.
  • المعرفة العامة تتخلف قليلاً: بينما يهيمن في البرمجة واستخدام الأدوات، فإن مؤشر ذكاء التحليل الاصطناعي العام الخاص به (50) متخلف قليلاً عن GLM-5.2 (51). لقد تحسن بشكل رئيسي عن طريق الهلوسة أقل، بدلاً من معرفة المزيد خارج مجالاته المتخصصة.
  • مخاطر التكميم العدوانية: في حين أن كم 3 بت الذي يتسع في 103 جيجابايت مذهل، فإن دفع التكميم بقوة يمكن أن يؤدي في بعض الأحيان إلى تدهور التفكير المعقد. ستحتاج إلى التحقق مما إذا كان إصدار 3 بت يحتفظ بالسلوكيات الوكيلة الدقيقة المطلوبة لبيئتك المحددة.
03

لمحة عن المعايير

Terminal Bench 2.1 — 82.7

قفزة هائلة في الاستخدام الوكيل للمحطة، مما يضعه على مسافة قريبة من Claude 4.8 Opus (85.0).

DeepSWE — 54.4

قفزة مذهلة من 7.3 المتواضعة في إصدار المعاينة، تظهر القوة المطلقة لما بعد التدريب في 31 يوليو.

الهندسة المعمارية — 284B الإجمالي / 13B نشط

تصميم Mixture-of-Experts متناثر للغاية يؤدي إلى تقليل FLOPs والنطاق الترددي للذاكرة، مما يسمح بأداء قوي على الأجهزة المقيدة.

AutomationBench Public — 25.1

يضاعف تقريبًا درجة GLM-5.2 البالغة (12.9)، مما يثبت تفوقه في التنفيذ المستقل متعدد الخطوات.

04

الحكم

DeepSeek-V4-Flash-0731 هو درس متقدم في تحسين ما بعد التدريب. بدلاً من زيادة عدد المعلمات الخام، ركزت DeepSeek بشكل بحت على قدرة الوكيل، مما حول نموذج معاينة قويًا إلى قوة مطلقة لبرمجة سير عمل استخدام الأدوات. إنه يتفوق على النماذج الأثقل بكثير في المعايير المستقلة مع تطلب ثلث المعلمات النشطة تقريبًا. بالنسبة للمطورين المحليين الذين لديهم ذاكرة وصول عشوائي سعتها 128 جيجابايت، هذا هو المعيار الذهبي الجديد. قد لا يتغلب على GLM-5.2 في اختبار للمعلومات العامة، ولكن إذا كنت بحاجة إلى نموذج للتنقل بشكل مستقل في محطة، وتصحيح مستودع، واستخدام أدوات دون هلوسة لمحاصرة نفسه، فإن Flash-0731 هو حاليًا الطريقة الأكثر كفاءة للقيام بذلك محليًا.

05

الأسئلة الشائعة