دليل مرتب

البرمجة — ذكاء اصطناعي يكتب شيفرة جاهزة للإنتاج

هذه وكلاء برمجة، لا ألعاب إكمال تلقائي. يتصدر GPT-6 Astra لأنه ينجز عمل الطرفية بأقل عدد من الرموز، بينما يتعادل معه Claude Opus 5.5 في الاختبارات المستقلة ويتفوق في قواعد الشيفرة الكبيرة والمتشابكة. ويُعد Claude Sonnet 5.5 الخيار السريع بنصف سعر الرمز للأخطاء والميزات محددة النطاق. ويقدّم GPT-6.1 Sol وGrok 4.7 برمجة قريبة من القمة بجزء من السعر، فيما يكمل GLM-5.3 وGLM-5.3-Flash وQwen3.8-Max القائمة بخيارات ذات قيمة ممتازة.

القرار أولاً

ترتيبنا

ابدأ بالفائز، ثم قارن المفاضلات التي قد تغيّر الإجابة بالنسبة لك.

#1 البرمجة

GPT-6 Astra

OpenAI

يتوّج GPT-6 Astra عرش البرمجة بالطريقة الصادقة نفسها التي تمسك بها GPT-5.6 بالتاج: بإنجاز العمل ذي الطابع الوكيلي — جلسات الطرفية، وخطوط الأنابيب المتعثرة، وتحليل الحوادث، وإعداد بيئة العمل بالكامل — مدعومًا الآن بتصدره الجديد لمنصة Code Arena التابعة لـ Arena.ai (بـ 1797 نقطة في WebDev) مع استهلاك نحو ثلث رموز Sol.

لماذا تفوز

تصدر المركز الأول الجديد في منصة Code Arena التابعة لـ Arena.ai في مسار WebDev بـ 1797 نقطة (بفارق +35 نقطة عن Claude Fable 5.1 Max عند 1762، و+109 عن Opus 5 Max عند 1688، و+180 عن Sol في المركز 13)، متصدرًا فئات تحليل البيانات، والمنتجات الاستهلاكية، وأدوات إنشاء المحتوى. بالإضافة إلى 57.7–57.9% على Terminal-Bench 4.0 (مقابل 55.8% لـ Fable 5.1)، وأفضل نتيجة بالجدول على DeepSWE v1.1 بـ 74.1%، و64.6% على Terminal-Bench Science، و88% pass@1 / 99.2% pass@4 على SRE-Bench، و100% على ExploitBench. ورغم أن منصة Artificial Analysis الخاصة تضع Fable 5.1 متقدمًا قليلًا (70 مقابل 67)، يعيد Astra رسم حدود كفاءة باريتو عند 40 دولارًا لكل مليون رمز مدمج ويستهلك نحو ثلث رموز Sol.

العيب

حتى مع تتويجه بالمركز الأول في Code Arena لتطوير الويب وأدوات المنتجات، ما زال Fable 5(.1) يحمل الرقم القياسي في SWE-Bench Pro ويتصدر مؤشر Artificial Analysis الخاص بوكلاء البرمجة (70 مقابل 67). سعر API يعادل 2.5 ضعف Sol عند 10/50 دولارًا، وقراءة الذاكرة المؤقتة تكلف أربعة أضعاف الـ 0.25 دولار لدى Fable 5.1، والإجابات المقتضبة تتخطى خطوات صقل التقارير، والضمانات السيبرانية الأقوى تزيد الاحتكاك في العمل القريب من اختبار الثغرات. جداول الإطلاق تحركت بعد النشر: تعامل مع أي رقم منفرد بهامش ±1–2 نقطة.

9.9 تقييم التحرير
اقرأ المراجعة
الأفضل لـ

يتوّج GPT-6 Astra عرش البرمجة بالطريقة الصادقة نفسها التي تمسك بها GPT-5.6 بالتاج: بإنجاز العمل ذي الطابع الوكيلي — جلسات الطرفية، وخطوط الأنابيب المتعثرة، وتحليل الحوادث، وإعداد بيئة العمل بالكامل — مدعومًا الآن بتصدره الجديد لمنصة Code Arena التابعة لـ Arena.ai (بـ 1797 نقطة في WebDev) مع استهلاك نحو ثلث رموز Sol.

لماذا تفوز

تصدر المركز الأول الجديد في منصة Code Arena التابعة لـ Arena.ai في مسار WebDev بـ 1797 نقطة (بفارق +35 نقطة عن Claude Fable 5.1 Max عند 1762، و+109 عن Opus 5 Max عند 1688، و+180 عن Sol في المركز 13)، متصدرًا فئات تحليل البيانات، والمنتجات الاستهلاكية، وأدوات إنشاء المحتوى. بالإضافة إلى 57.7–57.9% على Terminal-Bench 4.0 (مقابل 55.8% لـ Fable 5.1)، وأفضل نتيجة بالجدول على DeepSWE v1.1 بـ 74.1%، و64.6% على Terminal-Bench Science، و88% pass@1 / 99.2% pass@4 على SRE-Bench، و100% على ExploitBench. ورغم أن منصة Artificial Analysis الخاصة تضع Fable 5.1 متقدمًا قليلًا (70 مقابل 67)، يعيد Astra رسم حدود كفاءة باريتو عند 40 دولارًا لكل مليون رمز مدمج ويستهلك نحو ثلث رموز Sol.

انتبه إلى

حتى مع تتويجه بالمركز الأول في Code Arena لتطوير الويب وأدوات المنتجات، ما زال Fable 5(.1) يحمل الرقم القياسي في SWE-Bench Pro ويتصدر مؤشر Artificial Analysis الخاص بوكلاء البرمجة (70 مقابل 67). سعر API يعادل 2.5 ضعف Sol عند 10/50 دولارًا، وقراءة الذاكرة المؤقتة تكلف أربعة أضعاف الـ 0.25 دولار لدى Fable 5.1، والإجابات المقتضبة تتخطى خطوات صقل التقارير، والضمانات السيبرانية الأقوى تزيد الاحتكاك في العمل القريب من اختبار الثغرات. جداول الإطلاق تحركت بعد النشر: تعامل مع أي رقم منفرد بهامش ±1–2 نقطة.

#2

Claude Opus 5.5

Anthropic

Claude Opus 5.5 هو نموذج البرمجة الذي تستدعيه حين تكون المهمة ضخمة ومتشابكة: ترحيل يمتد عبر مئات آلاف الأسطر، أو خلل يعبر خمس خدمات، أو نظام قديم لم يعد أحد يفهمه تمامًا. في اختبارات Anthropic نفسها يتقدّم على GPT-6 Astra، وفي الاختبارات المستقلة يتعادلان. ولا يحتل المركز الثاني بدل الأول إلا لأن Astra ينجز عمل الطرفية نفسه برموز أقل بكثير.

9.9 تقييم التحرير
اقرأ المراجعة
#3

Claude Sonnet 5.5

Anthropic

Claude Sonnet 5.5 هو نموذج البرمجة الذي يمكنك تركه يعمل طوال اليوم: سريع، وسعر رمزه نصف سعر Opus 5.5، وجيد بما يكفي لكي لا تحتاج معظم إصلاحات الأخطاء والميزات الجديدة وإعادة الهيكلة إلى النموذج الرائد أبدًا. لكن لا تدفع مؤشر الجهد إلى أقصاه: فعند أعلى مستوى يكتب أكثر من أي نموذج قاسته Artificial Analysis، بل تسوء بعض نتائجه.

9.8 تقييم التحرير
اقرأ المراجعة
#4

GPT-6.1 Sol

OpenAI

نموذج GPT-6.1 Sol هو وكيل البرمجة الذي يمكنك تركه يعمل طوال اليوم دون أن تقلق بشأن الفاتورة. في الاختبارات المستقلة، يتأخر هذا النموذج بنقطة أو نقطتين فقط عن نموذج OpenAI الرائد GPT-6 Astra، ومع ذلك فإن تكلفة المهمة النموذجية لا تتجاوز الربع. لم يتغير سعر الرمز (Token) مقارنة بنموذج GPT-6 Sol (2 دولار للإدخال و10 دولارات للإخراج لكل مليون رمز)، إلا أن إعادة قراءة الكود المخزن في الذاكرة المؤقتة (Cache) أصبحت تكلف 0.10 دولار فقط لكل مليون رمز، وهنا تبرز قيمة هذه الوفورات بشكل خاص مع مستودعات الأكواد الكبيرة.

9.8 تقييم التحرير
اقرأ المراجعة
#5

محرك تفكير من فئة Mythos تم تحسينه للبرمجة المستقلة (Agentic Coding). نفس أوزان Mythos 5.1 المقيد، لكنه مُحسّن بخصم 75% على الذاكرة المؤقتة (Cache) مما يغير اقتصاديات الهندسة طويلة الأمد. أفضل استخدام له في Claude Code، حيث يتصدر مجاله بدرجة 70 في AA Coding Agent.

9.8 تقييم التحرير
اقرأ المراجعة
#6

Grok 4.7

xAI

Grok 4.7 هو أرخص نموذج برمجة جادّ بالقرب من قمة الترتيب. مقابل دولارين للإدخال و6 دولارات للإخراج لكل مليون رمز، يسجّل 71.0% في DeepSWE و46.3% في CursorBench 4.0، ويعمل مباشرة داخل Cursor وGrok Build. إنه شريك برمجة قوي للعمل اليومي، لكنه ليس بعد الوكيل الذي تتركه وحده في الطرفية لساعات.

9.7 تقييم التحرير
اقرأ المراجعة
#7

GLM-5.3

Z.ai (Zhipu AI)

وكيل برمجة ثقيل مفتوح الأوزان، دُرّب للجزء الذي يأتي بعد الإجابة الأولى: التخطيط والتعديل والاختبار والتعافي والحفاظ على الاتجاه خلال المهام الطويلة داخل المستودعات.

9.2 تقييم التحرير
اقرأ المراجعة
#8

Qwen3.8-Max

Alibaba / Qwen Team

منافس ذو قيمة عالية لبرمجة السياق الطويل والمهام البصرية، يحتل الآن المرتبة السادسة بعد أن وضعته الاختبارات المستقلة خلف النموذج الرائد GLM-5.3. يظل نقطة الفحص (checkpoint) القابلة للتنزيل من فئة Max استثنائية، لكن 2.4 تريليون معلمة تجعل الاستضافة الذاتية مشروعاً بحجم مركز بيانات.

9.2 تقييم التحرير
اقرأ المراجعة
#9

GLM-5.3-Flash

Z.ai (Zhipu AI)

قدرة تقترب من خط المقدمة في البرمجة والعمل الوكيلي بأسعار منخفضة على نحو غير معتاد، مع رؤية أصلية وسياق بطول 1M. تعني كلمة «Flash» هنا الكفاءة والرخص، لا الحجم الصغير ولا السرعة الفائقة.

9.2 تقييم التحرير
اقرأ المراجعة
أسئلة وإجابات

الأسئلة الشائعة