دليل مرتب

البرمجة — ذكاء اصطناعي يكتب شيفرة إنتاجية

هذه وكلاء برمجة وليست ألعاب إكمال تلقائي. يتعادل GPT-5.6 وOpus 5 عند القمة؛ يأخذ GPT المركز

القرار أولاً

ترتيبنا

ابدأ بالفائز، ثم قارن المفاضلات التي قد تغيّر الإجابة بالنسبة لك.

#1 البرمجة

GPT-5.6

OpenAI

يتصدر GPT-5.6 ترتيب البرمجة لأن Sol يفوز في سباق وكلاء البرمجة الواسع، لا لأنه يفوز في كل اختبار منفرد. Sol يغلق المشكلة الصعبة، وTerra هو المهندس اليومي بنصف سعر Sol لكل توكن، وLuna لمعالجة الدفعات. مع max ووكلاء Ultra المتوازيين وProgrammatic Tool Calling وواجهة Codex أقوى، قدمت OpenAI تشكيلة برمجة لا قميصاً واحداً.

لماذا تفوز

يسجل Sol مع استدلال max قيمة 80 في مقارنة OpenAI لمؤشر Artificial Analysis Coding Agent Index متقدماً على Claude Fable 5؛ ويحقق Sol نسبة 88.8% في Terminal-Bench 2.1 وSol Ultra نسبة 91.9%؛ ويصل Sol إلى 72.7% في DeepSWE. يقلل Programmatic Tool Calling عبء التنظيم، وتوفر Sol وTerra وLuna سلماً واضحاً للأسعار: $5/$30 و$2/$12 و$0.20/$1.20.

العيب

هذه قيادة في البرمجة الوكيلة وليست احتكاراً: ما زال Claude Fable 5 يحقق 80.3% مقابل 64.6% لـ Sol في مقارنة SWE-Bench Pro المنشورة. يزيد Ultra استهلاك التوكنات ويتوقف على الخطة. وقد تضيف الضمانات السيبرانية احتكاكاً إلى طلبات الدفاع أو الاستغلال؛ وكل رسم يحتاج اختباراً على مستودعك واختباراتك وقواعد النشر لديك.

9.9 تقييم التحرير
اقرأ المراجعة
الأفضل لـ

يتصدر GPT-5.6 ترتيب البرمجة لأن Sol يفوز في سباق وكلاء البرمجة الواسع، لا لأنه يفوز في كل اختبار منفرد. Sol يغلق المشكلة الصعبة، وTerra هو المهندس اليومي بنصف سعر Sol لكل توكن، وLuna لمعالجة الدفعات. مع max ووكلاء Ultra المتوازيين وProgrammatic Tool Calling وواجهة Codex أقوى، قدمت OpenAI تشكيلة برمجة لا قميصاً واحداً.

لماذا تفوز

يسجل Sol مع استدلال max قيمة 80 في مقارنة OpenAI لمؤشر Artificial Analysis Coding Agent Index متقدماً على Claude Fable 5؛ ويحقق Sol نسبة 88.8% في Terminal-Bench 2.1 وSol Ultra نسبة 91.9%؛ ويصل Sol إلى 72.7% في DeepSWE. يقلل Programmatic Tool Calling عبء التنظيم، وتوفر Sol وTerra وLuna سلماً واضحاً للأسعار: $5/$30 و$2/$12 و$0.20/$1.20.

انتبه إلى

هذه قيادة في البرمجة الوكيلة وليست احتكاراً: ما زال Claude Fable 5 يحقق 80.3% مقابل 64.6% لـ Sol في مقارنة SWE-Bench Pro المنشورة. يزيد Ultra استهلاك التوكنات ويتوقف على الخطة. وقد تضيف الضمانات السيبرانية احتكاكاً إلى طلبات الدفاع أو الاستغلال؛ وكل رسم يحتاج اختباراً على مستودعك واختباراتك وقواعد النشر لديك.

#2

Claude Opus 5

Anthropic

مبرمج حدودي عملي: يجمع Opus 5 حُسن تقدير قريباً من Fable مع سعر Opus وتحقق صبور على نحو لافت. يحتل المركز #2 لأنه يتصدر Frontier-Bench، ويكاد يعادل Fable 5 في CursorBench، ويكلف نصف السعر لكل رمز.

9.9 تقييم التحرير
اقرأ المراجعة
#3

Claude Fable 5

Anthropic

الملك الجديد للبرمجة الوكيلية. نموذج Anthropic من فئة Mythos لا يتصدّر المعايير فحسب — بل يعيد كتابتها. SWE-Bench Pro 80.3% يسحق الميدان. FrontierCode Diamond 29.3% يفوق GPT-5.5 بخمس مرات. Stripe هاجرت 50 مليون سطر من Ruby في يوم. كفوء بالرموز، أصلي بالرؤية، ومبني لنوع العمل الهندسي طويل الأفق الذي يفصل الأدوات عن زملاء الفريق.

9.8 تقييم التحرير
اقرأ المراجعة
#4

Qwen3.8-Max

Alibaba / Qwen Team

يأخذ Qwen3.8-Max المرتبة #4 للبرمجة كمنافس ذي قيمة عالية: سياق 1M ومدخلات صور وفيديو وإشارة مبكرة قوية للواجهة وأسعار API أقل كثيرًا من النماذج الممتازة. الترتيب مؤقت لأن الأرقام الرئيسية من المزود، وأدلة إصلاح المستودعات المستقلة لا تزال قليلة ومتباينة.

9.7 تقييم التحرير
اقرأ المراجعة
#5

Grok 4.6

xAI

Grok 4.6 ترقية جدية لوكلاء البرمجة: أفضل في استكشاف المستودعات والتنفيذ الطويل والنماذج المرئية، مع سعر $2/$6 وتوافر فوري في Cursor وGrok Build.

9.7 تقييم التحرير
اقرأ المراجعة
#6

GLM-5.3

Z.ai (Zhipu AI)

قفزة ما بعد تدريب على القاعدة نفسها، مصممة للجزء الذي يأتي بعد الإجابة الأولى. يخطط GLM-5.3 ويعدل ويختبر ويتعافى خلال مهام طويلة. نتائج الإطلاق والقدرة السيبرانية قوية، لكن الأدلة كلها تقريبًا من يوم الإطلاق.

9.2 تقييم التحرير
اقرأ المراجعة
أسئلة وإجابات

الأسئلة الشائعة