الترتيب #2 البرمجة — ذكاء اصطناعي يكتب شيفرة جاهزة للإنتاج
Anthropic

Claude Opus 5.5

Claude Opus 5.5 هو نموذج البرمجة الذي تستدعيه حين تكون المهمة ضخمة ومتشابكة: ترحيل يمتد عبر مئات آلاف الأسطر، أو خلل يعبر خمس خدمات، أو نظام قديم لم يعد أحد يفهمه تمامًا. في اختبارات Anthropic نفسها يتقدّم على GPT-6 Astra، وفي الاختبارات المستقلة يتعادلان. ولا يحتل المركز الثاني بدل الأول إلا لأن Astra ينجز عمل الطرفية نفسه برموز أقل بكثير.

تم التحديث 27 سبتمبر 2026 Agentic CodingTerminal-Bench 4.0FrontierCode 54.4%
الأفضل لـ

Claude Opus 5.5 هو نموذج البرمجة الذي تستدعيه حين تكون المهمة ضخمة ومتشابكة: ترحيل يمتد عبر مئات آلاف الأسطر، أو خلل يعبر خمس خدمات، أو نظام قديم لم يعد أحد يفهمه تمامًا. في اختبارات Anthropic نفسها يتقدّم على GPT-6 Astra، وفي الاختبارات المستقلة يتعادلان. ولا يحتل المركز الثاني بدل الأول إلا لأن Astra ينجز عمل الطرفية نفسه برموز أقل بكثير.

لماذا تفوز

تعلن Anthropic عن 66.4% في Terminal-Bench 4.0، و54.4% في FrontierCode v1.1، و57.8% في CursorBench 4.0، متقدمًا على GPT-6 Astra في الأوليين. وتضع اختبارات Artificial Analysis المستقلة كلًّا من Opus 5.5 وAstra في تعادل تام على Terminal-Bench 4.0 بنسبة 59.6%. ويروي المختبرون الأوائل عن ترحيل 680,000 سطر في أقل من يوم، وتدقيق 200,000 سطر في أقل من ثلاث ساعات. تكلفة الرموز 4/20 دولارًا، وقراءة الذاكرة المؤقتة 0.20 دولار.

انتبه إلى

عند أقصى جهد يكون Opus 5.5 كثير الكلام: قاست Artificial Analysis نحو أربعة أضعاف رموز الإخراج لكل مهمة مقارنة بـ GPT-6 Astra، ولهذا يحتفظ Astra بالمركز الأول لدينا من حيث تكلفة المهمة المنجزة. تحيل ضوابط Anthropic الأمنية معظم أعمال الأمن السيبراني إلى Opus 4.8، وما زالت الجلسات المكثفة قد تصطدم بحدود الاستخدام في الخطط.

01

ما هو في الواقع

ثمة فرق بين من يكتب الشيفرة ومن يفهم النظام.

الأول يرى خطأً يقول undefined is not a function، فيحيط ذلك السطر بفحص if ويمضي. يختفي العطل، وبعد ثلاثة أيام ينكسر شيء آخر في مكان لم يتوقعه أحد.

أما الثاني فيسأل: لماذا كانت القيمة غير معرّفة؟ يتتبعها عبر الخدمات إلى الوراء، فيكتشف أن الكتابة في قاعدة البيانات اكتملت قبل تأكيد استلام رسالة، فيصحّح الترتيب بحيث لا يمكن لتلك الحالة الخاطئة أن تحدث أصلًا.

Claude Opus 5.5 من النوع الثاني بلا شك. صدر في 22 سبتمبر 2026، ويحتل المركز الثاني في ترتيب البرمجة لدينا، وهو أقرب إلى المركز الأول من أي نموذج قبله.

ما يبرع فيه: المهام الكبيرة والمتشابكة

قصص المختبرين الأوائل لدى Anthropic كلها على الشاكلة نفسها: مهام ضخمة كانت تستغرق من فريق كامل أسابيع.

  • أنهى أحد المختبرين ترحيل شيفرة من 680,000 سطر في أقل من يوم.
  • ودقّق مختبر آخر قاعدة شيفرة من 200,000 سطر وأصلحها في أقل من ثلاث ساعات، بينما احتاج Opus 5 إلى أكثر من 20 ساعة و2.5 ضعف الرموز للعمل نفسه.
  • وفي اختبار داخلي، أعاد كلٌّ من Opus 5.5 وFable 5.1 كتابة HAProxy – البرنامج الشائع الذي يوزّع حركة الويب بين الخوادم – من لغة C إلى Rust، ونجح كلاهما في جميع اختبارات HAProxy الخاصة تقريبًا. أنهى Opus 5.5 العمل في 9.5 ساعات بدل 12، وبتكلفة أقل بنسبة 51%.

هذه حكايات من الشركة المطوّرة، لا قياسات مستقلة، فتعامل معها بوصفها مؤشرًا على الاتجاه لا ضمانًا. لكن النمط ثابت: كلما كان العمل أكبر وأكثر فوضى، ابتعد Opus 5.5 عن غيره.

وهو كذلك يشرح نفسه بوضوح. يعرض إعلان Anthropic مثالًا له وهو يشخّص خللًا في الفوترة. فبدل جدار من التفاصيل التقنية، يبدأ بالمال: 1.50 دولار من انخفاض إيرادات أحد العملاء سببها تغيير في التسعير، و9.92 دولار الباقية سببها خلل في commit بعينه توقف معه احتساب الاستخدام في اليوم الأخير من كل شهر. حين يعدّل وكيلٌ شيفرتك، فإن تقارير كهذه هي ما يُبقيه صادقًا.

المقاييس: تعادل، بحسب من يَعُدّ

هنا يستحق الأمر التمهل، لأن جداول الشركات والاختبارات المستقلة تروي قصصًا مختلفة قليلًا.

أرقام Anthropic (سبتمبر 2026):

  • Terminal-Bench 4.0، الذي يقيس العمل متعدد الخطوات في طرفية سطر الأوامر: سجّل Opus 5.5 نسبة 66.4% (±2.6 نقطة)، وسجّل GPT-6 Astra نسبة 57.9%، وهو رقم أعلنته OpenAI.
  • FrontierCode v1.1، الذي يفحص ما إذا كانت تعديلات الشيفرة جيدة بما يكفي للدمج: Opus 5.5 54.4%، وAstra 53.3%.
  • CursorBench 4.0، الذي يشمل مهام برمجة أطول داخل محرر Cursor: Opus 5.5 57.8%، وFable 5.1 51.8%.

الأرقام المستقلة: شغّلت Artificial Analysis اختبار Terminal-Bench 4.0 بنفسها، فحصلت على 59.6% لكلٍّ من Opus 5.5 وAstra. تعادل تام.

قاعدتنا أن نثق بالقياسات المستقلة أكثر من جداول الشركات. وهذا يعطينا تعادلًا في القدرة الخالصة، فيُحسم الترتيب بشيء آخر.

لماذا يحتفظ GPT-6 Astra بالمركز الأول

حين يتساوى نموذجان في الجودة، نرتّبهما بحسب ما تكلّفك المهمة المنجزة.

وهنا يملك Astra أفضلية واضحة. بأقصى جهد، قاست Artificial Analysis أن Opus 5.5 يكتب نحو 119,000 رمز إخراج لكل مهمة، مقابل نحو 27,000 لـ Astra. رموز Opus أرخص (20 دولارًا لكل مليون رمز إخراج مقابل 50 لـ Astra)، لكنه يستهلك منها نحو أربعة أضعاف. أجرِ الحساب، وستجد أن متوسط مهمة Astra عند أعلى أداء يكلّف نحو النصف.

وتطرح Anthropic حجة مضادة معقولة. تقول إن Opus 5.5 عند الجهد الافتراضي يعادل Astra في Terminal-Bench بنحو 40% من التكلفة، ويتفوق عليه في FrontierCode بنحو 20% من التكلفة. إن أكدت الاختبارات المستقلة ذلك، فسيتغير الترتيب. أما الآن فهو ادعاء من الشركة، وننتظر بيانات مستقلة قبل أن نرفع أي نموذج.

القيود بصراحة

  • احتفظ بأقصى جهد للمشكلات الصعبة. إن تركت Opus 5.5 على أقصى جهد في الإصلاحات الروتينية، فسيكتب سلاسل تفكير طويلة تدفع أنت ثمنها.
  • أعمال الأمن تُحوَّل. Opus 5.5 قوي في الأمن السيبراني لدرجة أن Anthropic ترسل معظم مهام الأمن إلى Opus 4.8، ما لم تكن منضمًا إلى Cyber Verification Program. أما إصلاح الأخطاء العادي فلا يتأثر.
  • الجلسات الطويلة ما زالت تصطدم بالحدود. رفعت Anthropic حدود الخمس ساعات في الخطط المدفوعة، لكن تشغيل وكيل لساعات على مستودع كبير قد يبلغها مع ذلك.

أيهما توظّف

اختر GPT-6 Astra حين تكون لديك قائمة من المهام المحددة بوضوح وتريد إنجازها بأقل تكلفة ممكنة.

واختر Claude Opus 5.5 حين يكون العمل كبيرًا أو ملتبسًا أو محفوفًا بالمخاطر: ترحيل إطار عمل، أو تدقيق عميق، أو خلل يعبر الحدود بين الخدمات. في مثل هذه المهام يساوي التفكير المتأني أكثر من الإخراج المقتضب. إنه المهندس الذي نأتمنه على النظام الذي لا يريد أحد غيره أن يقترب منه.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • مصنوع للمهام الكبيرة: استخدمه مختبرو Anthropic في ترحيل شيفرة من 680,000 سطر أُنجز في أقل من يوم، وفي تدقيق 200,000 سطر في أقل من ثلاث ساعات، بينما احتاج Opus 5 إلى أكثر من 20 ساعة و2.5 ضعف الرموز. كلما كان العمل أكبر وأكثر فوضى، اتسع تفوقه.
  • يجد الخلل الحقيقي: يتتبع العطل حتى منبعه بدل أن يلفّ العَرَض في كتلة try/catch. في مثال Anthropic شرح خللًا في الفوترة بلغة واضحة: ما الذي تعطّل، وأي commit سبّب العطل، وكم من المال ضاع.
  • تعديلات جاهزة للدمج: يفحص FrontierCode v1.1 ما إذا كانت تعديلات النموذج على الشيفرة جيدة بما يكفي لدمجها في مشاريع حقيقية. يسجّل Opus 5.5 نسبة 54.4% في جدول Anthropic، متقدمًا بفارق ضئيل على GPT-6 Astra بنسبة 53.3%.
  • تقارير تُقرأ فعلًا: أعادت Anthropic تدريب أسلوب كتابة النموذج. تبدأ الشروح بالخلاصة وتتخلى عن المصطلحات المعقدة، ما يجعل مراجعة عمل الوكيل أسرع بكثير.
  • أصعب في الخداع: تقول Anthropic إن Opus 5.5 يتقاسم مع Fable 5.1 أدنى معدل نجاح لهجمات حقن الأوامر في اختبارات Gray Swan، وإنه أقل ميلًا بكثير من النماذج السابقة إلى اتخاذ إجراءات يصعب التراجع عنها. وهذا مهم حين يعمل وكيل في مستودعك دون رقابة.

قيود صادقة

  • كثير الكلام عند أقصى جهد: قاست Artificial Analysis نحو 119,000 رمز إخراج لكل مهمة بأقصى جهد، مقابل نحو 27,000 لـ GPT-6 Astra. ومع تساوي الدرجة القصوى، يصبح Astra النموذج الأرخص لكل مهمة منجزة رغم سعره المعلن الأعلى.
  • أرقام الشركات ما زالت هي الغالبة: رقم 66.4% البارز في Terminal-Bench جاء من تشغيل Anthropic نفسها (خطأ معياري ±2.6 نقطة)، أما رقم Astra المقارن 57.9% فمصدره OpenAI. ويُظهر التشغيل المستقل لـ Artificial Analysis تعادلًا، لا تفوقًا.
  • أعمال الأمن تُحوَّل إلى نموذج آخر: لأن Opus 5.5 قوي جدًا في الأمن السيبراني، تُحال معظم مهام الأمن إلى Opus 4.8 ما لم تنضم إلى Cyber Verification Program لدى Anthropic. أما إصلاح الأخطاء المعتاد فلا يتأثر.
  • حدود الاستخدام في الجلسات الطويلة: رفعت Anthropic حدود الخمس ساعات في الخطط المدفوعة، لكن تشغيل الوكلاء لساعات على قواعد شيفرة كبيرة قد يبلغ تلك الحدود مع ذلك.
03

لمحة عن المعايير

Terminal-Bench 4.0 — تعادل مستقل مع Astra عند 59.6% (66.4% وفق الشركة)

مهام معقدة متعددة الخطوات في طرفية سطر الأوامر. قاست Artificial Analysis كلًّا من Opus 5.5 وGPT-6 Astra (xhigh) عند 59.6%. وفي تشغيل Anthropic الخاص يسجّل Opus 5.5 نسبة 66.4% (±2.6) مقابل 57.9% لـ Astra وفق OpenAI.

FrontierCode v1.1 — 54.4%

هل تعديلات الشيفرة جاهزة للدمج في قواعد شيفرة حقيقية؟ جدول إطلاق Anthropic: Opus 5.5 54.4%، وGPT-6 Astra 53.3%، وFable 5.1 50.3%، وOpus 5 48.0%.

CursorBench 4.0 — 57.8%

مهام برمجة أطول داخل محرر Cursor. تعلن Anthropic عن 57.8% مقابل 51.8% لـ Fable 5.1 و41.7% لـ GPT-5.6 Sol.

رموز الإخراج لكل مهمة — نحو 119 ألفًا بأقصى جهد

قياس Artificial Analysis بأقصى جهد، مقابل نحو 27 ألفًا لـ GPT-6 Astra. وهذا سبب احتفاظ Astra بالمركز الأول لدينا: الدرجة القصوى نفسها بنحو نصف التكلفة لكل مهمة.

السعر — 4/20 دولارًا لكل مليون رمز، و0.20 دولار لقراءة الذاكرة المؤقتة

انخفضت قراءة الذاكرة المؤقتة، وهي الجزء الأكبر من فاتورة وكلاء البرمجة، بنسبة 60% مقارنة بـ Opus 5. ويكلّف الوضع السريع (بسرعة تصل إلى 2.5 ضعف) 8/40 دولارًا.

04

الحكم

Claude Opus 5.5 هو نموذج البرمجة الثاني لدينا، ولم تكن المسافة بينه وبين الأول أضيق من ذلك قط. في اختبار Terminal-Bench المستقل يتعادل مع GPT-6 Astra، وفي تشغيلات Anthropic الخاصة لـ FrontierCode وTerminal-Bench يتقدّم عليه. نُبقي Astra في الصدارة لسبب نعلنه صراحة: عند أعلى أداء ينجز Astra العمل نفسه بنحو ربع رموز الإخراج، فتكون كل مهمة منجزة أرخص. أما إن كان عملك ترحيلًا مترامي الأطراف، أو تدقيقًا عميقًا، أو خللًا لا يجده أحد غيره، فإن Opus 5.5 هو النموذج الذي نأتمنه عليه – وهو على الجهد الافتراضي أرخص من أي وقت مضى.

05

الأسئلة الشائعة