ثمة فرق بين من يكتب الشيفرة ومن يفهم النظام.
الأول يرى خطأً يقول undefined is not a function، فيحيط ذلك السطر بفحص if ويمضي. يختفي العطل، وبعد ثلاثة أيام ينكسر شيء آخر في مكان لم يتوقعه أحد.
أما الثاني فيسأل: لماذا كانت القيمة غير معرّفة؟ يتتبعها عبر الخدمات إلى الوراء، فيكتشف أن الكتابة في قاعدة البيانات اكتملت قبل تأكيد استلام رسالة، فيصحّح الترتيب بحيث لا يمكن لتلك الحالة الخاطئة أن تحدث أصلًا.
Claude Opus 5.5 من النوع الثاني بلا شك. صدر في 22 سبتمبر 2026، ويحتل المركز الثاني في ترتيب البرمجة لدينا، وهو أقرب إلى المركز الأول من أي نموذج قبله.
ما يبرع فيه: المهام الكبيرة والمتشابكة
قصص المختبرين الأوائل لدى Anthropic كلها على الشاكلة نفسها: مهام ضخمة كانت تستغرق من فريق كامل أسابيع.
- أنهى أحد المختبرين ترحيل شيفرة من 680,000 سطر في أقل من يوم.
- ودقّق مختبر آخر قاعدة شيفرة من 200,000 سطر وأصلحها في أقل من ثلاث ساعات، بينما احتاج Opus 5 إلى أكثر من 20 ساعة و2.5 ضعف الرموز للعمل نفسه.
- وفي اختبار داخلي، أعاد كلٌّ من Opus 5.5 وFable 5.1 كتابة HAProxy – البرنامج الشائع الذي يوزّع حركة الويب بين الخوادم – من لغة C إلى Rust، ونجح كلاهما في جميع اختبارات HAProxy الخاصة تقريبًا. أنهى Opus 5.5 العمل في 9.5 ساعات بدل 12، وبتكلفة أقل بنسبة 51%.
هذه حكايات من الشركة المطوّرة، لا قياسات مستقلة، فتعامل معها بوصفها مؤشرًا على الاتجاه لا ضمانًا. لكن النمط ثابت: كلما كان العمل أكبر وأكثر فوضى، ابتعد Opus 5.5 عن غيره.
وهو كذلك يشرح نفسه بوضوح. يعرض إعلان Anthropic مثالًا له وهو يشخّص خللًا في الفوترة. فبدل جدار من التفاصيل التقنية، يبدأ بالمال: 1.50 دولار من انخفاض إيرادات أحد العملاء سببها تغيير في التسعير، و9.92 دولار الباقية سببها خلل في commit بعينه توقف معه احتساب الاستخدام في اليوم الأخير من كل شهر. حين يعدّل وكيلٌ شيفرتك، فإن تقارير كهذه هي ما يُبقيه صادقًا.
المقاييس: تعادل، بحسب من يَعُدّ
هنا يستحق الأمر التمهل، لأن جداول الشركات والاختبارات المستقلة تروي قصصًا مختلفة قليلًا.
أرقام Anthropic (سبتمبر 2026):
- Terminal-Bench 4.0، الذي يقيس العمل متعدد الخطوات في طرفية سطر الأوامر: سجّل Opus 5.5 نسبة 66.4% (±2.6 نقطة)، وسجّل GPT-6 Astra نسبة 57.9%، وهو رقم أعلنته OpenAI.
- FrontierCode v1.1، الذي يفحص ما إذا كانت تعديلات الشيفرة جيدة بما يكفي للدمج: Opus 5.5 54.4%، وAstra 53.3%.
- CursorBench 4.0، الذي يشمل مهام برمجة أطول داخل محرر Cursor: Opus 5.5 57.8%، وFable 5.1 51.8%.
الأرقام المستقلة: شغّلت Artificial Analysis اختبار Terminal-Bench 4.0 بنفسها، فحصلت على 59.6% لكلٍّ من Opus 5.5 وAstra. تعادل تام.
قاعدتنا أن نثق بالقياسات المستقلة أكثر من جداول الشركات. وهذا يعطينا تعادلًا في القدرة الخالصة، فيُحسم الترتيب بشيء آخر.
لماذا يحتفظ GPT-6 Astra بالمركز الأول
حين يتساوى نموذجان في الجودة، نرتّبهما بحسب ما تكلّفك المهمة المنجزة.
وهنا يملك Astra أفضلية واضحة. بأقصى جهد، قاست Artificial Analysis أن Opus 5.5 يكتب نحو 119,000 رمز إخراج لكل مهمة، مقابل نحو 27,000 لـ Astra. رموز Opus أرخص (20 دولارًا لكل مليون رمز إخراج مقابل 50 لـ Astra)، لكنه يستهلك منها نحو أربعة أضعاف. أجرِ الحساب، وستجد أن متوسط مهمة Astra عند أعلى أداء يكلّف نحو النصف.
وتطرح Anthropic حجة مضادة معقولة. تقول إن Opus 5.5 عند الجهد الافتراضي يعادل Astra في Terminal-Bench بنحو 40% من التكلفة، ويتفوق عليه في FrontierCode بنحو 20% من التكلفة. إن أكدت الاختبارات المستقلة ذلك، فسيتغير الترتيب. أما الآن فهو ادعاء من الشركة، وننتظر بيانات مستقلة قبل أن نرفع أي نموذج.
القيود بصراحة
- احتفظ بأقصى جهد للمشكلات الصعبة. إن تركت Opus 5.5 على أقصى جهد في الإصلاحات الروتينية، فسيكتب سلاسل تفكير طويلة تدفع أنت ثمنها.
- أعمال الأمن تُحوَّل. Opus 5.5 قوي في الأمن السيبراني لدرجة أن Anthropic ترسل معظم مهام الأمن إلى Opus 4.8، ما لم تكن منضمًا إلى Cyber Verification Program. أما إصلاح الأخطاء العادي فلا يتأثر.
- الجلسات الطويلة ما زالت تصطدم بالحدود. رفعت Anthropic حدود الخمس ساعات في الخطط المدفوعة، لكن تشغيل وكيل لساعات على مستودع كبير قد يبلغها مع ذلك.
أيهما توظّف
اختر GPT-6 Astra حين تكون لديك قائمة من المهام المحددة بوضوح وتريد إنجازها بأقل تكلفة ممكنة.
واختر Claude Opus 5.5 حين يكون العمل كبيرًا أو ملتبسًا أو محفوفًا بالمخاطر: ترحيل إطار عمل، أو تدقيق عميق، أو خلل يعبر الحدود بين الخدمات. في مثل هذه المهام يساوي التفكير المتأني أكثر من الإخراج المقتضب. إنه المهندس الذي نأتمنه على النظام الذي لا يريد أحد غيره أن يقترب منه.