تخيّل نجّارين. الأول هو المعلّم الذي تستدعيه حين يحتاج البيت إلى درج جديد ولم يرسم أحد مخططاته بعد. والثاني هو الحرفي المثابر الذي يركّب أربعين بابًا في أسبوع، وكل باب منها مستقيم تمامًا.
معظم أسبوع أي فريق برمجي أبواب لا أدراج: اختبار يفشل، ونموذج إدخال يحتاج إلى حقل جديد، وواجهة برمجية غيّرت اسمها. صُمّم Claude Sonnet 5.5 للأبواب.
أطلقته Anthropic في 28 سبتمبر 2026 بوصفه النموذج الثاني في عائلة Claude 5.5، بعد أسبوع من Opus 5.5. وحافظ على سعر Sonnet 5: دولاران لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج، أي نصف سعر Opus 5.5. وتقول Anthropic إنه أسرع من Sonnet 5 بأكثر من 30%، وتقل تكلفة المهمة الواحدة معه بما يصل إلى 30% لأنه ينجز العمل بخطوات أقل.
الأرقام المستقلة
في وكلاء البرمجة، الاختبار الذي نثق به أكثر من غيره هو Terminal-Bench 4.0: مهام طويلة متعددة الخطوات في سطر أوامر حقيقي، يتعيّن فيها على النموذج أن يثبّت الأدوات ويشغّلها ويقرأ الأخطاء ثم يحاول مجددًا.
أجرت Artificial Analysis هذا الاختبار باستقلالية في سبتمبر 2026. حصل Sonnet 5.5 على 64%، متقدمًا قليلًا على Opus 5.5 وGPT-6 Astra اللذين سجّل كل منهما نحو 60%. أما تشغيل Anthropic الخاص فأعلى، عند 70.6%، لكن بيئات الاختبار التي تديرها الشركات تميل إلى مجاملة نماذجها، لذا فالرقم المستقل 64% هو الجدير بالتذكّر. وفي الحالتين هي قفزة هائلة مقارنة بـ Sonnet 5 الذي سجّل 10.3% في جدول Anthropic.
ويتفق مصدر مستقل ثانٍ مع الصورة العامة. تضع Vals AI نموذج Sonnet 5.5 في المركز الثاني من 66 نموذجًا في مؤشرها بنسبة 69.22%، على بعد أقل من نصف نقطة من Opus 5.5، وبنحو ثلثي تكلفة الاختبار الواحد. ويحتل المركز الأول في تصنيفين برمجيين: Vibe Code Bench (بناء تطبيقات صغيرة انطلاقًا من وصف) بنسبة 92.39%، وCode Migration بنسبة 69.83%.
ما تضيفه اختبارات Anthropic نفسها
يستكمل جدول الإطلاق لدى Anthropic التفاصيل:
- FrontierCode v1.1، الذي يسأل هل يمكن دمج تغيير في الشيفرة دون أن يلمسه إنسان: 52.1% عند مستوى xhigh. ويسجّل Opus 5.5 نسبة 54.4% وGPT-6 Sol نسبة 49.3%.
- CursorBench 4.0، المبني على جلسات حقيقية في محرر Cursor: 55.5%، أي خلف Opus 5.5 بنحو نقطتين ومتقدمًا كثيرًا على 34.1% لـ Sonnet 5.
والأكثر فائدة هي الرسوم البيانية للتكلفة، التي تضع نتيجة كل نموذج مقابل تكلفة المهمة عند كل مستوى جهد. تبرز منها نتيجتان. عند مستوى High، وهو الافتراضي في الواجهة البرمجية، يعادل Sonnet 5.5 أفضل نتيجة لـ GPT-6 Sol في FrontierCode بنحو خُمس تكلفة المهمة. وعند مستوى Medium، وهو الافتراضي في Claude Code، يتجاوز أفضل نتيجة لـ Sonnet 5 في Terminal-Bench بأقل من عُشر التكلفة.
ويصف المختبرون الأوائل الشيء نفسه بكلمات أبسط. رأت Lovable نحو نصف عدد أوامر الطرفية لكل مهمة. وقاست Slack نحو 14% رموز إخراج أقل مقارنة بـ Sonnet 5. أما Unity، التي لا تعدّ المهمة منجزة إلا إذا عمل التغيير فعلًا أثناء التشغيل، فتقول إن معظم عمل Sonnet 5.5 اجتاز هذا الفحص.
مؤشر الجهد، ولماذا يأتي أعلى مستوى بنتيجة عكسية
مثل Opus 5.5، يملك Sonnet 5.5 مؤشر جهد بخمسة مستويات: low وmedium وhigh وxhigh وmax. تتيح المستويات الأعلى للنموذج أن يفكر مدة أطول ويراجع عمله بعناية أكبر. قد تتوقع أن يكون max الأفضل، لكنه مع Sonnet 5.5 كثيرًا ما لا يكون كذلك.
قاست Artificial Analysis المدى كله على مؤشر الذكاء الخاص بها:
| مستوى الجهد | مؤشر الذكاء | تكلفة المهمة |
|---|---|---|
| Low | 36 | $0.41 |
| Medium | 41 | $0.59 |
| High | 47 | $1.08 |
| Xhigh | 52 | $2.74 |
| Max | 56 | $7.60 |
الانتقال من xhigh إلى max يضيف أربع نقاط مقابل ما يقارب ثلاثة أضعاف التكلفة. وعند max كتب Sonnet 5.5 نحو 193,000 رمز إخراج لكل مهمة. هذا أعلى رقم قاسته Artificial Analysis على الإطلاق: أكثر بنحو 60% من Opus 5.5 عند max، ونحو سبعة أضعاف GPT-6 Astra.
والأسوأ أن الجهد الأكبر لا يعني دائمًا شيفرة أفضل. ففي FrontierCode يسجّل Sonnet 5.5 52.1% عند xhigh لكن 46.2% فقط عند max. وتشرح Anthropic السبب في حاشية: عند max كان النموذج يطلق أكثر من غيره روتين مراجعة الشيفرة في Claude Code، الذي يوزّع المراجعة على وكلاء مساعدين كثيرين. وفي بعض الحالات انتهى ذلك بنفاد المهلة أو بتعديلات إضافية خارج المهمة، وFrontierCode يعاقب على التغييرات التي لم يطلبها أحد.
الدرس بسيط: اعتبر xhigh هو السقف. إذا ظلت المهمة تفشل عند xhigh، فالخطوة التالية الأفضل عادةً هي Opus 5.5 لا max.
العيب بصراحة
يبقى Opus هو المهندس المعماري. تقولها Anthropic بوضوح: في عدة اختبارات يقترب Sonnet 5.5 عند max من Opus 5.5، لكن في اختبارات Anthropic نفسها واختبارات المختبرين الخارجيين يبقى Opus 5.5 أقوى بوضوح في العمل المعقد المفتوح الذي يتطلب حكمًا متواصلًا. كما يحتفظ Opus بالصدارة في FrontierCode وCursorBench.
لن تنخفض فاتورة Claude Code إلى النصف. يعيد وكلاء البرمجة قراءة مشروعك باستمرار، وتُحتسب هذه القراءات على أنها قراءات من الذاكرة المؤقتة بسعر $0.20 لكل مليون رمز في Sonnet 5.5 وOpus 5.5 على حد سواء. ستوفّر في الإدخال والإخراج الجديدين، لكن الجلسة الطويلة المعتمدة بكثافة على الذاكرة المؤقتة توفّر أقل مما يوحي به عنوان «نصف السعر».
تُحال مهام الأمن. Sonnet 5.5 هو أول نموذج Sonnet يُطرح بضوابط الأمن السيبراني التي تطبقها Anthropic على أقوى نماذجها. لا يتأثر إصلاح الأخطاء المعتاد، لكن مهام الأمن الأعلى خطورة تُحال بشكل ظاهر إلى Sonnet 5، ما لم يحصل فريقك على الموافقة عبر برنامج Cyber Verification Program من Anthropic.
الانتقال يتطلب بعض العمل. تذكر Anthropic خمسة تغييرات غير متوافقة مقارنة بـ Sonnet 5. ففرض استخدام أداة يعيد الآن خطأ، وتُرفض قيم temperature غير الافتراضية، ويعود النص الواقع بين استدعاءات الأدوات بصيغة مختلفة. إصلاح ذلك ليس صعبًا، لكنه ليس تبديلًا في سطر واحد.
أين يناسب
| إن كانت المهمة… | استخدم | لماذا |
|---|---|---|
| خطأً أو ميزة أو ترحيلًا محدد النطاق | Claude Sonnet 5.5 | سريع ورخيص عند medium أو high |
| بنية مفتوحة أو مشكلة لم يحدد أحد نطاقها | Claude Opus 5.5 | حكم أقوى بوضوح بحسب Anthropic والمختبرين |
| عملًا طويلًا في الطرفية دون إشراف بأقل تكلفة للمهمة | GPT-6 Astra | يستهلك جزءًا صغيرًا من الرموز عند ذروة أدائه |
| صقل الواجهات الأمامية والشرائح والمشاريع المرئية الصغيرة | Claude Sonnet 5.5 | حس مرهف بالتصميم وتكرار سريع |
الحكم النهائي
Claude Sonnet 5.5 هو النموذج الذي ينبغي لمعظم المطورين أن يتركوه يعمل. يتولى الأبواب، الأربعين كلها، بسرعة وبنصف سعر رمز النموذج الرائد. أبقِه عند medium أو high، واستخدم xhigh للحالات الصعبة، وحين يتبيّن أن المهمة درج لا باب، استدعِ Opus.