الترتيب #3 البرمجة — ذكاء اصطناعي يكتب شيفرة إنتاجية
Anthropic

Claude Fable 5

الملك الجديد للبرمجة الوكيلية. نموذج Anthropic من فئة Mythos لا يتصدّر المعايير فحسب — بل يعيد كتابتها. SWE-Bench Pro 80.3% يسحق الميدان. FrontierCode Diamond 29.3% يفوق GPT-5.5 بخمس مرات. Stripe هاجرت 50 مليون سطر من Ruby في يوم. كفوء بالرموز، أصلي بالرؤية، ومبني لنوع العمل الهندسي طويل الأفق الذي يفصل الأدوات عن زملاء الفريق.

تم التحديث 1 يوليو 2026 Mythos-classAgenticSWE-Bench Pro SOTA
الأفضل لـ

الملك الجديد للبرمجة الوكيلية. نموذج Anthropic من فئة Mythos لا يتصدّر المعايير فحسب — بل يعيد كتابتها. SWE-Bench Pro 80.3% يسحق الميدان. FrontierCode Diamond 29.3% يفوق GPT-5.5 بخمس مرات. Stripe هاجرت 50 مليون سطر من Ruby في يوم. كفوء بالرموز، أصلي بالرؤية، ومبني لنوع العمل الهندسي طويل الأفق الذي يفصل الأدوات عن زملاء الفريق.

لماذا تفوز

SWE-Bench Pro 80.3% (SOTA — يتقدم على GPT-5.5 بـ 21.7 نقطة). FrontierCode Diamond 29.3% (5× أكثر من GPT-5.5 بنتيجة 5.7%، 2× أكثر من Opus 4.8 بنتيجة 13.4%). CursorBench SOTA. Senior Engineer Benchmark 91/100 (مقابل 62/100 لـ GPT-5.5). ترحيل قاعدة أكواد من 50 مليون سطر في يوم واحد. إتمام ألعاب بالرؤية فقط. تكامل مع Claude Code. سياق مليون رمز.

انتبه إلى

تسعير متميز بواقع $10/$50 لكل مليون رمز (2× مقارنة بـ Opus 4.8). حواجز أمان متحفظة تُحوّل أقل من 5% من الجلسات إلى Opus 4.8 (مواضيع الأمن السيبراني والبيولوجيا). المعايير المستقلة لا تزال تظهر. حدود استخدام أثناء الطلب المرتفع على خطط Pro/Max. أفضل تجربة عبر Claude Code أو بيئات التطوير المتوافقة.

01

ما هو في الواقع

تحديث 25 يوليو: يدفع Opus 5 نموذج Fable 5 إلى #3. يحتفظ Fable بنتيجة SWE-Bench Pro وفروق صغيرة في CursorBench وFrontierCode؛ لكن Opus 5 يفوز بـ Frontier-Bench ويقدم شبه تعادل بنصف سعر الرمز. تبقى مراجعة يونيو دليلاً مفيداً، لا الترتيب العام الحالي.

هناك رقم يجعل كتابة هذه المراجعة سهلة: 80.3%. هذه نتيجة Claude Fable 5 على SWE-Bench Pro — المعيار الذي لا يهتم بالمسائل البسيطة، فقط ما إذا كان الذكاء الاصطناعي يستطيع إصلاح أخطاء حقيقية في قواعد أكواد إنتاجية حقيقية. GPT-5.5 يسجّل 58.6%. الملك السابق Opus 4.8 سجّل 69.2%. Fable 5 لا يفوز فحسب — بل يفوز بفارق يجعلك تعيد التحقق من الأرقام.

لكن SWE-Bench Pro نصف القصة فقط. FrontierCode Diamond — معيار Cognition لمعرفة ما إذا كانت النماذج تستطيع كتابة كود إنتاجي عالي الجودة بكفاءة رمزية — يروي النصف الآخر. Fable 5: 29.3%. Opus 4.8: 13.4%. GPT-5.5: 5.7%. هذا ليس تقدّماً؛ إنه رياضة مختلفة. والنموذج يحقق هذه النتائج بجهد تفكير متوسط، مما يعني أنه يحرق رموزاً أقل لإنتاج كود أفضل. النموذج الغالي الذي هو فعلاً أرخص لكل مهمة واقعية.

دراسة حالة Stripe ليست خيالاً صحفياً. قاعدة أكواد Ruby من 50 مليون سطر — من النوع الذي يجعل المهندسين يتعرّقون — تمّ ترحيلها في يوم واحد. عمل كان سيستغرق فريقاً كاملاً شهرين. النموذج خطّط ونفّذ وتحقّق ذاتياً وسلّم. على CursorBench، قال الرئيس التنفيذي لـ Cursor إنه “فتح فئة من المشاكل طويلة الأفق كانت بعيدة المنال عن النماذج السابقة.” وعلى Senior Engineer Benchmark، سجّل 91/100 — بينما GPT-5.5 وOpus 4.8 كلاهما حلّ في أوائل الستينات.

هذا ما تبدو عليه بنية فئة Mythos عندما تغلّفها بحواجز أمان وتسلّمها للمطورين. الحواجز حقيقية — الاستعلامات عن الأمن السيبراني والبيولوجيا والكيمياء تُحوَّل إلى Opus 4.8 (لا يزال ممتازاً، لكن ليس المحرك الكامل). لكن لأكثر من 95% من أعمال البرمجة التي لا تُنشّط مُصنّفات الأمان، أنت تعمل مع أقدر نموذج أُطلق للعموم على الإطلاق. عصر البرمجة الوكيلية حصل للتو على بطله الأوضح.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • إعادة النشر العالمي وإثبات الحماية من ثغرات اليوم الصفر (Zero-Day): بعد اجتياز مراجعة الامتثال التجاري الدولي في 30 يونيو 2026، أصبح Fable 5 متاحاً مجدداً في جميع أنحاء العالم دون قيود إقليمية أو الحاجة إلى VPN. وفي اختبارات الإنتاج، أكدت فرق الأمن السيبراني في Amazon أن Fable 5 اكتشف بشكل مستقل وقام بترقيع ثغرة أمنية من نوع اليوم الصفر (تزوير رموز OAuth2) عبر 40 خدمة صغيرة في أقل من 3 دقائق — مما يثبت كفاءته الأمنية على مستوى الشركات.
  • التوجيه الأمني إلى Opus 4.8 والإنذارات الكاذبة: بينما ينفذ Fable 5 حوالي 95% من مهام البرمجة القياسية محلياً وبدقة، تقوم مصنفات الأمان المدمجة من Anthropic تلقائياً بتوجيه استعلامات الأمن السيبراني المعقدة أو عالية المخاطر إلى Claude Opus 4.8 لضمان التوافق التام مع السياسات. ملاحظة: قد تتسبب المصنفات شديدة الحساسية في بعض الأحيان في إنذارات كاذبة على نصوص إدارة النظام الآمنة.
  • مقاوم لعمليات كسر الحماية (Jailbreaks) الموجهة بالوكلاء: على عكس المنافسين ذوي الأوزان المفتوحة الذين يقعون فريسة لإطارات الإقناع الآلية متعددة الأدوار (مثل هجمات MoA أو Crescendo)، يحافظ التدريب الأمني الهرمي لنموذج Fable 5 على حدود صارمة دون تقليل جودة ومبدعية الإنتاج البرمجي.
  • SWE-Bench Pro 80.3% — الرقم القياسي الجديد: المعيار الذي يختبر هندسة البرمجيات الواقعية حصل للتو على رقم قياسي تاريخي جديد. Fable 5 يتقدم على GPT-5.5 (58.6%) بفارق 21.7 نقطة وعلى سلفه Opus 4.8 (69.2%) بفارق 11.1 نقطة. هذا ليس سباقاً متقارباً — إنه دوري مختلف.
  • FrontierCode Diamond 29.3% — إعادة تعريف كفاءة الرموز: معيار Cognition لجودة الكود الإنتاجي يُظهر Fable 5 عند 29.3%، وOpus 4.8 عند 13.4%، وGPT-5.5 عند 5.7%. النموذج يحقق نتائج رائدة حتى بجهد تفكير متوسط — مما يعني حرق رموز أقل لنتائج أفضل.
  • إثبات واقعي بـ 50 مليون سطر: Stripe استخدمت Fable 5 لترحيل قاعدة أكواد Ruby من 50 مليون سطر في يوم واحد — عمل كان سيستغرق فريقاً كاملاً شهرين. ليس معياراً. ليس عرضاً توضيحياً. كود إنتاجي في قاعدة أكواد إنتاجية.
  • برمجة أصلية بالرؤية: يعيد بناء تطبيقات ويب من لقطات الشاشة وحدها. يستخرج أرقاماً دقيقة من الرسوم البيانية العلمية. أتمّ Pokémon FireRed بالرؤية فقط — بدون أدوات مساعدة، بدون بيانات حالة اللعبة. النموذج يقرأ شاشتك ويبرمج مما يراه.
  • عمل مستقل طويل الأفق: يخطط، يفوّض لوكلاء فرعيين، يكتب ويشغّل اختباراته الخاصة، ويصحّح ذاتياً عبر جلسات متعددة الأيام. الذاكرة المستمرة المعتمدة على الملفات حسّنت أداء Slay the Spire بمقدار 3× أكثر من Opus 4.8. لا يبدأ قوياً فحسب — بل يبقى قوياً.

قيود صادقة

  • إنذارات كاذبة في الأمن السيبراني: قد تقوم مصنفات الأمان شديدة الحساسية في بعض الأحيان بتصنيف نصوص إدارة النظام المشروعة، أو اختبارات الاختراق، أو تصحيح الأخطاء منخفضة المستوى على أنها ضارة، مما يؤدي إلى توجيهها تلقائياً إلى Opus 4.8 أو حظر تنفيذها بالكامل.
  • مخاطر كسر الحماية المستمرة في الصناعة: على الرغم من مقاومته للهجمات القياسية، لا يوجد نموذج رائد محصن تماماً ضد عمليات كسر الحماية الموجهة بالوكلاء والمستحدثة؛ لذا يظل الاختبار الأمني المستمر (Red-Teaming) ضرورياً لنشر الأنظمة في الشركات.
  • تكلفة متميزة: $10/$50 لكل مليون رمز تقريباً 2× مقارنة بـ Opus 4.8 ($5/$25). كفاءة الرموز تعوّض جزئياً على المهام المعقدة، لكن المستخدمين الخفيفين سيشعرون بالفاتورة. مشتركو Pro يحصلون على وصول مضمّن حتى 22 يونيو، ثم أرصدة استخدام.
  • توجيه أمان على المواضيع المُعلَّمة: الاستعلامات التي تمسّ الأمن السيبراني أو البيولوجيا أو الكيمياء أو تقطير النماذج تُحوَّل تلقائياً إلى Opus 4.8. تنشط في أقل من 5% من الجلسات مع بعض الإيجابيات الخاطئة. باحثو الأمن المشروعون قد يحتاجون Mythos 5 المقيّد عبر Project Glasswing.
  • تقييمات الأطراف الثالثة لا تزال تظهر: معايير Anthropic الخاصة مفصّلة وغنية بالأمثلة، لكن أرقام LMSYS Arena وArtificial Analysis الكاملة غير متاحة بعد يوم الإطلاق. المؤشرات المبكرة إيجابية جداً.
  • أفضل أداء في البيئة المناسبة: Fable 5 يتألق أكثر في Claude Code وتكاملات API. تجربة محادثة claude.ai قوية، لكن قدرات النموذج الوكيلية تنطلق حقاً مع الأدوات المناسبة.
03

لمحة عن المعايير

SWE-Bench Pro — 80.3% (SOTA)

هندسة برمجيات واقعية. يتقدم على GPT-5.5 (58.6%) بـ 21.7 نقطة وعلى Opus 4.8 (69.2%) بـ 11.1 نقطة. أكبر فارق يحققه أي نموذج على الإطلاق على معيار البرمجة الحاسم.

FrontierCode Diamond — 29.3% (SOTA)

كود إنتاجي عالي الجودة بكفاءة رمزية. 2.2× مقارنة بـ Opus 4.8 (13.4%) و5.1× مقارنة بـ GPT-5.5 (5.7%). يحقق أداءً رائداً حتى بجهد تفكير متوسط.

Senior Engineer Benchmark — 91/100

يتفوق على GPT-5.5 (62/100) وOpus 4.8 (63/100) بفارق كبير. مهام مصمّمة لاختبار الحكم الهندسي على مستوى كبار المهندسين.

CursorBench — SOTA

أفضل أداء على معيار Cursor للبرمجة المدمجة في بيئات التطوير. 'فتح فئة من المشاكل طويلة الأفق كانت بعيدة المنال عن النماذج السابقة.'

04

الحكم

تاج البرمجة انتقل للتو — بشكل حاسم. Claude Fable 5 لا يتفوق فقط على GPT-5.5 في SWE-Bench Pro — بل يتفوق عليه بـ 21.7 نقطة. لا يتصدر FrontierCode Diamond فحسب — بل يتصدره بخمس مرات. وعلى عكس الانتصارات في المعايير الاصطناعية، الإيصالات الواقعية وصلت فعلاً: 50 مليون سطر مُرحَّلة في يوم، إتمام ألعاب بالرؤية فقط، جلسات هندسية مستقلة متعددة الأيام. Opus 4.8 السابق كان ملك المبضع؛ Fable 5 هو ملك المبضع الذي يدير غرفة العمليات بأكملها أيضاً. نعم، يكلف 2× أكثر لكل رمز. نعم، أقل من 5% من الجلسات تُوجَّه أمنياً إلى Opus 4.8. لكن لنوع الهندسة العميقة المعقدة طويلة الأفق التي تُعرّف تطوير البرمجيات الاحترافي في 2026 — هذا أقوى نموذج برمجة يمكن لأي شخص الوصول إليه. نقطة.

05

الأسئلة الشائعة