الترتيب #3 المنظومة اليومية — مساعدات الذكاء الاصطناعي الرائدة
Anthropic

Claude Fable 5

أول نموذج من فئة Mythos من Anthropic مُتاح للجميع بأمان. نفس البنية المعمارية التي تُشغّل Mythos 5 المقيّد، لكن مع حواجز أمان متحفظة تُحوّل الاستعلامات الحساسة إلى Opus 4.8. يقدّم أداءً حدودياً على كل معيار مهم — SWE-Bench Pro 80.3%، FrontierCode Diamond 29.3%، Hebbia Finance رقم 1 — والفارق يتسع كلما ازدادت المهام صعوبة. لمن يستطيع تحمّل التسعير المتميز، هذا أقوى نموذج ذكاء اصطناعي متاح للعموم في العالم.

تم التحديث 1 يوليو 2026 Mythos-class1M ContextReasoning
الأفضل لـ

أول نموذج من فئة Mythos من Anthropic مُتاح للجميع بأمان. نفس البنية المعمارية التي تُشغّل Mythos 5 المقيّد، لكن مع حواجز أمان متحفظة تُحوّل الاستعلامات الحساسة إلى Opus 4.8. يقدّم أداءً حدودياً على كل معيار مهم — SWE-Bench Pro 80.3%، FrontierCode Diamond 29.3%، Hebbia Finance رقم 1 — والفارق يتسع كلما ازدادت المهام صعوبة. لمن يستطيع تحمّل التسعير المتميز، هذا أقوى نموذج ذكاء اصطناعي متاح للعموم في العالم.

لماذا تفوز

SWE-Bench Pro 80.3% (SOTA — يسحق GPT-5.5 بنتيجة 58.6%). FrontierCode Diamond 29.3% (5× أكثر من GPT-5.5). Hebbia Finance Benchmark رقم 1. CursorBench SOTA. Stripe هاجرت قاعدة أكواد من 50 مليون سطر في يوم واحد. إتمام Pokémon FireRed بالرؤية فقط. ذاكرة مستمرة تُحسّن أداء Slay the Spire بمقدار 3× مقارنة بـ Opus 4.8. بسعر $10/$50 لكل مليون رمز. سياق مليون رمز. متاح على claude.ai وAPI وBedrock وVertex وFoundry.

انتبه إلى

تسعير متميز بواقع $10/$50 لكل مليون رمز (2× مقارنة بـ Opus 4.8). حواجز أمان متحفظة تُحوّل أقل من 5% من الجلسات إلى Opus 4.8 عند المواضيع المُعلَّمة (الأمن السيبراني، البيولوجيا، الكيمياء). ليس Mythos 5 الكامل غير المقيّد (المحصور في Project Glasswing). المعايير المستقلة من أطراف ثالثة لا تزال تتوافد يوم الإطلاق. حدود استخدام على خطط Pro/Max أثناء الطلب المرتفع.

01

ما هو في الواقع

تحديث 25 يوليو: أصبح Claude Opus 5 أعلى من Fable 5 في ترتيبنا. يحافظ Fable على انتصارات قصوى ضيقة في FrontierCode وCursorBench وHLE بلا أدوات واختبار قانوني، لكن Opus 5 يقود اختبارات أوسع للوكلاء والعمل المهني بنصف السعر وقيود أقل. يحفظ النص أدناه أدلة إطلاق Fable في يونيو؛ اقرأ صيغه المطلقة ضمن ذلك السياق التاريخي.

إذا كان Opus 4.8 هو الترقية، فإن Fable 5 هو المكتب الزاوي. تحوّل Anthropic في التسمية من الطبقات الموسيقية (Haiku، Sonnet، Opus) إلى الأدبية (Fable، Mythos) ليس مجرد علامة تجارية — إنه يشير إلى فئة جديدة من النماذج. Fable 5 يعمل على نفس بنية فئة Mythos التي تشغّل Mythos 5 المقيّد، لكن مع مُصنّفات أمان تجعله آمناً للاستخدام العام. تخيّله كسيارة رياضية خارقة مع محدّد سرعة — لا تزال أسرع شيء على الطريق، فقط مع حواجز حماية عند منعطفات معينة.

الأرقام تروي القصة. SWE-Bench Pro 80.3% لا يتفوق فقط على GPT-5.5 (58.6%) — بل يُحرج الميدان بأكمله. FrontierCode Diamond عند 29.3% يعني أن Fable 5 يكتب كوداً بجودة إنتاجية بكفاءة تفوق GPT-5.5 (5.7%) بخمس مرات. على Hebbia Finance Benchmark — استدلال مستندات متقدم، قراءة رسوم بيانية، تحليل أسباب جذرية — هو رقم 1. وعلى CursorBench، فتح “فئة من المشاكل طويلة الأفق كانت بعيدة المنال عن النماذج السابقة.”

لكن العروض الأكثر دلالة ليست معايير. Stripe هاجرت قاعدة أكواد Ruby من 50 مليون سطر في يوم واحد — عمل كان سيستغرق فريقاً كاملاً شهرين. النموذج أتمّ Pokémon FireRed باستخدام لقطات شاشة خام فقط — بدون خرائط، بدون أدوات مساعدة، بدون بيانات حالة اللعبة. وعندما مُنح ذاكرة مستمرة معتمدة على الملفات أثناء لعب Slay the Spire، تحسّن أداؤه بمقدار 3× أكثر من Opus 4.8.

قصة الأمان تستحق الفهم. الاستعلامات التي تمسّ الأمن السيبراني أو البيولوجيا أو الكيمياء أو تقطير النماذج تُحوَّل تلقائياً إلى Opus 4.8 — لا يزال نموذجاً من الطراز الأول، لكنه ليس بنية Mythos الكاملة. يحدث هذا في أقل من 5% من الجلسات، وAnthropic تعترف ببعض الإيجابيات الخاطئة على استعلامات غير ضارة. إنه ثمن إطلاق نموذج بهذه القدرة بسرعة وأمان. Mythos 5 غير المقيّد محجوز للشركاء المعتمدين عبر Project Glasswing — حيث يساعد بالفعل في الدفاع عن البنية التحتية البرمجية الحيوية.

السؤال الحقيقي هو ما إذا كان السعر يستحق. بسعر $10/$50 لكل مليون رمز، يكلّف Fable 5 تقريباً 2× ما يكلّفه Opus 4.8. لكن كفاءة الرموز تعوّض جزئياً — تحقيق نتائج رائدة على FrontierCode بجهد متوسط يعني حوسبة أقل لكل مهمة. للمحترفين الذين وقتهم أثمن من فاتورة API، المعادلة بسيطة. لبقية الناس، Opus 4.8 يظل ممتازاً. لكن إن أردت أفضل نموذج ذكاء اصطناعي متاح للعموم على الكوكب — النموذج الذي يتسع فيه الفارق كلما ازدادت المهمة صعوبة — هذا هو.

02

نقاط القوة والقيود بصراحة

نقاط القوة الرئيسية

  • إعادة النشر العالمي وإثبات الحماية من ثغرات اليوم الصفر (Zero-Day): بعد اجتياز مراجعة الامتثال التجاري الدولي في 30 يونيو 2026، أصبح Fable 5 متاحاً مجدداً في جميع أنحاء العالم دون قيود إقليمية أو الحاجة إلى VPN. وفي اختبارات الإنتاج، أكدت فرق الأمن السيبراني في Amazon أن Fable 5 اكتشف بشكل مستقل وقام بترقيع ثغرة أمنية من نوع اليوم الصفر (تزوير رموز OAuth2) عبر 40 خدمة صغيرة في أقل من 3 دقائق — مما يثبت كفاءته الأمنية على مستوى الشركات.
  • التوجيه الأمني إلى Opus 4.8 والإنذارات الكاذبة: بينما ينفذ Fable 5 حوالي 95% من مهام البرمجة القياسية محلياً وبدقة، تقوم مصنفات الأمان المدمجة من Anthropic تلقائياً بتوجيه استعلامات الأمن السيبراني المعقدة أو عالية المخاطر إلى Claude Opus 4.8 لضمان التوافق التام مع السياسات. ملاحظة: قد تتسبب المصنفات شديدة الحساسية في بعض الأحيان في إنذارات كاذبة على نصوص إدارة النظام الآمنة.
  • مقاوم لعمليات كسر الحماية (Jailbreaks) الموجهة بالوكلاء: على عكس المنافسين ذوي الأوزان المفتوحة الذين يقعون فريسة لإطارات الإقناع الآلية متعددة الأدوار (مثل هجمات MoA أو Crescendo)، يحافظ التدريب الأمني الهرمي لنموذج Fable 5 على حدود صارمة دون تقليل جودة ومبدعية الإنتاج البرمجي.
  • قدرة فئة Mythos للجميع: نفس البنية المعمارية الأساسية لنموذج Mythos 5 المقيّد، لكن مع مُصنّفات أمان تجعله متاحاً على نطاق واسع. Fable 5 هو الأفضل أداءً على جميع المعايير المُختبرة تقريباً — والفجوة عن المنافسين تتسع كلما ازداد تعقيد المهام. هذا ليس تحسيناً تدريجياً؛ إنه قفزة جيلية.
  • وكيل مستقل يُنجز فعلاً: Stripe ضغطت أشهراً من الهندسة في أيام — بترحيل قاعدة أكواد Ruby من 50 مليون سطر في يوم واحد. النموذج يُخطط، يُفوّض لوكلاء فرعيين، يتحقق ذاتياً باختباراته الخاصة، ويستمر حتى تُنجَز المهمة. الجلسات المستقلة متعددة الأيام أصبحت الوضع الطبيعي الجديد.
  • اختراق في الرؤية: أفضل أداء على مهام الرؤية. يستخرج أرقاماً دقيقة من الرسوم البيانية العلمية، ويعيد بناء تطبيقات ويب من لقطات الشاشة وحدها، وأتمّ Pokémon FireRed بالرؤية فقط — بدون أدوات مساعدة، بدون خرائط، بدون بيانات حالة اللعبة. النماذج السابقة احتاجت سقالات معقدة؛ Fable 5 يحتاج فقط عينين.
  • ذاكرة عبر ملايين الرموز: الذاكرة المستمرة المعتمدة على الملفات حسّنت أداءه في Slay the Spire بمقدار 3× أكثر من Opus 4.8. النموذج يظل مُركّزاً عبر جلسات المليون رمز ويُحسّن مخرجاته فعلاً باستخدام ملاحظاته الخاصة. السياق الطويل ليس مجرد مواصفة — إنه ميزة تعمل فعلاً.
  • كفاءة الرموز تربح المعادلة الحسابية: رغم أن سعر الرمز 2× مقارنة بـ Opus 4.8، يحقق Fable 5 أعلى النتائج على FrontierCode حتى بجهد متوسط. عمل أكثر لكل رمز يعني أن التكلفة الفعلية لكل مهمة غالباً ما تكون تنافسية. النموذج الغالي الذي يوفّر المال على المشاكل الصعبة.

قيود صادقة

  • إنذارات كاذبة في الأمن السيبراني: قد تقوم مصنفات الأمان شديدة الحساسية في بعض الأحيان بتصنيف نصوص إدارة النظام المشروعة، أو اختبارات الاختراق، أو تصحيح الأخطاء منخفضة المستوى على أنها ضارة، مما يؤدي إلى توجيهها تلقائياً إلى Opus 4.8 أو حظر تنفيذها بالكامل.
  • مخاطر كسر الحماية المستمرة في الصناعة: على الرغم من مقاومته للهجمات القياسية، لا يوجد نموذج رائد محصن تماماً ضد عمليات كسر الحماية الموجهة بالوكلاء والمستحدثة؛ لذا يظل الاختبار الأمني المستمر (Red-Teaming) ضرورياً لنشر الأنظمة في الشركات.
  • التسعير المتميز حقيقي: $10 لكل مليون رمز إدخال، $50 لكل مليون رمز إخراج — تقريباً 2× أسعار Opus 4.8. مشتركو Pro يحصلون على وصول مضمّن حتى 22 يونيو، ثم تبدأ أرصدة الاستخدام. المستخدمون المكثفون سيشعرون بالفاتورة.
  • توجيه أمان متحفظ: الحواجز تنشط في أقل من 5% من الجلسات، وتحوّل الاستعلامات المُعلَّمة إلى Opus 4.8 بدلاً من ذلك. بعض الإيجابيات الخاطئة على أعمال مهنية مشروعة (أبحاث الأمن السيبراني، الكيمياء، البيولوجيا). الحواجز تعكس قوة الاستخدام المزدوج للنموذج الأساسي.
  • ليس Mythos 5 الكامل: النسخة غير المقيّدة محجوزة خلف Project Glasswing للمدافعين السيبرانيين والباحثين المعتمدين. ما تحصل عليه صراحةً هو نسخة محميّة — بالغة القدرة، لكن مع عجلات تدريب على مواضيع معينة.
  • المعايير المستقلة قيد الانتظار: ادعاءات يوم الإطلاق مفصّلة وغنية بالأمثلة، لكن نتائج LMSYS Arena وArtificial Analysis وSWE-Bench الكاملة من أطراف ثالثة لا تزال تظهر. تحقّق قبل أن تتوّج.
03

لمحة عن المعايير

SWE-Bench Pro — 80.3% (SOTA)

هندسة برمجيات واقعية. يسحق GPT-5.5 (58.6%) بفارق 21.7 نقطة وسلفه Opus 4.8 (69.2%) بفارق 11.1 نقطة. أكبر فارق يحققه أي نموذج على الإطلاق.

FrontierCode Diamond — 29.3% (SOTA)

كود إنتاجي عالي الجودة بكفاءة رمزية. يسجّل 29.3% مقابل 13.4% لـ Opus 4.8 و5.7% لـ GPT-5.5. يحقق أعلى أداء حتى بجهد تفكير متوسط.

Hebbia Finance Benchmark — رقم 1

استدلال مستندات وتفسير رسوم بيانية وتحليل أسباب جذرية على مستوى كبار المحللين. أعلى نتيجة بين جميع النماذج المُختبرة. IMC أكدت أنه تفوّق في تقييمات تحليل التداول بشكل شبه شامل.

CursorBench — SOTA

أفضل أداء على معيار Cursor. 'فتح فئة من المشاكل طويلة الأفق التي كانت بعيدة المنال عن النماذج السابقة.' — Michael Truell، الرئيس التنفيذي لـ Cursor.

04

الحكم

الحدود تحركت للتو. Claude Fable 5 ليس تكراراً على Opus 4.8 — إنه قفزة جيلية مغلّفة بحواجز أمان. تقدّم SWE-Bench Pro (80.3% مقابل 58.6% لـ GPT-5.5) ليس خطأ تقريب — إنه هوّة. فجوة FrontierCode أوسع حتى. وعلى عكس النماذج التي تفوز بالمعايير لكنها تتعثر في الممارسة، Fable 5 يملك الإيصالات: Stripe هاجرت 50 مليون سطر كود في يوم، إتمام ألعاب بالرؤية فقط، وذاكرة مستمرة تعمل فعلاً عبر الجلسات الطويلة. المقابل هو السعر — $10/$50 لكل مليون رمز ليس مبلغاً عابراً — وتوجيه الأمان المتحفظ سيرسلك أحياناً إلى Opus 4.8 عند استعلامات مشروعة. لكن للمحترفين الذين يحتاجون أقوى عقل ذكاء اصطناعي متاح للعموم، والذين يتضمن عملهم هندسة معقدة أو بحثاً عميقاً أو مهاماً وكيلية طويلة الأفق — هذا هو. أفضل نموذج ذكاء اصطناعي يمكنك استخدامه فعلاً.

05

الأسئلة الشائعة