O'rin #3 Dasturlash — Ishlab chiqarish (Production) uchun kod yozadigan SI
Anthropic

Claude Fable 5

Agentli dasturlashning yangi qiroli. Anthropic'ning Mythos sinfidagi ushbu modeli nafaqat benchmarklarda yetakchilik qiladi, balki ularni qaytadan yozib chiqadi. SWE-Bench Pro dagi 80.3% natija qolganlarni tor-mor etadi. FrontierCode Diamond 29.3% — bu GPT-5.5 dan 5 barobar ko'p degani. Stripe bir kun ichida Ruby'da yozilgan 50 million qator kodni ko'chirib o'tkazdi (migratsiya). Token tejamkor, vizual tasvirlarni yaxshi tushunadigan (vision-native) va asboblarni haqiqiy hamkasbga aylantiradigan uzoq muddatli muhandislik ishlari uchun yaratilgan.

Yangilangan 2026-yil 1-iyul Mythos-classAgenticSWE-Bench Pro SOTA
9.810 dan
Rasmiy veb-sayt
Eng mos

Agentli dasturlashning yangi qiroli. Anthropic'ning Mythos sinfidagi ushbu modeli nafaqat benchmarklarda yetakchilik qiladi, balki ularni qaytadan yozib chiqadi. SWE-Bench Pro dagi 80.3% natija qolganlarni tor-mor etadi. FrontierCode Diamond 29.3% — bu GPT-5.5 dan 5 barobar ko'p degani. Stripe bir kun ichida Ruby'da yozilgan 50 million qator kodni ko'chirib o'tkazdi (migratsiya). Token tejamkor, vizual tasvirlarni yaxshi tushunadigan (vision-native) va asboblarni haqiqiy hamkasbga aylantiradigan uzoq muddatli muhandislik ishlari uchun yaratilgan.

Nima uchun bu eng yaxshisi

SWE-Bench Pro 80.3% (SOTA — GPT-5.5 dan 21.7 ball baland). FrontierCode Diamond 29.3% (GPT-5.5 ning 5.7% dan 5 barobar, Opus 4.8 ning 13.4% dan 2 barobar yuqori). CursorBench SOTA. Katta muhandislar (Senior Engineer) benchmarki 91/100 (GPT-5.5 da bu 62/100). Bir kun ichida 50 million qator kodni ko'chirish (migratsiya). Faqat ko'rish qobiliyati orqali o'yinni tugatish. Claude Code integratsiyasi. 1M (bir million) kontekst.

E'tibor bering

Har bir million token uchun $10/$50 bo'lgan yuqori (premium) narx (Opus 4.8 dan 2 barobar qimmat). Qat'iy xavfsizlik choralari seanslarning 5% dan kamrog'ini (kiberxavfsizlik, biologiya kabi mavzularda) Opus 4.8 ga yo'naltiradi. Mustaqil benchmarklar endigina paydo bo'lmoqda. Talab yuqori bo'lgan paytlarda Pro/Max tariflarida foydalanish cheklovlari (limitlar) mavjud. Eng yaxshi tajriba Claude Code yoki mos keluvchi IDE lar orqali seziladi.

01

Aslida bu nima

25-iyul yangilanishi: Opus 5 Fable 5’ni #3 ga tushiradi. Fable e’lon qilingan SWE-Bench Pro va kichik CursorBench/FrontierCode ustunliklarini saqlaydi; Opus 5 Frontier-Bench’ni yutadi va yarim token narxida deyarli teng. Iyun sharhi foydali dalil bo‘lib qoladi, ammo joriy umumiy tartib emas.

Ushbu sharhni yozishni osonlashtiradigan bitta raqam bor: 80.3%. Bu Claude Fable 5 ning SWE-Bench Pro’dagi natijasi — bu benchmark o’yinchoq muammolarga e’tibor bermaydi, uni faqat SI haqiqiy ishlab chiqarish kod bazalaridagi haqiqiy xatolarni (buglarni) tuzata oladimi-yo’qmi qiziqtiradi. GPT-5.5 da 58.6% natija. Oldingi qirol, Opus 4.8 esa 69.2% ball olgan. Fable 5 shunchaki yengmaydi — u shu qadar katta farq bilan yengadiki, raqamlarni qayta tekshirishga majbur bo’lasiz.

Ammo SWE-Bench Pro bu hikoyaning faqat yarmi xolos. Modellar ishlab chiqarish sifatidagi tokenni tejaydigan kodni yoza oladimi-yo’qligini baholovchi Cognition’ning benchmarki — FrontierCode Diamond ikkinchi yarmini aytib beradi. Fable 5: 29.3%. Opus 4.8: 13.4%. GPT-5.5: 5.7%. Bu shunchaki yetakchilik emas; bu butunlay boshqa sport turi. Va model ushbu ballarga o’rtacha mantiqiy kuchlanish sarflab erishadi, ya’ni yaxshiroq kod ishlab chiqarish uchun kamroq token yondiradi. Aslida haqiqiy vazifalarda ancha arzonga tushadigan qimmat model.

Stripe misoli esa press-relizdagi xayoliy narsa emas. 50 million qatorli Ruby kod bazasi — muhandislarni terlatib yuboradigan ulkan monolit (tizim) — bir kunda ko’chirib (migratsiya) o’tkazildi. Butun boshli jamoa ikki oyda qiladigan ish. Model rejalashtirdi, bajardi, o’zini o’zi tekshirdi va natijani topshirdi. CursorBench haqida gapirar ekan, Cursor bosh direktori u “oldingi modellar uchun imkonsiz bo’lgan uzoq muddatli muammolar sinfini ochib berganini” aytdi. Senior Engineer Benchmark (katta muhandislar) sinovida u 100 dan 91 ball to’pladi — vaholanki GPT-5.5 va Opus 4.8 60 lar atrofida qolib ketgan edi.

Mythos sinfi arxitekturasini xavfsizlik to’siqlariga o’rab, dasturchilarga berganingizda u aynan shunday ko’rinishda bo’ladi. Xavfsizlik to’siqlari haqiqiy — kiberxavfsizlik, biologiya va kimyo so’rovlari Opus 4.8 ga (hali ham ajoyib model, biroq to’liq dvigatel emas) yo’naltiriladi. Ammo xavfsizlik klassifikatorlarini ishga tushirmaydigan 95%+ dasturlash ishlari uchun siz shu paytgacha ommaga taqdim etilgan eng kuchli model bilan ishlaysiz. Agentli dasturlash erasi endi o’zining eng yaqqol chempionini topdi.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Global qayta ishga tushirish va Zero-Day xavfsizlik isboti: 2026-yil 30-iyun kuni xalqaro savdo muvofiqligi tekshiruvidan muvaffaqiyatli o’tgach, Fable 5 hududiy VPN cheklovlarisiz butun dunyo bo’ylab qayta ochildi. Real ishlab chiqarish testlarida Amazon kiberxavfsizlik jamoalari Fable 5 avtonom tarzda 40 ta mikroservis bo’ylab OAuth2 tokenlarini soxtalashtirishga qaratilgan Zero-Day zaifligini 3 daqiqadan kamroq vaqt ichida aniqlab, yamagani — uning korxona darajasidagi xavfsizligini isbotlab berganini tasdiqlashdi.
  • Opus 4.8 kiberxavfsizlik marshrutizatsiyasi va xato signallar: Fable 5 odatiy kodlash vazifalarining ~95% ini nativ ravishda bajarsa-da, Anthropic-ning xavfsizlik klassifikatorlari murakkab yoki yuqori xavfli kiberxavfsizlik so’rovlarini siyosatga muvofiqlikni tekshirish uchun avtomatik ravishda Claude Opus 4.8 modeliga yo’naltiradi. Eslatma: o’ta sezgir klassifikatorlar ba’zan oddiy tizim ma’muriyati skriptlarida ham xato signallarni (false positives) keltirib chiqarishi mumkin.
  • Strukturaviy agentik jeylbreyklarga chidamli: Avtomatlashtirilgan ko’p bosqichli ko’ndirish freymvorklariga (masalan, MoA jeylbreyklari yoki Crescendo hujumlariga) aldanadigan ochiq vaznli raqobatchilardan farqli o’laroq, Fable 5 ning ierarxik xavfsizlik ta’limi ijodiy kodlash sifatini tushirmasdan qat’iy chegaralarni saqlab qoladi.
  • SWE-Bench Pro 80.3% — yangi SOTA: Haqiqiy dasturiy injiniringni (software engineering) sinovdan o’tkazadigan benchmark endigina yangi mutlaq rekordni o’rnatdi. Fable 5 GPT-5.5 ni (58.6%) 21.7 ballga va o’zining avvalgi versiyasi Opus 4.8 ni (69.2%) 11.1 ballga ortda qoldirdi. Bu shunchaki yaqin poyga emas — bu umuman boshqa liga.
  • FrontierCode Diamond 29.3% — token tejamkorligi yangidan ta’riflandi: Cognition’ning yuqori sifatli ishlab chiqarish kodi (production code) uchun benchmarki Fable 5 ni 29.3%, Opus 4.8 ni 13.4% va GPT-5.5 ni 5.7% da ko’rsatmoqda. Model hatto o’rtacha mantiqiy kuchlanishda ham yetakchi natijalarga erishadi — bu degani yaxshiroq natijalar uchun kamroq token sarflanadi.
  • 50 million qator kodda o’z tasdig’ini topgan: Stripe butun bir jamoaga ikki oy vaqt talab qiladigan ishni — 50 million qatorli Ruby kod bazasini bir kun ichida ko’chirish (migratsiya) uchun Fable 5 dan foydalandi. Bu oddiy benchmark yoki demo emas. Ishlab chiqarish bazasidagi haqiqiy kod (Production code).
  • Ko’rish qobiliyatiga asoslangan dasturlash (Vision-native): Veb-ilovalarni faqat skrinshotlarning o’zidan qayta yarata oladi. Ilmiy grafiklardan aniq raqamlarni ajratib oladi. Pokémon FireRed o’yinini hech qanday yordamchi dasturlar va o’yin holati (game-state) ma’lumotlarisiz faqat ko’rish qobiliyati bilan tugatdi. Model ekraningizni o’qiydi va ko’rgan narsasi asosida kod yozadi.
  • Uzoq muddatli avtonom ishlash: Reja tuzadi, vazifalarni kichik agentlarga (sub-agents) bo’lib beradi, o’z testlarini yozadi va ishga tushiradi hamda ko’p kunlik seanslar davomida o’z-o’zini to’g’rilab boradi. Doimiy fayl xotirasi (persistent file-based memory) Slay the Spire o’yinida Opus 4.8 ga qaraganda unumdorlikni 3 barobar yaxshiladi. U nafaqat ishni kuchli boshlaydi — balki oxirigacha shunday qoladi.

Haqiqiy cheklovlar

  • Kiberxavfsizlik bo’yicha xato signallar: O’ta sezgir xavfsizlik klassifikatorlari ba’zan qonuniy tizim ma’muriyati, penetratsion testlar yoki quyi darajadagi debag skriptlarini zararli deb topishi mumkin, bu esa avtomatik ravishda Opus 4.8 modeliga yo’naltirishga yoki ijroni to’liq bloklashga olib keladi.
  • Sohadagi jeylbreyk xavf-xatarlari: Odatiy hujumlarga chidamli bo’lsa-da, hech bir ilg’or model yangi turdagi strukturaviy agentik jeylbreyklardan to’liq kafolatlanmagan; korporativ bosqichda joriy etish uchun doimiy red-tim (xavfsizlik sinovlari) o’tkazish talab etiladi.
  • Yuqori (Premium) narx: Million token uchun $10/$50 bu Opus 4.8 ($5/$25) dan taxminan 2 barobar qimmat degani. Tokenlarni tejash murakkab vazifalarda buni qisman qoplasa-da, kam foydalanuvchilar (light users) buni o’z hisoblarida sezishadi. Pro obunachilari 22-iyungacha bepul kirish imkoniga ega, shundan so’ng kreditlar (pullik hisob) ishga tushadi.
  • Belgilangan mavzularda xavfsizlik yo’nalishi: Kiberxavfsizlik, biologiya, kimyo yoki modelni distillash (distillation) bilan bog’liq so’rovlar avtomatik ravishda Opus 4.8 ga yo’naltiriladi. Bu seanslarning 5% dan kamrog’ida sodir bo’ladi va ba’zida xato ishga tushib qolishi mumkin. Qonuniy xavfsizlik bo’yicha tadqiqotchilarga Project Glasswing orqali cheklangan Mythos 5 kerak bo’lishi mumkin.
  • Uchinchi tomon baholashlari endi chiqmoqda: Anthropic’ning o’z benchmarklari batafsil va misollarga boy, biroq LMSYS Arena va Artificial Analysis’ning to’liq raqamlari taqdimot kunidayoq mavjud emas. Ammo dastlabki belgilar juda ijobiy.
  • To’g’ri muhitda eng yaxshi: Fable 5 Claude Code va API integratsiyalarida eng yorqin namoyon bo’ladi. claude.ai chat tajribasi kuchli, biroq modelning agentlik qobiliyatlari haqiqatan ham to’g’ri vositalar bilangina to’liq ochiladi.
03

Benchmark natijalari

SWE-Bench Pro — 80.3% (SOTA)

Haqiqiy dasturiy injiniring (Software engineering). GPT-5.5 (58.6%) dan 21.7 ball va oldingi Opus 4.8 (69.2%) dan 11.1 ball yuqori. Dasturlash bo'yicha eng asosiy benchmarkda biror model egallagan eng katta ustunlik.

FrontierCode Diamond — 29.3% (SOTA)

Token tejaydigan, ishlab chiqarish (production) sifatidagi kod. Opus 4.8 (13.4%) dan 2.2 marta va GPT-5.5 (5.7%) dan 5.1 marta yaxshiroq. Hatto o'rtacha mantiqiy kuchlanishda ham yetakchi natijalarga erishadi.

Senior Engineer Benchmark — 91/100

Katta farq bilan GPT-5.5 (62/100) va Opus 4.8 (63/100) dan o'zib ketdi. Katta muhandis (senior-level) darajasidagi xulosalarni sinash uchun ishlab chiqilgan vazifalar.

CursorBench — SOTA

IDE ga integratsiya qilingan kodlash bo'yicha Cursor benchmarkida eng yaxshi (SOTA). "Oldingi modellar uchun yetib bo'lmas bo'lgan uzoq muddatli muammolar sinfini ochib berdi".

04

Xulosa

Dasturlash qirolligi toji o’z egasini almashtirdi — hamda qat’iy ravishda. Claude Fable 5 SWE-Bench Pro’da GPT-5.5 ni shunchaki yengibgina qolmaydi — uni 21.7 ballga ortda qoldiradi. U FrontierCode Diamond’da shunchaki yetakchi emas — u 5 barobar katta farq bilan yetakchi. Va sintetik benchmarklardagi g’alabalardan farqli o’laroq, haqiqiy dalillar allaqachon mavjud: bir kunda ko’chirilgan (migratsiya) qilingan 50 million qator kod, faqat ko’rish qobiliyati orqali o’yinni tugatish, avtonom ko’p kunlik muhandislik seanslari. Oldingi Opus 4.8 skalpel qiroli edi; Fable 5 esa nafaqat skalpel qiroli, balki butun operatsiya xonasini boshqaradigan qirol hamdir. Ha, har bir token uchun 2 barobar qimmatroq turadi. Ha, seanslarning <5% i xavfsizlik sabab Opus 4.8 ga yo’naltiriladi. Ammo 2026-yilda professional dasturiy ta’minot yaratishni belgilab beradigan chuqur, murakkab, uzoq muddatli muhandislik ishlari uchun — bu hammaga ochiq bo’lgan eng kuchli kodlash modelidir. Nuqta.

05

Ko'p so'raladigan savollar