Kod yozadigan odam bilan tizimni tushunadigan odam o’rtasida farq bor.
Birinchisi undefined is not a function degan xatoni ko’radi, o’sha qatorni if tekshiruvi bilan o’raydi va ishini davom ettiradi. Nosozlik yo’qoladi. Uch kundan keyin boshqa narsa buziladi — hech kim kutmagan joyda.
Ikkinchisi qiymat nega aniqlanmagan bo’lib chiqqanini so’raydi. U qiymatni servislar orqali orqaga qarab kuzatadi, ma’lumotlar bazasiga yozish xabar tasdiqlanishidan oldin tugab qolganini aniqlaydi va tartibni shunday to’g’rilaydiki, noto’g’ri holat umuman yuzaga kela olmaydi.
Claude Opus 5.5 shubhasiz ikkinchi toifaga kiradi. U 2026-yil 22-sentabrda chiqdi va dasturlash reytingimizda 2-o’rinni egallaydi — undan oldingi har qanday modelga qaraganda 1-o’ringa yaqinroq.
Nimada kuchli: katta va chigal ishlar
Anthropic’ning ilk sinovchilari hikoyalari bir xil shaklda: ilgari butun jamoaga haftalar kerak bo’lgan ulkan ishlar.
- Sinovchilardan biri 680 000 qatorli kod migratsiyasini bir kundan kam vaqtda yakunladi.
- Boshqasi 200 000 qatorli kod bazasini uch soatdan kam vaqtda tekshirib, tuzatib chiqdi. Opus 5 ga xuddi shu ish uchun 20 soatdan ortiq vaqt va 2,5 baravar ko’p token kerak bo’lgan.
- Ichki testda Opus 5.5 va Fable 5.1 veb-trafikni serverlar o’rtasida taqsimlaydigan keng tarqalgan HAProxy dasturini C tilidan Rust tiliga qayta yozdi va ikkalasi ham HAProxy’ning o’z testlaridan deyarli to’liq o’tdi. Opus 5.5 ishni 12 soat o’rniga 9,5 soatda, 51% arzonroqqa tugatdi.
Bular mustaqil o’lchovlar emas, ishlab chiqaruvchi keltirgan misollar, shuning uchun ularni kafolat emas, yo’nalish belgisi deb qabul qiling. Lekin qonuniyat barqaror: ish qanchalik katta va tartibsiz bo’lsa, Opus 5.5 shunchalik uzoqlashib ketadi.
Bundan tashqari, u o’z ishini tushunarli tushuntiradi. Anthropic e’lonida model billingdagi xatoni aniqlayotgani ko’rsatilgan. Texnik tafsilotlar devori o’rniga u puldan boshlaydi: mijoz daromadidagi pasayishning $1,50 qismi narx o’zgarishidan, qolgan $9,92 esa ma’lum bir commit’dagi xatodan kelib chiqqan — o’sha xato tufayli har oyning oxirgi kunidagi foydalanish hisobga olinmay qolgan. Agent kodingizni o’zgartirayotganda, aynan shunday hisobotlar uni halol ushlab turadi.
Benchmarklar: kim hisoblashiga qarab — durang
Bu yerda shoshmaslik kerak, chunki ishlab chiqaruvchi jadvallari va mustaqil testlar biroz boshqacha hikoya qiladi.
Anthropic raqamlari (2026-yil sentabr):
- Terminal-Bench 4.0 — buyruqlar qatori terminalidagi ko’p bosqichli ish: Opus 5.5 66,4% (±2,6 ball). GPT-6 Astra — 57,9%, bu raqamni OpenAI e’lon qilgan.
- FrontierCode v1.1 — koddagi o’zgarishlar birlashtirishga yetarlicha yaxshimi, shuni tekshiradi: Opus 5.5 54,4%, Astra 53,3%.
- CursorBench 4.0 — Cursor muharriri ichidagi uzoqroq dasturlash vazifalari: Opus 5.5 57,8%, Fable 5.1 51,8%.
Mustaqil raqamlar: Artificial Analysis Terminal-Bench 4.0 ni o’zi sinovdan o’tkazdi va Opus 5.5 uchun ham, Astra uchun ham 59,6% natija oldi. Mutlaq durang.
Bizning qoidamiz — mustaqil o’lchovlarga ishlab chiqaruvchi jadvallaridan ko’ra ko’proq ishonish. Sof qobiliyat bo’yicha bu durang. Demak, reytingni boshqa narsa hal qiladi.
Nega birinchi o’rin GPT-6 Astra’da qoladi
Ikki model bir xil yaxshi bo’lsa, biz ularni yakunlangan vazifa sizga qanchaga tushishiga qarab saralaymiz.
Bu yerda Astra’ning aniq ustunligi bor. Maksimal kuch sarfida Artificial Analysis Opus 5.5 har bir vazifaga taxminan 119 000 ta chiqish tokeni yozganini, Astra esa taxminan 27 000 ta yozganini o’lchadi. Opus tokenlari arzonroq (million chiqish tokeni uchun $20, Astra’da esa $50), lekin u taxminan to’rt baravar ko’p token sarflaydi. Hisoblab ko’rsangiz, eng yuqori unumdorlikda Astra’ning o’rtacha vazifasi taxminan ikki baravar arzonga tushadi.
Anthropic’ning asosli qarshi dalili bor. Uning aytishicha, standart kuch darajasida Opus 5.5 Terminal-Bench da Astra bilan xarajatning taxminan 40% i evaziga tenglashadi, FrontierCode da esa taxminan 20% i evaziga undan o’zib ketadi. Agar mustaqil testlar buni tasdiqlasa, reyting o’zgaradi. Hozircha bu ishlab chiqaruvchining da’vosi va biz modelni yuqoriga ko’tarishdan oldin mustaqil ma’lumotlarni kutamiz.
Cheklovlar haqida ochiq gapiramiz
- Maksimal kuch sarfini qiyin muammolar uchun saqlang. Oddiy tuzatishlar uchun maksimal darajada qoldirsangiz, Opus 5.5 uzun fikrlash zanjirlarini yozadi va ularning pulini siz to’laysiz.
- Xavfsizlik ishlari boshqa modelga yo’naltiriladi. Opus 5.5 kiberxavfsizlikda shunchalik kuchliki, Cyber Verification Program ishtirokchisi bo’lmasangiz, Anthropic xavfsizlikka oid vazifalarning ko’pini Opus 4.8 ga yuboradi. Oddiy xatolarni tuzatishga bu ta’sir qilmaydi.
- Uzoq sessiyalar hali ham limitlarga urilishi mumkin. Anthropic pullik tariflarda besh soatlik limitlarni oshirdi, ammo katta repozitoriy ustida soatlab ishlaydigan agent baribir ularga yetib borishi mumkin.
Qaysi birini ishga olish kerak
Aniq belgilangan vazifalar navbati bo’lsa va ularni imkon qadar arzonga yopmoqchi bo’lsangiz, GPT-6 Astra’ni tanlang.
Ish katta, noaniq yoki xavfli bo’lsa — framework migratsiyasi, chuqur audit yoki servislar chegarasidan o’tadigan xato — Claude Opus 5.5 ni tanlang. Bunday ishlarda puxta fikrlash qisqa javobdan qimmatroq. Bu — boshqa hech kim tegishni istamaydigan tizimni biz bemalol ishonib topshira oladigan muhandis.