Uzoq vaqt ilg‘or AI restorandagi qoidaga o‘xshardi: menyu qanchalik hashamatli bo‘lsa, hisobni shunchalik diqqat bilan kuzatish kerak edi. Grok 4.6 bu qoidani buzdi. U Artificial Analysis Intelligence Index’da 61 ball oldi, GPT-5.6 Sol bilan tenglashdi va faqat Opus 5 hamda Fable 5’ning eng yuqori rejimlaridan ortda qoldi. Shunga qaramay, standart API narxi million kirish tokeni uchun $2, chiqish tokeni uchun $6 bo‘lib qoldi. Bu safar qobiliyatdagi o‘sish yangi premium hisob bilan kelmadi.
Eng qiziq ma’no umumiy ball ostida yotadi. Professional agent ishini baholaydigan GDPVal-AA v2 testida Grok 1753 Elo oldi. Uzoq tadqiqot, tahlil va tayyor ish mahsulotini talab qiladigan AA-Briefcase testida esa 1577 Elo qayd etdi. Artificial Analysis bir vazifaga o‘rtacha 53 qadam va 0.5 milliard kirish tokeni sarflanganini ko‘rdi. Opus 5 max qariyb 103 qadam va 2.0 milliard token ishlatgan. Tasavvur qiling: ikki loyiha jamoasi o‘xshash sifatdagi hisobot tayyorlaydi, ammo bittasi yarmi kam yig‘ilish o‘tkazadi va hujjatlarni to‘rt baravar kam qayta o‘qiydi. Bunday samaradorlik nafaqat hisobni kamaytiradi, balki uzoq jarayonda agentning asl maqsadni unutish imkoniyatini ham qisqartiradi.
xAI modelni aynan shunday chidamlilik uchun tayyorladi. Taqdimotda uzoqroq qo‘shimcha trening, qayta yaratilgan reasoning va dasturiy trayektoriyalar, shuningdek, bilim ishi, umumiy kodlash, veb-ishlab chiqish, CAD va boshqa vositali muhitlarda reinforcement learning tasvirlangan. Modelda 500 000 token kontekst va low, medium, high hamda xhigh reasoning darajalari bor. U Grok Build, Cursor, xAI API, OpenRouter, Vercel va Cloudflare orqali mavjud. Tezroq variant kutishni kamaytiradi, ammo token narxini ikki baravar oshiradi.
Bu raqamlar barcha yo‘nalishda g‘alaba degani emas. Grokning eng kuchli dalili agentlik bilim ishlaridadir. xAI jadvalida uning DeepSWE v1.1’dagi 65.9% natijasi GPT-5.6 Sol va Fable 5’dan past; Terminal-Bench v3.0’dagi 26% esa raqiblarning 34% atrofidagi natijalaridan ancha ortda. Bundan tashqari, ayrim raqib raqamlari boshqa model kartalari yoki ochiq leaderboardlardan olingan bo‘lib, prompt, vosita va to‘xtash qoidalari bir xil emas. Shu sabab kichik farqni aniq o‘lchov emas, bir xil kuch sinfiga mansublik deb o‘qish to‘g‘riroq.
Dastlabki amaliy xabarlar ham e’tiborga loyiq. Ayrim dasturchilar xavfli security o‘zgarishlari yoki muvaffaqiyatsiz urinishdan keyingi noto‘g‘ri xulq haqida yozgan. Bular chastotani ko‘rsatadigan nazoratli ma’lumot emas, lekin benchmark o‘rtachasi yashirishi mumkin bo‘lgan xato turini tasvirlaydi. Agentni sandboxda ishlatish, unga minimal credentials berish, kichik difflar talab qilish, testlarni ishga tushirish va inson tasdig‘ini saqlash oqilona yo‘ldir. 500K kontekst butun loyihani sig‘dirishi mumkin; u model eng muhim faktni albatta topishini yoki manbani to‘g‘ri ko‘rsatishini kafolatlamaydi.
Shuning uchun amaliy xulosa «Grokka ko‘proq ishonish» emas, **«Grokni yaxshiroq tekshirishga qurbi yetish»**dir. Artificial Analysis bir vazifa uchun qariyb $0.84 o‘lchagan. Ikkinchi ishga tushirish, manba tekshiruvi yoki alohida reviewer model ishlatish shu sabab iqtisodiy jihatdan mantiqli. Tadqiqot, tahlil, ish hujjatlari va uzoq agent vazifalari uchun Grok 4.6 endi narx ustunligiga ega haqiqiy ilg‘or variantdir. Xato pul, obro‘ yoki productionga ta’sir qilsa, darvozada inson qolishi kerak.