O'rin #6 Kundalik ekotizim — Yetakchi SI yordamchilari
xAI

Grok 4.6

Grok 4.6 xAI'ning arzon narx hikoyasini frontier darajasiga olib chiqdi: Artificial Analysis indeksida 61 ball, uzoq agentlik ishlarida kuchli natija va o'sha $2/$6 API narxi.

Yangilangan 2026-yil 14-avgust AgenticKnowledge WorkOffice
9.510 dan
Rasmiy veb-sayt
Eng mos

Grok 4.6 xAI'ning arzon narx hikoyasini frontier darajasiga olib chiqdi: Artificial Analysis indeksida 61 ball, uzoq agentlik ishlarida kuchli natija va o'sha $2/$6 API narxi.

Nima uchun bu eng yaxshisi

Artificial Analysis 61 ball, Grok 4.5 dan besh ball o'sish, har vazifa uchun $0.84, GDPVal-AA v2 da 1753 Elo va AA-Briefcase da 1577 qayd etdi. 500K kontekst hamda Grok Build, Cursor, API, OpenRouter, Vercel va Cloudflare mavjud.

E'tibor bering

Eng katta yutuq agentlik bilim ishlarida; bu kodlash yoki chatda to'liq g'alaba emas. Taqqoslashlar turli harnesslardan olingan, dastlabki xavfsizlik xabarlari esa sandbox, tor ruxsat va inson tekshiruvini talab qiladi.

01

Aslida bu nima

Uzoq vaqt ilg‘or AI restorandagi qoidaga o‘xshardi: menyu qanchalik hashamatli bo‘lsa, hisobni shunchalik diqqat bilan kuzatish kerak edi. Grok 4.6 bu qoidani buzdi. U Artificial Analysis Intelligence Index’da 61 ball oldi, GPT-5.6 Sol bilan tenglashdi va faqat Opus 5 hamda Fable 5’ning eng yuqori rejimlaridan ortda qoldi. Shunga qaramay, standart API narxi million kirish tokeni uchun $2, chiqish tokeni uchun $6 bo‘lib qoldi. Bu safar qobiliyatdagi o‘sish yangi premium hisob bilan kelmadi.

Eng qiziq ma’no umumiy ball ostida yotadi. Professional agent ishini baholaydigan GDPVal-AA v2 testida Grok 1753 Elo oldi. Uzoq tadqiqot, tahlil va tayyor ish mahsulotini talab qiladigan AA-Briefcase testida esa 1577 Elo qayd etdi. Artificial Analysis bir vazifaga o‘rtacha 53 qadam va 0.5 milliard kirish tokeni sarflanganini ko‘rdi. Opus 5 max qariyb 103 qadam va 2.0 milliard token ishlatgan. Tasavvur qiling: ikki loyiha jamoasi o‘xshash sifatdagi hisobot tayyorlaydi, ammo bittasi yarmi kam yig‘ilish o‘tkazadi va hujjatlarni to‘rt baravar kam qayta o‘qiydi. Bunday samaradorlik nafaqat hisobni kamaytiradi, balki uzoq jarayonda agentning asl maqsadni unutish imkoniyatini ham qisqartiradi.

xAI modelni aynan shunday chidamlilik uchun tayyorladi. Taqdimotda uzoqroq qo‘shimcha trening, qayta yaratilgan reasoning va dasturiy trayektoriyalar, shuningdek, bilim ishi, umumiy kodlash, veb-ishlab chiqish, CAD va boshqa vositali muhitlarda reinforcement learning tasvirlangan. Modelda 500 000 token kontekst va low, medium, high hamda xhigh reasoning darajalari bor. U Grok Build, Cursor, xAI API, OpenRouter, Vercel va Cloudflare orqali mavjud. Tezroq variant kutishni kamaytiradi, ammo token narxini ikki baravar oshiradi.

Bu raqamlar barcha yo‘nalishda g‘alaba degani emas. Grokning eng kuchli dalili agentlik bilim ishlaridadir. xAI jadvalida uning DeepSWE v1.1’dagi 65.9% natijasi GPT-5.6 Sol va Fable 5’dan past; Terminal-Bench v3.0’dagi 26% esa raqiblarning 34% atrofidagi natijalaridan ancha ortda. Bundan tashqari, ayrim raqib raqamlari boshqa model kartalari yoki ochiq leaderboardlardan olingan bo‘lib, prompt, vosita va to‘xtash qoidalari bir xil emas. Shu sabab kichik farqni aniq o‘lchov emas, bir xil kuch sinfiga mansublik deb o‘qish to‘g‘riroq.

Dastlabki amaliy xabarlar ham e’tiborga loyiq. Ayrim dasturchilar xavfli security o‘zgarishlari yoki muvaffaqiyatsiz urinishdan keyingi noto‘g‘ri xulq haqida yozgan. Bular chastotani ko‘rsatadigan nazoratli ma’lumot emas, lekin benchmark o‘rtachasi yashirishi mumkin bo‘lgan xato turini tasvirlaydi. Agentni sandboxda ishlatish, unga minimal credentials berish, kichik difflar talab qilish, testlarni ishga tushirish va inson tasdig‘ini saqlash oqilona yo‘ldir. 500K kontekst butun loyihani sig‘dirishi mumkin; u model eng muhim faktni albatta topishini yoki manbani to‘g‘ri ko‘rsatishini kafolatlamaydi.

Shuning uchun amaliy xulosa «Grokka ko‘proq ishonish» emas, **«Grokni yaxshiroq tekshirishga qurbi yetish»**dir. Artificial Analysis bir vazifa uchun qariyb $0.84 o‘lchagan. Ikkinchi ishga tushirish, manba tekshiruvi yoki alohida reviewer model ishlatish shu sabab iqtisodiy jihatdan mantiqli. Tadqiqot, tahlil, ish hujjatlari va uzoq agent vazifalari uchun Grok 4.6 endi narx ustunligiga ega haqiqiy ilg‘or variantdir. Xato pul, obro‘ yoki productionga ta’sir qilsa, darvozada inson qolishi kerak.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Ilg‘or darajaga qaytish: Artificial Analysis to‘qqiz testli indeksda 61 ball beradi—GPT-5.6 Sol bilan teng, Grok 4.5’dan besh ball yuqori va Opus 5 hamda Fable 5 max rejimlaridan past.
  • Uzoq ish asosiy yutuq: GDPVal-AA v2’da 1753 Elo va AA-Briefcase’da 1577 professional agent ishini ko‘rsatadi; xAI jadvalidagi Harvey LAB 15.8% esa eng yaxshi taqqoslash natijasidir.
  • Amaliy samaradorlik: bir Briefcase vazifasiga qariyb 53 qadam va 0.5 mlrd kirish tokeni, Opus 5 max’da 103 va 2.0 mlrd; o‘lchangan $0.84/vazifa narx-intellekt Pareto chegarasida turadi.
  • Narx o’zgarmadi: million token uchun $2/$6, kesh $0.50; tez variant ikki baravar qimmat.
  • Keng kirish: Grok Build, Cursor, API, OpenRouter, Vercel va Cloudflare, 500K kontekst bilan.

Haqiqiy cheklovlar

  • Kodlash yetakchiligi testga bog’liq: DeepSWE 65.9% va Terminal-Bench v3 26% eng yuqori natijalardan past.
  • Sharoitlar bir xil emas: turli kartalar, reytinglar va harnesslar kichik farqlarni noaniq qiladi.
  • Xavfsizlik signallari muhim: xavfli o’zgarishlar va nosozlikni yomon boshqarish haqida xabarlar bor.
  • Umumiy chat ortda: dastlabki kuch agentlar va veb-ishlarda ko’proq ko’rinmoqda.
  • 500K haqiqat kafolati emas: manbalar, nazorat nuqtalari va qabul mezonlari zarur.
03

Benchmark natijalari

Artificial Analysis Intelligence Index — 61

To'qqiz testli mustaqil indeksda GPT-5.6 Sol bilan teng.

GDPVal-AA v2 — 1753 Elo

Professional agentlik ishida juda kuchli natija.

AA-Briefcase — 1577 Elo

Opus 5 max ga qaraganda ancha kam qadam va token bilan Fable darajasiga yaqin sifat.

O'lchangan xarajat — vazifaga $0.84

Artificial Analysis kuzatilgan sarf va $2/$6 narxidan hisoblagan.

04

Xulosa

Grok 4.6 agentlik bilim ishlarida eng kuchli narx-sifat tanlovlaridan biri: mustaqil ilg‘or intellekt, uzoq vazifalarda yuqori samaradorlik va platformani qayta qurmasdan sinash uchun yetarli tarqatish. U har bir kod testida yutmaydi va muhim qarorlardagi xavfni yo‘q qilmaydi. Uni yana bir urinishga qurbi yetadigan loyiha agenti sifatida ishlating, ruxsatlarni tor tuting va tekshiruvni ishning doimiy qismiga aylantiring.

05

Ko'p so'raladigan savollar