Qwen3.8-Max’ni yaxshi jihozlangan ustaxonadagi yangi kuchli motor deb tasavvur qilish oson. Motor — Alibabaning flagman modeli: jami 2,4 trillion parametr, so‘rovda shundan 95 milliard faol. Ustaxona esa Qwen Studio: chat, Deep Research, rasm, video va veb-artefaktlar. Kundalik vazifada ustaxonaning o‘zi motor kabi muhim bo‘lishi mumkin.
Birinchi diqqatga tushadigan narsa — narx. Million token uchun $2 kirish va $6 chiqish, kesh uchun $0,25 uzoq tahlil va ikkinchi tekshiruvga joy qoldiradi. Uzoq reasoning baribir chiqish sifatida hisoblanadi, demak hamma ish arzon emas. Ammo arzonroq urinish birinchi chiroyli javobga ishonish o‘rniga uni tekshirish imkonini beradi.
Model bir million token kontekstida matn, rasm va videoni birga ko‘ra oladi. Strategiya hujjati, jadval, maket, boshqaruv paneli skrinshoti va buzilgan jarayon videosi bitta stolga tushadi. Bu mukammal xotira yoki hukm emas, lekin tadqiqot bilan vizual ish orasidagi noaniq topshirishlarni kamaytiradi.
Natijalar umidli, ammo yakuniy emas. Alibaba PaperBench, IFBench, OSWorld-Verified va Terminal Bench’da kuchli natijalarni aytadi; Frontend Code Arena’ning ilk ko‘rinishida model 1668 Elo bilan #4. Ayniqsa, avtonom ish namoyishlari qiziq: Alibaba ma’lumotiga ko‘ra, model 10–16 kun nazoratsiz holda bo‘sh papkadan o‘zini rivojlantiruvchi harness yaratgan, 265 commit qilgan, 127 pull request ochgan va 151 issue yozgan. Kompaniya 45 yuborishda multimodal dialog aniqligi 0,60 dan 0,853 ga ko‘tarilganini, chip dizayni va e-commerce bo‘yicha uzoq simulyatsiyalarni ham aytadi. Bular vendor hisobotlari, mustaqil tasdiq emas, ammo jamoa bitta javobdan ko‘ra uzoq professional ish zanjirini nishonga olayotganini aniq ko‘rsatadi.
Kodda ehtiyotkorlik ayniqsa zarur: SWE-bench Pro 67,7 modelni haqiqiy repolardagi muammolarni hal qilish bo‘yicha frontier yetakchilar qatoriga chiqarmaydi, ilk bug sinovlari ham aralash. Chiroyli interfeys yaratish va eski loyihani ishonchli tuzatish boshqa-boshqa qobiliyat. Shuning uchun Qwen3.8-Max #5 ga loyiq — universal, tejamkor alternativ sifatida. Uni real, chegaralangan vazifada sinang, manbalar va natijalarni tekshiring, mustaqil dalillar uning standart vosita bo‘lishini hal qilsin.
Kundalik tanlovda «eng aqlli model qaysi?» degan savoldan ko‘ra «hozir vaqt qayerda yo‘qolyapti?» degani foydaliroq. PDF, jadval, skrinshot va qisqa ekran yozuvi orasida ma’lumotni doim ko‘chiradigan odam bitta multimodal ish maydonidan yutadi. Ishlari Gmail, Google Docs, Outlook yoki ruxsatlari sozlangan korporativ muhitda bo‘lgan kishi esa o‘sha yerga allaqachon o‘rnatilgan yordamchi bilan ko‘proq vaqt tejashi mumkin. Ekotizim faqat funksiyalar ro‘yxati emas; u yo‘q qiladigan topshirishlar soni hamdir.
Avtonomlik namoyishlarini va’da emas, case study deb o‘qish kerak. 265 commitning o‘zi har biri to‘g‘ri, xavfsiz va saqlashga yaroqli ekanini isbotlamaydi. Muhimi, Alibaba ko‘rsatmoqchi bo‘lgan ish usuli: maqsadni bo‘laklash, vositalardan foydalanish, natijani tekshirish va kontekstni yo‘qotmasdan davom etish. Jamoa avval kichik, qaytarish mumkin bo‘lgan jarayonni—manbali tadqiqot, prototip yoki checklistli tahlilni—sinab ko‘rgani ma’qul; tanqidiy ishni agentga birdan bermaslik kerak.
Qwen oilasining oddiy amaliy foydasi ham bor: ishning har bosqichi uchun alohida hisob ochish shart emas. Bir joyda tadqiqotdan boshlash, keyin skrinshotni ko‘rish va qoralama yoki vizual material tayyorlash mumkin. Ammo qulaylik ko‘r-ko‘rona ishonchga aylanmasin: asl hujjatlarni saqlang, tekshiriladigan manbani so‘rang va pul, obro‘ yoki muhim qarorga ta’sir qiladigan xulosani qayta tekshiring.
14-avgustdan boshlab birinchi Max weights haqiqatan ham ochiq. Yuklab olinadigan checkpoint matnli, native 262 144 token kontekstga ega va qariyb 1.01M gacha uzayadi; hosted Max esa vision, vositalar va standart 1M ni qo‘shadi. 2.4T jami parametr baribir datacenter loyihasi, tijoriy litsenziya chegaralari esa deploymentdan oldin tekshirilishi kerak.