Qwen3.8-Max qiziq bo‘lishining sababi har bir qatorda eng katta son emas. Muhimi — katta kontekst, vizual kirish, agent ambitsiyasi va qayta urinishga imkon beradigan narx kombinatsiyasi. Kodlash sinash, tekshirish va yana sinashdan iborat; token hisobining kichikligi bu jarayonni amaliy qiladi.
Million token uchun $2 kirish va $6 chiqish API’ni Kimi’ning avvalgi $3/$15 narxidan ancha arzon qiladi. Agent repo kontekstini qayta o‘qishi yoki ikkinchi model patchni ko‘rishi kerak bo‘lsa, bu foydali. Arzon degani to‘g‘ri degani emas, ammo test, qayta urinish va mustaqil review kamroq xarajat bo‘ladi.
Frontend Code Arena’ning ilk ko‘rinishida Qwen3.8-Max 1668 Elo bilan #4. Odamlar qaysi model yaratganini bilmay tayyor interfeysni afzal ko‘radi. Bu prototip uchun foydali, ammo chiroyli sahifa mo‘rt kodni yashirishi mumkin va ko‘proq ovoz bilan reyting o‘zgaradi.
Matn, skrinshot, dizayn, yozuv va katta repo 1M kontekstdagi bitta sessiyaga sig‘adi: bu katta ish stoli, kafolat emas. Alibaba Terminal Bench 2.1’dа 86,6 deydi, lekin harness, vosita va takrorlash raqamlarga ta’sir qiladi. SWE-bench Pro 67,7 modelni haqiqiy repolardagi muammolarni hal qilish bo‘yicha yetakchilar qatoriga olib chiqmaydi, aralash bug sinovlari esa eski kodda ehtiyot bo‘lishni talab qiladi.
Shuning uchun #4 vaqtinchalik: frontend, vizual debugging va uzun kontekstda kuchli. Ochiq weights endi matnli modelni private joylashtirish imkonini beradi, ammo CI, infratuzilma narxi, litsenziya va diff review hal qiluvchi bo‘lib qoladi.
Frontend ishida Arena o‘rni ko‘ringanidan foydaliroq. Foydalanuvchi model ichida chiroyli reasoning bo‘lganini ko‘rmaydi; u navigatsiya, oraliqlar, xato holatlari va keyingi qadam tushunarlimi, shuni ko‘radi. Tayyor interfeysni model nomini bilmasdan afzal ko‘rish prototip va mahsulot uchun yaxshi signal. Biroq u accessibility, telefon ekraniga moslashish, yuklanish tezligi va ekran ortidagi kod tekshiruvining o‘rnini bosa olmaydi. Bu to‘rt narsa prompt hamda qabul mezonida bo‘lishi kerak.
Bir million token ham butun repozitoriyni tartibsiz tashlashga taklif emas. Yaxshisi ish papkasini tuzing: avval maqsad, tegishli fayllar, qayta tiklanadigan xato, testlar va arxitektura qarorlari; keyin zarur bo‘lsa qo‘shimcha tarix. Shunda agent minglab sahifani jim ko‘rish o‘rniga gipoteza tuzib, tekshiradi. Qiyin xatoda Qwen kuchli birinchi tekshiruv hisobotini bera oladi. Lekin xavfsiz merge uchun qaysi o‘zgarish yetarlicha kichikligini odam hal qiladi.
Mavjud agent bilan adolatli taqqoslash uchun vazifa, vosita, vaqt limiti va testlar bir xil bo‘lsin. Faqat patch oxirida ishlaganini emas, qancha urinish, token va inson daqiqasi ketganini ham yozing. Qwen iqtisodi tekshirilgan yaxshi urinishlar sonini oshirgandagina qimmatli; shunchaki ko‘proq matn yozganda emas.
Birinchi yaxshi tajriba cheksiz loyiha emas, balki yiqilayotgan test va aniq qabul mezoniga ega muammodir. Qwen’dan o‘zgartirishdan oldin rejasini tushuntirishni so‘rang, keyin testni ishga tushiring va shu xatoda mavjud yordamchingiz bilan taqqoslang. Shunda jamoa bitta leaderboard raqamiga mahliyo bo‘lmay, tuzatish sifati, vaqt va token sarfini birgalikda o‘lchaydi.