Aksariyat AI modellari taqdimoti sizga bitta model va bitta qarorni beradi: undan foydalaning yoki yo’q. Gemma 4 sizga beshta model beradi va boshqa savol beradi: sizda qanday uskunalar (hardware) bor?
Bu marketingga o’xshab ko’rinishi mumkin, ammo bu oila haqida eng foydali narsa shu. Har bir a’zo arxitekturaviy jihatdan farq qiladi — nafaqat bitta narsaning kattalashtirilgan nusxasi. Edge (chekka) modellari Per-Layer Embeddings (Har qavatdagi kiritishlar) dan foydalanadi. 12B ko’rish va audio enkoderlarini butunlay chiqarib tashladi. 26B tokenlarni 128 ta ekspert aralashmasi orqali yo’naltiradi. 31B esa har bir token uchun barcha 30.7 milliard parametrlarni sarflaydi. Bitta oila, turli xil muhandislik falsafalari, turli xil kelishuvlar (trade-offlar).
Keling, ularni ko’rib chiqaylik.
E2B — Cho’ntak AI (~1 GB RAM)
Eng kichik Gemma 4. Taxminan 1 GB operativ xotiraga sig’adigan darajada kvantlangan ikki milliard parametr. U matn, rasm va jonli audioni boshqaradi — barchasi qurilma ichida, barchasi oflayn. AIME 2026-da 37.5% ball to’playdi, bu Raspberry Pi-da ishlashi mumkin bo’lgan narsa uchun raqobatbardosh matematik mulohaza hisoblanadi. Asosiy sir Per-Layer Embeddings (PLE) dagi bo’lib, har bir dekoder qatlamiga parametrlar sonini oshirmasdan maksimal intellektni olish uchun o’zining shaxsiy kodlanishini beradi. Siz uni ish stoli (desktop) modelidek kuchli demaysiz, lekin arzon telefonda tezkor tarjimalar, fotosuratlar yoki ovozli so’rovlar uchun bu juda foydali.
E4B — Telefon quvvati (4–6 GB RAM)
E4B telefon uchun optimallashtirilgan modelga yetarlicha mulohaza yuritish uchun yetarli parametrlar berilganda nima bo’lishini ko’rsatadi. U AIME 2026-da 42.5% to’playdi — Gemma 3 ning ancha kattaroq 27B modelidan ikki baravar ko’p. Matn, rasm va audioni lokal darajada qayta ishlaydi, 128K kontekst oynasiga ega va ko’p bosqichli fikrlash uchun sozlanishi fikrlash rejimini (thinking mode) o’z ichiga oladi. Agar sizda 8+ GB RAM’ga ega zamonaviy flagman telefoningiz bo’lsa, bu “shunchaki telefonimdan oflayn rejimida so’rayman” degan so’zni shunchaki qiziqarli tryuk emas, balki jiddiy variantga aylantiradigan modeldir.
12B Unified — Maxfiylikni ta’minlovchi noutbuk agentlar motori (~7 GB VRAM, QAT bilan)
Shu yerda Gemma 4 ko’pchilik uchun qiziqarli bo’ladi. 2026 yil 3 iyunda chiqarilgan 12B Unified o’z o’lchamidagi boshqa hech bir model qila olmaydigan narsani qiladi: u matn, rasm va audioni bitta dekoderli transformatorda hech qanday alohida enkoderlarsiz boshqaradi. Xom tasvir bo’laklari (patchlar) va audio to’lqin shakllari yengil chiziqli qatlamlar (linear layers) orqali to’g’ridan-to’g’ri embedding makoniga kiradi. Oddiyroq arxitektura, pastroq kechikish, osonroq moslashtirish (fine-tuning).
Raqamlar: 77.2% MMLU Pro, 77.5% AIME 2026, 72.0% LiveCodeBench, 78.8% GPQA Diamond. Google uning 26B MoE-ga “umumiy xotiraning yarmidan kamroq hajmida” yaqinlashishini aytmoqda. 5 iyunda chiqarilgan rasmiy QAT (Quantization-Aware Training) varianti bilan Q4_0 versiyasi taxminan 6.7 GB VRAM ni talab qiladi. Spekulyativ dekodlash uchun Multi-Token Prediction (MTP) bilan birlashtiring va hamjamiyat testlarida RTX 4070 Super kabi 12 GB GPU-da soniyasiga 100–130+ tokenni ko’rsatmoqda. U hatto 16 GB birlashtirilgan xotiraga ega noutbuklarda ham ishlaydi — maxsus GPU talab qilinmaydi.
Agar siz avtonom AI agentlarini, lokal ovozli yordamchilarni yoki shaxsiy kodlash jarayonlarini bulutga bog’lanmasdan va maxfiylik xavf-xatarlarisiz to’g’ridan-to’g’ri noutbukingizda ishga tushirishni istasangiz, bu aynan sizning modelingiz.
26B MoE — Samaradorlik bo’yicha ekspert (kvantlangan 15–18 GB VRAM)
26B jami 26 milliard parametrni o’z ichiga oladi, ammo bu yerda o’ziga xos fokus bor: har bir token uchun atigi 3.8 milliard faollashadi. O’rganilgan yo’naltiruvchi har bir token uchun 128 ta ekspert quyi tarmog’idan 2 tasini tanlaydi va ancha kam hisoblash xarajatlari evaziga 31B ga yaqin sifatni beradi. Buni mutaxassislar bilan to’la binoga ega bo’lish va har bir savol uchun faqat o’zingizga kerak bo’lgan ikkitasini chaqirish deb o’ylang.
U matn, tasvir va videoni (kichikroq modellar kabi nafaqat audioni) qo’llab-quvvatlaydi, 256K kontekst oynasiga ega va Arena AI ochiq modellari orasida 6-o’rinni egallaydi. Murosaga kelish joyi bu VRAM — sizga kvantlangan 15-18 GB kerak bo’ladi, bu RTX 4090, RTX 5060 Ti 16 GB yoki 32 GB+ birlashtirilgan xotirali Mac ni anglatadi. Agar sizda apparat bo’lsa va eng yaxshi razvedka va quvvat nisbatini istasangiz, bu sizning modelingiz.
31B Dense — Murosasiz gigant (kvantlangan 16–20 GB VRAM)
Hech qanday marshrutizatsiya yo’q, ekspertlar aralashmasi yo’q, yorliqlar (shortcuts) yo’q. 31B Dense barcha 30.7 milliard parametrni har bir tokenda faollashtiradi. Bu Gemma 4 oilasining eng yuqori sifat nuqtasi — Arena AI-dagi barcha ochiq modellar orasida 3-o’rinni egallaydi va AIME 2026-da 89.2% oladi. 26B (matn, rasm, video) bilan bir xil usullar, bir xil 256K kontekst oynasi, ammo har bir javobda maksimal mulohaza chuqurligi bor.
Narxi hisoblash quvvati bilan o’lchanadi. BF16 uchun ~71 GB VRAM kerak (korporativ darajadagi GPU). Ammo INT4 darajasida kvantlanganda u 16–20 GB xotiraga sig’adi, bu yuqori darajadagi iste’molchi GPU-da to’liq bajarilishi mumkin. Agar apparatingiz yetarli bo’lsa va aniqlik tezlikdan ko’ra muhimroq bo’lsa, bu ilg’or bulutli ishlashga (frontier cloud performance) eng yaqin keladigan ochiq modeldir.
Qaysi birini tanlash kerak?
Mana halol tanlov shpargalkasi:
- Telefon, oflayn, tezkor vazifalar → E4B (yoki juda cheklangan qurilmalar uchun E2B)
- Noutbuk, 8–12 GB GPU → QAT bilan 12B Unified
- Noutbuk, 16 GB yagona xotira, GPU yo’q → QAT bilan 12B Unified (sekinroq lekin ishlaydi)
- Ish stansiyasi (Workstation), RTX 4090 / 32 GB Mac → 26B MoE (vattiga eng yaxshi sifat)
- Server yoki yuqori darajadagi ish stantsiyasi → 31B Dense (maksimal sifat)
Beshalasi ham Apache 2.0 litsenziyasini baham ko’radi, 140 dan ortiq tillarni qo’llab-quvvatlaydi va Ollama, llama.cpp, LM Studio, vLLM va Google AI Edge vositalar to’plami bilan ishlaydi. Oila a’zolari arxitekturada bir-biridan farq qiladi, lekin falsafada kelishib olgan: kimningdir bulutida emas, o’z apparatingizda ishlaydigan jiddiy sun’iy intellekt.