Большинство запусков ИИ-моделей дают вам одну модель и одно решение: использовать или нет. Gemma 4 дает вам пять моделей и задает другой вопрос: какое у вас оборудование?
Это может звучать как маркетинг, но на самом деле это самое полезное свойство данного семейства. Каждый член архитектурно отличается — это не просто увеличенная копия одного и того же. Edge-модели используют Per-Layer Embeddings. 12B полностью отказался от энкодеров зрения и звука. 26B направляет токены через смесь из 128 экспертов. 31B просто бросает все 30,7 миллиардов параметров на каждый токен. Одно семейство, разные инженерные философии, разные компромиссы.
Давайте рассмотрим их подробнее.
E2B — Карманный ИИ (~1 ГБ ОЗУ)
Самая маленькая Gemma 4. Два миллиарда параметров, квантованных так, чтобы поместиться примерно в 1 ГБ оперативной памяти. Она обрабатывает текст, изображения и живой звук — всё на устройстве, всё в автономном режиме. Набирает 37,5% в AIME 2026, что является конкурентоспособным математическим рассуждением для устройства, которое могло бы работать на Raspberry Pi. Секрет заключается в Per-Layer Embeddings (PLE), которая дает каждому слою декодера свое собственное выделенное вложение для максимального интеллекта без раздувания количества параметров. Вы не спутаете её с настольной моделью, но для быстрых переводов, вопросов по фото или голосовых запросов на бюджетном телефоне она действительно полезна.
E4B — Мощь телефона (4–6 ГБ ОЗУ)
E4B — это то, что происходит, когда вы даете модели, оптимизированной для телефона, достаточно параметров, чтобы она могла реально мыслить. Она набирает 42,5% в AIME 2026 — более чем вдвое превосходя модель 27B от Gemma 3. Нативно обрабатывает текст, изображения и звук, имеет контекстное окно 128K и включает настраиваемый режим рассуждений. Если у вас современный флагманский телефон с 8+ ГБ оперативной памяти, это та модель, которая делает фразу «я просто спрошу у своего телефона — оффлайн» серьезным вариантом, а не просто трюком.
12B Unified — Движок приватных агентов для ноутбуков (~7 ГБ VRAM с QAT)
Здесь Gemma 4 становится захватывающей для большинства людей. Выпущенная 3 июня 2026 года, 12B Unified делает то, чего не делает ни одна другая модель её размера: она обрабатывает текст, изображения и аудио в едином трансформере (только декодер) без отдельных энкодеров. Сырые фрагменты изображений и звуковые сигналы идут прямо в пространство вложений через легкие линейные слои. Более простая архитектура, низкая задержка, более легкое дообучение.
Цифры: 77,2% MMLU Pro, 77,5% AIME 2026, 72,0% LiveCodeBench, 78,8% GPQA Diamond. Google утверждает, что она приближается к 26B MoE «при менее чем половине общего объема памяти». С официальным вариантом QAT (Quantization-Aware Training), версия Q4_0 требует около 6,7 ГБ VRAM. В сочетании с Multi-Token Prediction для спекулятивного декодирования сообщество сообщает о 100–130+ токенах в секунду на 12-гигабайтном GPU, таком как RTX 4070 Super. Она даже работает на ноутбуках с 16 ГБ унифицированной памяти — выделенный GPU не обязателен.
Если вы хотите запускать автономных ИИ-агентов, локальных голосовых помощников или приватные процессы написания кода прямо на вашем ноутбуке без зависимости от облака и рисков для конфиденциальности, это ваша модель.
26B MoE — Эксперт по эффективности (15–18 ГБ VRAM квантованно)
26B содержит в общей сложности 26 миллиардов параметров, но вот в чем фокус: на каждый токен активируется только 3,8 миллиарда. Обученный маршрутизатор выбирает 2 из 128 экспертных подсетей для каждого токена, обеспечивая качество, близкое к 31B, при значительно меньших вычислительных затратах. Думайте об этом как о здании полном специалистов, где вы вызываете только тех двоих, которые вам нужны для каждого вопроса.
Она поддерживает текст, изображения и видео, имеет контекстное окно 256K и занимает 6-е место среди открытых моделей на Arena AI. Компромиссом является VRAM — вам потребуется 15–18 ГБ в квантованном виде, что означает наличие RTX 4090, RTX 5060 Ti 16GB или Mac с 32 ГБ+ унифицированной памяти. Если у вас есть такое оборудование и вы хотите получить наилучшее соотношение интеллекта и энергопотребления, это ваша модель.
31B Dense — Бескомпромиссный гигант (16–20 ГБ VRAM квантованно)
Никакой маршрутизации, никакой смеси экспертов, никаких сокращений. 31B Dense активирует все 30,7 миллиарда параметров на каждом токене. Это потолок качества семейства Gemma 4 — 3-е место среди всех открытых моделей на Arena AI и результат 89,2% в AIME 2026. Те же модальности, что и у 26B (текст, изображения, видео), то же контекстное окно 256K, но с максимальной глубиной рассуждений для каждого ответа.
Цена — это вычисления. BF16 требует ~71 ГБ VRAM. Но квантованная до INT4, она помещается в 16–20 ГБ — что вполне реально для мощного потребительского GPU. Если у вас есть оборудование и точность важнее скорости, это та открытая модель, которая ближе всего подходит к облачной производительности.
Какую из них выбрать?
Вот честная шпаргалка:
- Телефон, оффлайн, быстрые задачи → E4B (или E2B для очень ограниченных устройств)
- Ноутбук, 8–12 ГБ GPU → 12B Unified с QAT
- Ноутбук, 16 ГБ унифицированной памяти, без GPU → 12B Unified с QAT (работает медленнее, но работает)
- Рабочая станция, RTX 4090 / 32 ГБ Mac → 26B MoE (лучшее качество на ватт)
- Сервер или высокопроизводительная станция → 31B Dense (максимальное качество)
Все пять имеют лицензию Apache 2.0, поддерживают 140+ языков и работают с Ollama, llama.cpp, LM Studio, vLLM и набором инструментов Google AI Edge. Семейство расходится в архитектуре — но едино в философии: серьезный ИИ, который работает на вашем оборудовании.