Представьте, что вы выбираете мастерскую, а не один молоток. Локальная ИИ-модель должна пройти в дверь, оставить место на верстаке, понять материал и пользоваться инструментами, не отправляя приватную работу наружу. Qwen3.8-27B интересна тем, что все требования встречаются в одном чекпойнте. Это плотная vision-language модель на 27 миллиардов параметров, построенная на гибридной основе Qwen3.5: три слоя Gated DeltaNet сменяются одним слоем полного внимания. Линейное внимание экономит ресурсы, а периодическое полное связывает далёкие детали.
Слово «мультимодальная» здесь не означает декоративную кнопку загрузки. Qwen обучает и распространяет модель для текста, изображений и видео. Локальный coding-агент может изучить скриншот, прочесть диалог ошибки, сверить его с исходниками и запустить инструменты, не отправляя картинку отдельному облачному зрению. Карточка описывает документы, диаграммы, браузер, телефон и часовые видео. Поэтому Qwen3.8 ближе к универсальному приватному верстаку, чем к специализированному автодополнению.
Стартовые числа объясняют ажиотаж: 61,7 в SWE-bench Pro, 73,0 в Terminal Bench 2.1, 42,2 в DeepSWE 1.1 и 90,3 в LiveCodeBench v6. Для мультимодальных агентов Qwen заявляет 84,3 в OSWorld-Verified, 64,8 в WebArena-Verified и 70,7 в CoWorkBench. По сравнению с Qwen3.6-27B рост виден в ремонте репозиториев, терминале, офисной работе и управлении компьютером, а не в одном удобно выбранном экзамене. Такая широта интереснее отдельного рекорда.
Но benchmark — лабораторная установка, а не закон природы. SWE-bench Pro и DeepSWE у Qwen используют Claude Code, длинный контекст и заданный sampling. Проблемные задачи SWE-bench Pro исправили, а базовые модели оценили заново. CoWorkBench и QwenSWEBench — внутренние. MathVision использует фиксированный промпт и исправленные аннотации; визуальные агенты зависят от конкретных graders и scaffolds. Это не обесценивает числа, а уточняет измерение: Qwen3.8 в тщательно выбранной системе. Ollama, LM Studio, llama.cpp или собственный агент могут показать другое.
Разговор о железе требует той же точности. Официальные BF16-шарды весят около 55,6 ГБ без служебной памяти. Q4_K_M от Unsloth занимает 17,1 ГБ, визуальный проектор — 0,93 ГБ. Загрузка около 18 ГБ помещается на GPU с 24 ГБ, но оставшиеся шесть нужны буферам и KV-кэшу прошлых токенов. Чем длиннее контекст, тем он больше. Карта на 24 ГБ — правдоподобная отправная точка для полезной работы, но не обещание 262 144 токенов на максимальной скорости.
Qwen даёт необычно полные рычаги управления. Нативное окно — 262 144 токена, а карточка документирует YaRN почти до миллиона для vLLM, SGLang и TokenSpeed. Мышление включено, имеет уровни low, medium и xhigh и сохраняется между ходами агента. Обучена и голова предсказания нескольких токенов, которую совместимые движки используют для ускорения. Но рычаги надо настраивать: статический YaRN может портить короткий текст, а слабое рассуждение — вызывать повторы, съедающие экономию.
Правильный первый тест нарочно обычен. Загрузите quant, постоянно помещающийся в память, оставьте запас контекста и дайте реальную задачу с видимым финишем: исправить падающий тест, извлечь числа из приватного отчёта или собрать интерфейс по скриншоту. Запишите успех, повторы, скорость и ручные правки. Затем запустите Qwen3.6 или текущую модель в тех же условиях. Так вы измерите собственную мастерскую, а не чужую лабораторию.
Сейчас Qwen3.8-27B — лучший выбор на пересечении приватности, возможностей, мультимодальности и достижимого железа. Более крупные открытые модели бывают умнее в сложных областях, меньшие — быстрее. Qwen занимает полезную середину: достаточно сильна для серьёзной работы, достаточно мала для одного стола и достаточно открыта, чтобы этот стол полностью принадлежал вам.