Место #1 Локальный / Приватный ИИ — Ваш мозг, Ваша машина, Ваши правила
Alibaba (Qwen Team)

Qwen3.8 — 27B

Qwen3.8-27B — редкая локальная модель, чьи компромиссы совпадают с реально доступным железом: один плотный чекпойнт на 27B для текста, изображений, видео, кода и агентов с инструментами. 4-битная версия помещается на GPU класса 24 ГБ, а Apache 2.0 позволяет хранить работу локально и применять модель коммерчески.

Обновлено 15 августа 2026 Open WeightsApache 2.027B Dense
Лучше всего для

Qwen3.8-27B — редкая локальная модель, чьи компромиссы совпадают с реально доступным железом: один плотный чекпойнт на 27B для текста, изображений, видео, кода и агентов с инструментами. 4-битная версия помещается на GPU класса 24 ГБ, а Apache 2.0 позволяет хранить работу локально и применять модель коммерчески.

Почему он побеждает

Qwen заявляет 61,7 в SWE-bench Pro, 73,0 в Terminal Bench 2.1, 42,2 в DeepSWE 1.1, 84,3 в OSWorld-Verified и 70,7 в CoWorkBench. Нативный контекст — 262 144 токена, есть YaRN до 1M, уровни усилия рассуждения, сохранение мышления между ходами, нативное понимание изображений и видео.

Обратите внимание

Это данные первого дня, а не устоявшийся факт. Большинство громких чисел взято из таблицы Qwen; часть получена с Claude Code, исправленными задачами, специальными промптами или внутренними наборами. Типичный Q4_K_M вместе с визуальным проектором занимает около 18 ГБ, однако служебная память и KV-кэш всё равно ограничивают контекст на карте 24 ГБ.

01

Что это на самом деле

Представьте, что вы выбираете мастерскую, а не один молоток. Локальная ИИ-модель должна пройти в дверь, оставить место на верстаке, понять материал и пользоваться инструментами, не отправляя приватную работу наружу. Qwen3.8-27B интересна тем, что все требования встречаются в одном чекпойнте. Это плотная vision-language модель на 27 миллиардов параметров, построенная на гибридной основе Qwen3.5: три слоя Gated DeltaNet сменяются одним слоем полного внимания. Линейное внимание экономит ресурсы, а периодическое полное связывает далёкие детали.

Слово «мультимодальная» здесь не означает декоративную кнопку загрузки. Qwen обучает и распространяет модель для текста, изображений и видео. Локальный coding-агент может изучить скриншот, прочесть диалог ошибки, сверить его с исходниками и запустить инструменты, не отправляя картинку отдельному облачному зрению. Карточка описывает документы, диаграммы, браузер, телефон и часовые видео. Поэтому Qwen3.8 ближе к универсальному приватному верстаку, чем к специализированному автодополнению.

Стартовые числа объясняют ажиотаж: 61,7 в SWE-bench Pro, 73,0 в Terminal Bench 2.1, 42,2 в DeepSWE 1.1 и 90,3 в LiveCodeBench v6. Для мультимодальных агентов Qwen заявляет 84,3 в OSWorld-Verified, 64,8 в WebArena-Verified и 70,7 в CoWorkBench. По сравнению с Qwen3.6-27B рост виден в ремонте репозиториев, терминале, офисной работе и управлении компьютером, а не в одном удобно выбранном экзамене. Такая широта интереснее отдельного рекорда.

Но benchmark — лабораторная установка, а не закон природы. SWE-bench Pro и DeepSWE у Qwen используют Claude Code, длинный контекст и заданный sampling. Проблемные задачи SWE-bench Pro исправили, а базовые модели оценили заново. CoWorkBench и QwenSWEBench — внутренние. MathVision использует фиксированный промпт и исправленные аннотации; визуальные агенты зависят от конкретных graders и scaffolds. Это не обесценивает числа, а уточняет измерение: Qwen3.8 в тщательно выбранной системе. Ollama, LM Studio, llama.cpp или собственный агент могут показать другое.

Разговор о железе требует той же точности. Официальные BF16-шарды весят около 55,6 ГБ без служебной памяти. Q4_K_M от Unsloth занимает 17,1 ГБ, визуальный проектор — 0,93 ГБ. Загрузка около 18 ГБ помещается на GPU с 24 ГБ, но оставшиеся шесть нужны буферам и KV-кэшу прошлых токенов. Чем длиннее контекст, тем он больше. Карта на 24 ГБ — правдоподобная отправная точка для полезной работы, но не обещание 262 144 токенов на максимальной скорости.

Qwen даёт необычно полные рычаги управления. Нативное окно — 262 144 токена, а карточка документирует YaRN почти до миллиона для vLLM, SGLang и TokenSpeed. Мышление включено, имеет уровни low, medium и xhigh и сохраняется между ходами агента. Обучена и голова предсказания нескольких токенов, которую совместимые движки используют для ускорения. Но рычаги надо настраивать: статический YaRN может портить короткий текст, а слабое рассуждение — вызывать повторы, съедающие экономию.

Правильный первый тест нарочно обычен. Загрузите quant, постоянно помещающийся в память, оставьте запас контекста и дайте реальную задачу с видимым финишем: исправить падающий тест, извлечь числа из приватного отчёта или собрать интерфейс по скриншоту. Запишите успех, повторы, скорость и ручные правки. Затем запустите Qwen3.6 или текущую модель в тех же условиях. Так вы измерите собственную мастерскую, а не чужую лабораторию.

Сейчас Qwen3.8-27B — лучший выбор на пересечении приватности, возможностей, мультимодальности и достижимого железа. Более крупные открытые модели бывают умнее в сложных областях, меньшие — быстрее. Qwen занимает полезную середину: достаточно сильна для серьёзной работы, достаточно мала для одного стола и достаточно открыта, чтобы этот стол полностью принадлежал вам.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • По-настоящему практичный локальный мультимодальный агент: Один чекпойнт читает текст, скриншоты, схемы, документы и видео, рассуждает и вызывает инструменты. Для разбора ошибки интерфейса или таблицы перед правкой кода не нужно отправлять приватный процесс разным облачным моделям зрения и программирования.
  • Крупный скачок относительно прошлого поколения в тестах Qwen: Qwen3.8-27B повышает результат Qwen3.6-27B с 53,5 до 61,7 в SWE-bench Pro, с 63,4 до 73,0 в Terminal Bench 2.1 и с 13,3 до 42,2 в DeepSWE 1.1. Harness важен, но рост виден в разных типах разработки.
  • Размер 27B мал в полезном смысле: Вес Q4_K_M от Unsloth — около 17,1 ГБ, визуального проектора — около 0,93 ГБ. Поэтому GPU на 24 ГБ или подходящий Apple Silicon становятся реальным домом модели; запас зависит от движка, точности кэша и длины контекста.
  • Необычно полный контроль длинного контекста и мышления: Нативно доступны 262 144 токена; Qwen документирует YaRN до 1M в vLLM, SGLang и TokenSpeed. Рассуждение можно отключить, выбрать low, medium или xhigh и сохранять между ходами длинного агентного цикла.
  • Открытая лицензия и быстро готовая экосистема: Официальный чекпойнт имеет Apache 2.0. Qwen документирует vLLM, SGLang и TokenSpeed; Ollama уже предлагает 18-гигабайтный qwen3.8:27b, а Unsloth — GGUF примерно от 9 до 31,5 ГБ.

Честные ограничения

  • Цифры в основном опубликованы поставщиком: Qwen провела большинство сравнений и смешала публичные тесты с внутренними QwenSWEBench, CoWorkBench и RecreationBench. SWE-bench Pro и DeepSWE используют Claude Code с настройками Qwen, то есть измеряют систему «модель плюс harness», а не голые веса в любом локальном приложении.
  • 24 ГБ не дают полный контекст 262K: Веса — лишь первый чемодан. Визуальному проектору, буферам движка и растущему KV-кэшу тоже нужна память. Карта на 24 ГБ запускает 4-битную сборку, но очень длинные запросы требуют меньшего или квантованного кэша, частичной выгрузки на CPU либо большего объёма памяти.
  • Квантование меняет измеряемую модель: Таблица Qwen не доказывает, что каждый 4-битный GGUF сохраняет то же качество рассуждения, зрения и инструментов. Разница может быть небольшой или зависеть от задачи, но в продакшене надо тестировать именно выбранный quant и длину контекста.
  • Ранние интеграции требуют настроек под Qwen: Мышление включено по умолчанию, Qwen рекомендует разные параметры sampling для режимов с рассуждением и без него, а статический YaRN может ухудшить короткие тексты. Схемы инструментов, лимиты ответа и шаблон чата — часть продукта.
03

Результаты тестов

Ремонт репозиториев — SWE-bench Pro: 61,7

Qwen заявляет 61,7 против 53,5 у Qwen3.6-27B. Модели оценивались через Claude Code при temperature 1,0, top-p 0,95, контексте 256K и на уточнённом наборе с исправленными проблемными задачами.

Терминальный агент — Terminal Bench 2.1: 73,0

На 9,6 пункта выше Qwen3.6-27B в таблице Qwen. Это сильный сигнал для многошаговой работы в терминале, хотя локальные скорость и успех по-прежнему зависят от агентной оболочки и инструментов.

Управление компьютером — OSWorld-Verified: 84,3

Главный практический сюрприз: компактный открытый чекпойнт превосходит все сравнения Qwen, включая Opus4.6 Max с 72,7. Независимое повторение особенно важно, потому что computer-use чувствителен к окружению.

Локальный объём — Q4_K_M и визуальный проектор: около 18 ГБ

Метаданные репозитория указывают 17,1 ГБ для Q4_K_M GGUF и около 0,93 ГБ для BF16-проектора. Файлы помещаются на 24 ГБ, а оставшаяся память определяет контекст и параллельность.

04

Вердикт

Qwen3.8-27B становится нашей рекомендацией #1 для локального и приватного ИИ, потому что предлагает человеку наиболее полезный комплект: серьёзный код и агенты, нативные изображения и видео, длинный контекст, свободу Apache 2.0 и квантованный размер для одного мощного потребительского GPU. Она не побеждает любую крупную модель—DeepSeek-V4-Flash-0731 лидирует в Terminal Bench и DeepSWE в таблице Qwen—но полезные quants DeepSeek требуют около 100 ГБ, а не 18. Для локальной категории разница доступности принципиальна. Оценка 9,2 предварительна: тестируйте конкретные quant, инструменты и промпты, оставляйте человеку контроль важных действий и пересмотрите место после независимых репликаций.

05

Часто задаваемые вопросы