Место #1 Локальный / приватный ИИ — ваш мозг, ваша машина, ваши правила
Alibaba (Qwen Team)

Qwen3.8-27B

Qwen3.8-27B — редкая локальная модель, чьи компромиссы совпадают с реально доступным железом: один плотный чекпойнт на 27B для текста, изображений, видео, кода и агентов с инструментами. 4-битная версия помещается на GPU класса 24 ГБ, а Apache 2.0 позволяет хранить работу локально и применять модель коммерчески.

Обновлено 26 августа 2026 года Open WeightsApache 2.027B Dense
Лучше всего для

Qwen3.8-27B — редкая локальная модель, чьи компромиссы совпадают с реально доступным железом: один плотный чекпойнт на 27B для текста, изображений, видео, кода и агентов с инструментами. 4-битная версия помещается на GPU класса 24 ГБ, а Apache 2.0 позволяет хранить работу локально и применять модель коммерчески.

Почему он побеждает

Независимые тесты теперь придают стартовой истории реальную опору: Qwen3.8-27B получает 52 в Artificial Analysis Intelligence Index и 51 в Agentic Index, а рейтинг Arena Image-to-WebDev ставит её на #7 среди гораздо более крупных передовых систем. Собственные результаты Qwen в программировании и управлении компьютером остаются сильными, а модель сочетает контекст 262K, регулируемое рассуждение, нативное зрение и видео с лицензией Apache 2.0.

Обратите внимание

Независимые сводные оценки подтверждают широкие и агентные способности модели, но большинство конкретных результатов в программировании и управлении компьютером по-прежнему получено в окружениях Qwen. Стандартный режим рассуждения xhigh может быть мучительно медленным и многословным на локальном железе; для обычной интерактивной работы начинайте с low или medium либо отключайте мышление. Между загрузкой Q4 размером 18 ГБ и практическим использованием контекста 262K всё ещё стоят ограничения квантования и KV-кэша.

01

Что это на самом деле

Представьте, что вы выбираете мастерскую, а не один молоток. Локальная ИИ-модель должна пройти в дверь, оставить место на верстаке, понять материал и пользоваться инструментами, не отправляя приватную работу наружу. Qwen3.8-27B интересна тем, что все требования встречаются в одном чекпойнте. Это плотная vision-language модель на 27 миллиардов параметров, построенная на гибридной основе Qwen3.5: три слоя Gated DeltaNet сменяются одним слоем полного внимания. Линейное внимание экономит ресурсы, а периодическое полное связывает далёкие детали.

Слово «мультимодальная» здесь имеет вес. Это не текстовая модель с декоративной кнопкой загрузки изображения. Qwen обучает и распространяет её как модель image-text-to-text с нативным вводом изображений и видео. Локальный coding-агент может изучить скриншот, прочесть диалог ошибки, сверить его с исходниками и запустить инструменты, не отправляя картинку отдельному облачному сервису зрения. Карточка модели также описывает работу с документами, диаграммами, браузером, мобильными интерфейсами и часовыми видео. Поэтому Qwen3.8-27B ближе к универсальному приватному верстаку, чем к специализированному автодополнению.

Стартовые числа объясняют ажиотаж. Qwen сообщает 61,7 в SWE-bench Pro, 73,0 в Terminal Bench 2.1, 42,2 в DeepSWE 1.1 и 90,3 в LiveCodeBench v6. Для мультимодальных агентов заявлены 84,3 в OSWorld-Verified, 64,8 в WebArena-Verified и 70,7 в CoWorkBench. По сравнению с Qwen3.6-27B рост виден в ремонте репозиториев, работе в терминале, офисных задачах и управлении компьютером, а не в одном удобно выбранном экзамене. Такая широта интереснее отдельного рекорда.

Первые внешние измерения теперь указывают в том же направлении. Artificial Analysis даёт конфигурации xhigh 52 в Intelligence Index и 51 в Agentic Index; второй показатель немного превосходит исторический результат Opus 4.8 с максимальным усилием в указанном снимке. В рейтинге Arena Image-to-WebDev Qwen3.8-27B занимала #7 с результатом 1574 и 1 686 голосами 25 августа, а доверительный диапазон места простирался от пятого до десятого. То, что скачиваемая модель 27B статистически смешивается с передовыми облачными системами в превращении скриншотов в интерфейсы, примечательно. Эти тесты не воспроизводят точную локальную конфигурацию Qwen, но независимо показывают, что стартовая таблица описывала не мираж.

Но benchmark — лабораторная установка, а не закон природы. SWE-bench Pro и DeepSWE у Qwen используют окружение Claude Code, длинный контекст и заявленные параметры sampling. Qwen также исправила проблемные задачи SWE-bench Pro и заново оценила базовые модели. CoWorkBench и QwenSWEBench — внутренние тесты. MathVision использует фиксированный промпт и исправленные аннотации; некоторые тесты визуальных агентов зависят от конкретных graders или scaffolds. Это не обесценивает числа, а уточняет измерение: Qwen3.8 внутри тщательно выбранной системы. Ollama, LM Studio, llama.cpp или собственный агент могут показать другой результат.

Разговор о железе требует той же точности. Официальные BF16-шарды весов занимают около 55,6 ГБ без служебной памяти движка. Файл Q4_K_M от Unsloth занимает около 17,1 ГБ, визуальный проектор добавляет ещё 0,93 ГБ. Загрузка размером 18 ГБ действительно помещается на GPU с 24 ГБ, но оставшиеся шесть гигабайт — не пустая роскошь: они нужны буферам и KV-кэшу, который помнит предыдущие токены. Чем длиннее контекст, тем больше памяти он потребляет. Карта на 24 ГБ — правдоподобная отправная точка для полезной локальной работы, но не обещание 262 144 токенов при максимальной скорости и полной точности кэша.

Qwen даёт операторам необычно полные рычаги управления. Нативное окно — 262 144 токена, а карточка модели документирует масштабирование YaRN до миллиона для vLLM, SGLang и TokenSpeed. Рассуждение включено по умолчанию, для него доступны уровни усилия low, medium и xhigh, а preserve_thinking переносит контекст рассуждения между ходами агентного диалога. Qwen также обучила голову предсказания нескольких токенов, которую совместимые системы вывода могут использовать для ускорения декодирования.

Заводская настройка плохо подходит многим обычным задачам. По умолчанию Qwen использует рассуждение xhigh, а Artificial Analysis насчитала 160 миллионов выходных токенов на всём своём индексе против медианы 43 миллиона у похожих открытых моделей. В локальном тесте Саймона Уиллисона простой SVG с пеликаном потребовал 22 276 токенов рассуждения и 21 минуту; отключение мышления сократило запуск до 137 секунд. Это не падение качества, а урок эксплуатации: начинайте с low или medium — либо без мышления для простых преобразований — и поднимайте задачу до xhigh, только когда дополнительный поиск стоит ожидания. Статический YaRN, sampling и сохранение состояния рассуждения требуют такой же осознанной настройки.

Правильный первый тест нарочно обычен. Загрузите quant, который можно постоянно держать в памяти, выберите контекстное окно с запасом и дайте Qwen реальную задачу с видимым финишем: исправить падающий тест, извлечь числа из приватного отчёта или воспроизвести интерфейс по скриншоту. Запишите, завершена ли задача, сколько повторов потребовалось, как быстро работала модель и сколько ручных правок осталось. Затем запустите Qwen3.6 или текущую модель в тех же условиях. Так вы измерите собственную мастерскую, а не чужую лабораторию.

Сейчас Qwen3.8-27B — лучший стандартный выбор на пересечении приватности, возможностей, мультимодальности и достижимого железа. Более крупные открытые модели бывают умнее в отдельных или сложных областях, меньшие — быстрее. Qwen занимает полезную середину: достаточно сильна для серьёзной работы, достаточно мала, чтобы жить под одним столом, и достаточно открыта, чтобы этот стол полностью принадлежал вам.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • По-настоящему практичный локальный мультимодальный агент: Один чекпойнт читает текст, скриншоты, схемы, документы и видео, рассуждает и вызывает инструменты. Чтобы изучить ошибку интерфейса или извлечь таблицу перед правкой кода, не нужно распределять приватный процесс между отдельными моделями зрения и программирования.
  • Теперь стартовый прирост подтверждён независимыми данными: В тестах Qwen результат Qwen3.8-27B вырос с 53,5 у Qwen3.6-27B до 61,7 в SWE-bench Pro, с 63,4 до 73,0 в Terminal Bench 2.1 и с 13,3 до 42,2 в DeepSWE 1.1. Отдельно Artificial Analysis присваивает модели 52 в Intelligence Index и 51 в Agentic Index — необычно сильные результаты для открытой модели на 27B.
  • Размер 27B полезен, а не просто мал: Веса Q4_K_M от Unsloth занимают около 17,1 ГБ, а визуальный проектор — около 0,93 ГБ. Поэтому GPU на 24 ГБ или подходящий компьютер на Apple silicon становится реальным домом модели; доступный запас зависит от движка, точности кэша и длины контекста.
  • Необычно полный контроль длинного контекста и мышления: Нативно доступны 262 144 токена; Qwen документирует масштабирование YaRN до 1M для vLLM, SGLang и TokenSpeed. Рассуждение можно отключить, задать усилие low, medium или xhigh и сохранять между ходами длинного агентного цикла. Эти настройки важны, потому что xhigh включён по умолчанию, но подходит не каждой задаче.
  • Открытая лицензия и быстро развивающаяся экосистема развёртывания: Официальный чекпойнт выпущен под Apache 2.0. Qwen документирует поддержку vLLM, SGLang и TokenSpeed; Ollama уже предлагает сборку qwen3.8:27b размером 18 ГБ, а Unsloth публикует GGUF-квантования примерно от 9 ГБ до 31,5 ГБ.

Честные ограничения

  • Независимое подтверждение охватывает общую картину, но не воспроизводит каждое заявление: Artificial Analysis и Arena теперь поддерживают выводы об общем интеллекте, агентности и визуальном программировании. Однако большинство громких сравнений задач всё ещё провела Qwen, смешав публичные тесты с внутренними QwenSWEBench, CoWorkBench и RecreationBench. SWE-bench Pro и DeepSWE используют окружение Claude Code, поэтому измеряют систему «модель плюс обвязка», а не голые веса в любом локальном приложении.
  • 24 ГБ не дают полный контекст 262K: Веса — лишь первый чемодан. Визуальному проектору, буферам движка и растущему KV-кэшу тоже нужна память. Карта на 24 ГБ запускает 4-битную сборку, но очень длинные запросы требуют меньшего или квантованного кэша, частичной выгрузки на CPU либо большего объёма памяти.
  • Квантование меняет то, что мы измеряем: Таблица Qwen не доказывает, что каждый 4-битный GGUF сохраняет то же качество рассуждения, зрения и работы с инструментами. Разница может быть небольшой или зависеть от задачи, но для production надо тестировать именно выбранные quant и длину контекста.
  • Стандартная настройка способна превратить быструю задачу в долгую медитацию: По умолчанию Qwen использует рассуждение xhigh. Простой SVG-тест Саймона Уиллисона занял 21 минуту и 22 276 токенов рассуждения против 137 секунд с отключённым мышлением. Для интерактивной работы начинайте с low или medium, оставляйте xhigh действительно сложным задачам и помните, что на результат также влияют sampling, схемы инструментов, шаблоны чата и статический YaRN.
03

Результаты тестов

Ремонт репозиториев — SWE-bench Pro: 61,7

Qwen сообщает 61,7 против 53,5 у Qwen3.6-27B. Модели оценивались через Claude Code при temperature 1,0, top-p 0,95, контексте 256K и на уточнённом наборе с исправленными проблемными задачами.

Терминальный агент — Terminal Bench 2.1: 73,0

На 9,6 пункта выше Qwen3.6-27B в таблице Qwen. Это сильный сигнал для многошаговой работы в командной строке, хотя локальные скорость и успех по-прежнему зависят от агентной обвязки и доступных инструментов.

Управление компьютером — OSWorld-Verified: 84,3

Главный практический сюрприз: компактный открытый чекпойнт превосходит все сравнения в таблице Qwen, включая Opus 4.6 Max с 72,7. Независимое воспроизведение особенно важно, потому что результаты управления компьютером чувствительны к окружающей обвязке.

Локальный объём — Q4_K_M и визуальный проектор: около 18 ГБ

Метаданные репозитория указывают 17,1 ГБ для Q4_K_M GGUF и около 0,93 ГБ для BF16-проектора. Файлы помещаются на железе класса 24 ГБ, а оставшаяся память определяет доступный контекст и параллельность.

Независимая сводная оценка — Artificial Analysis Intelligence Index: 52

Конфигурация xhigh получает 52, сравнявшись с GPT-5.6 Luna при максимальном усилии в указанном снимке и заняв первое место в сравнительном классе открытых моделей Artificial Analysis от 4B до 40B. На весь индекс она потратила 160 миллионов выходных токенов против медианы 43 миллиона, поэтому результат заодно документирует исключительную многословность.

Визуальное программирование — Arena Image-to-WebDev: #7, результат 1574

25 августа модель 27B занимала седьмое место среди 44 систем с 1 686 голосами и диапазоном ранга 5–10, статистически смешиваясь с гораздо более крупными и дорогими моделями. Arena отражает пользовательские предпочтения, а не контролируемый тест локального quant, но независимо подтверждает практическую силу сочетания зрения и программирования.

04

Вердикт

Qwen3.8-27B остаётся нашей рекомендацией #1 для локального и приватного ИИ, потому что предлагает человеку самый полезный общий набор: серьёзные способности в программировании и агентной работе, нативное зрение и видео, длинный контекст, свободу Apache 2.0 и квантованный размер для одного мощного потребительского GPU. Благодаря Artificial Analysis и Arena это место теперь меньше зависит от стартовых таблиц Qwen. Модель не побеждает всех более крупных соперников, а независимые API-тесты не доказывают, что любая локальная сборка Q4 ведёт себя так же. Считайте оценку 9,2 сильной, но чувствительной к конфигурации рекомендацией: начинайте с режима ниже xhigh, тестируйте именно те quant, инструменты и контекст, которые будете развёртывать, и оставляйте человеку проверку значимых действий.

05

Часто задаваемые вопросы