Место #8 Программирование — ИИ, который пишет код для продакшена
Alibaba / Qwen Team

Qwen3.8-Max

Ценный конкурент для визуальных задач и программирования с длинным контекстом, который теперь занимает 6-е место после того, как независимые тесты поставили впереди флагманский GLM-5.3. Его загружаемый чекпойнт уровня Max остается выдающимся, но 2.4 триллиона параметров превращают самостоятельный хостинг в проект масштаба дата-центра.

Обновлено 30 августа 2026 г. Agentic CodingVision + Video1M Context

Рейтинг обновлён Рейтинг в категории «Программирование» пересматривался с момента последнего обновления этого обзора (30 августа 2026 г.). Место, указанное выше, всегда актуально. Сейчас № 1: GPT-6 Astra

Лучше всего для

Ценный конкурент для визуальных задач и программирования с длинным контекстом, который теперь занимает 6-е место после того, как независимые тесты поставили впереди флагманский GLM-5.3. Его загружаемый чекпойнт уровня Max остается выдающимся, но 2.4 триллиона параметров превращают самостоятельный хостинг в проект масштаба дата-центра.

Почему он побеждает

Artificial Analysis фиксирует 71.8 по программированию и 58.4 по агентной работе; Alibaba сообщает о 86.6 в Terminal Bench 2.1 и 93.0 в PaperBench. Хостируемый Max добавляет зрение, инструменты, контекст в 1 миллион токенов по умолчанию и доступ к API за $2/$6, в то время как открытые веса позволяют развернуть частную текстовую версию.

Обратите внимание

GLM-5.3 теперь опережает Qwen в независимых индексах интеллекта, программирования и агентной работы, а также в прямых сравнениях Z.ai по Terminal-Bench и DeepSWE. Самые сильные подробные оценки Qwen по-прежнему предоставляются самим разработчиком, а результаты реальных тестов на исправление ошибок остаются смешанными.

01

Что это на самом деле

Интересная особенность Qwen3.8-Max заключается не в том, что у него самые высокие показатели в каждой строке. Это не так. Самое интересное — это комбинация: модель с очень большим контекстным окном, визуальным вводом, серьезными амбициями агента и ценой, которая делает повторные попытки доступными. Программирование в основном состоит из попыток, проверок и новых попыток; меньший счет за токены делает этот процесс менее теоретическим.

Alibaba предлагает модель по цене $2 за миллион токенов ввода и $6 за миллион токенов вывода. Для сравнения, предыдущий тариф Kimi K3 в этом руководстве составлял $3/$15. Эта экономия особенно полезна, когда агенту-программисту нужно заново прочитать контекст репозитория или когда вы хотите, чтобы вторая модель проверила патч. Дешево — не значит хорошо, но это может сделать хорошие инженерные привычки — тесты, повторные запуски и независимые обзоры — менее дорогими на практике.

Ранние результаты во фронтенде заслуживают внимания. В раннем срезе Frontend Code Arena модель Qwen3.8-Max занимает 4-е место с 1668 Elo. Эти рейтинги основаны на том, что люди предпочитают один готовый интерфейс другому, не зная, какая модель его создала. Это приближает тест к главному вопросу, стоящему за любым прототипом продукта: выглядит ли страница согласованно и работает ли она так, как ожидает пользователь? Оценка может измениться, и красивый интерфейс все еще может скрывать хрупкий код, но это значимый стартовый сигнал.

Вводы хостируемой модели Max хорошо подходят для визуальной разработки: скриншот, референс дизайна, запись браузера, бриф и текст репозитория могут быть в одном чате. Открытый чекпойнт отличается: он работает только с текстом с нативным контекстом в 262K, который можно расширить примерно до 1.01M. Командам следует выбирать между хостируемой и открытой версиями, основываясь на том, какие модальности и инфраструктура им действительно нужны.

Открытый релиз больше меняет развертывание, нежели волшебным образом изменяет уверенность в бенчмарках. Команды могут хранить код в своей собственной среде и обслуживать модель через поддерживаемые стеки. Тем не менее, 2.4 триллиона параметров остаются масштабом дата-центра, а специальная лицензия добавляет условия упоминания названия и отдельных лицензий при высоких порогах пользователей или дохода. Открытые веса просто переносят замок с двери поставщика в вашу серверную; они не делают серверную маленькой.

Alibaba сообщает о 86.6 в Terminal Bench 2.1, что является сильным результатом для агента, работающего с задачами командной строки. Z.ai сообщает о 88.2 для GLM-5.3 в той же стартовой таблице и 66.9 против 56.6 у Qwen в DeepSWE. Независимый анализ Artificial Analysis ставит GLM впереди с 74.8 против 71.8 по программированию и 59.1 против 58.4 по агентной работе. GLM также занимает третье место с 41.8% в новейшей публичной таблице лидеров Terminal-Bench 4.0, где Qwen вообще не представлен. Разные системы тестирования по-прежнему имеют значение, но теперь данные достаточно последовательно указывают на изменение порядка.

Самое очевидное предостережение касается починки репозиториев. Результат Alibaba 67.7 в SWE-bench Pro солиден, но ниже лидирующих показателей, а ранние независимые отчеты об исправлении багов оказались неоднородными. Это знакомая разница в разработке ИИ: создание убедительного нового интерфейса и починка старой запутанной кодовой базы используют одни и те же инструменты, но не обязательно один и тот же тип дисциплины. Используйте Qwen для обеих задач, если он хорошо зарекомендует себя в ваших тестах; не делайте автоматического вывода о победе во втором случае, основываясь на первом.

На данный момент Qwen3.8-Max занимает 6-е место с оценкой 9.2. Он остается привлекательным для работы с фронтендом через хостируемую мультимодальную версию Max и для приватного кодинга с длинным контекстом через открытый текстовый чекпойнт, но флагманский GLM-5.3 теперь находится выше него в списке по программированию. Держите доступ строго ограниченным и измеряйте полный результат: прохождение тестов, проверенные диффы, полезное поведение, стоимость инфраструктуры и соответствие лицензии.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Цена меняет то, что стоит пробовать: При стоимости $2 за ввод / $6 за вывод за миллион токенов, Qwen3.8-Max стоит гораздо дешевле самых дорогих агентов-программистов и дешевле прежнего тарифа Kimi K3 ($3/$15). Это делает итеративную отладку, длинный контекст и повторное независимое рецензирование финансово реалистичными.
  • Он начинает с обнадеживающих результатов во фронтенде: Frontend Code Arena ставит Qwen3.8-Max на 1668 Elo (4-е место) в раннем срезе, что включает высокие позиции для потребительских продуктов. Слепое предпочтение сгенерированного интерфейса — полезный сигнал для UI-разработки, даже если это не доказывает инженерных навыков в масштабе всего репозитория.
  • Длинные визуальные задачи подходят его архитектуре ввода: Модель может принимать текст, скриншоты, диаграммы и видео с контекстным окном в 1 миллион токенов. Это чрезвычайно полезно для превращения дизайна в код, диагностики записанного сбоя UI или удержания большого репозитория вместе с требованиями к продукту в одной рабочей сессии.
  • Результат терминального агента от разработчика высок: Alibaba сообщает о 86.6 в Terminal Bench 2.1, что близко к вершине их сравнения. Это свидетельство того, что система Qwen может выполнять задачи в командной строке, писать файлы и реагировать на обратную связь от инструментов.
  • Он предлагает целенаправленные настройки рассуждений: Настройка reasoning_effort поддерживает высокие, средние и низкие уровни, а preserve_thinking включена по умолчанию. Разработчики могут уделить больше времени сложному дизайну или сократить задержку для небольшой, четко определенной правки.
  • Команды могут хостить уровень Max самостоятельно: Открытый чекпойнт доступен на Hugging Face и ModelScope, и в его карточке заявлена совместимость с vLLM, SGLang и TokenSpeed. Это позволяет проводить частную оценку и тонкую настройку, при условии наличия у команды оборудования масштаба дата-центра.

Честные ограничения

  • Независимые данные теперь устанавливают более низкий потолок: Artificial Analysis оценивает Qwen3.8-Max в 71.8 по программированию и 58.4 по агентной работе, позади GLM-5.3 (74.8 и 59.1). Подробные результаты Alibaba по Terminal Bench и PaperBench остаются полезными, но сильно зависят от настройки тестов.
  • Починка репозиториев остается наиболее очевидным пробелом: Alibaba сообщает о 67.7 в SWE-bench Pro, что уступает сильнейшим результатам передовых моделей. Ранние независимые отчеты по тестам на исправление багов также неоднозначны, поэтому хорошую фронтенд-демонстрацию не следует путать с надежным обслуживанием большой кодовой базы в продакшене.
  • Огромный контекст может заставить плохой план существовать дольше: Миллион токенов позволяет модели видеть очень много, но она все равно может неправильно интерпретировать архитектурное допущение или упустить факт в середине текста. Используйте небольшие коммиты, тесты и чекпойнты, вместо того чтобы поручать неограниченную задачу в течение одной длинной сессии.
  • Качество рассуждений, скорость и стоимость образуют трехсторонний компромисс: Высокие усилия могут помочь в сложной проблеме, но токены рассуждений оплачиваются как вывод, и ранние пользователи сообщают о высоком потреблении квот или токенов. Используйте средние или низкие усилия для рутинных правок и измеряйте стоимость каждого интегрированного и протестированного изменения.
  • Доступ к сервису и интеграции могут зависеть от региона: API доступны, но доступность, оплата, квоты и задержки могут различаться в зависимости от местоположения. Прежде чем делать модель стандартом, убедитесь, что она надежно доступна там, где работает ваша команда и развернут код.
  • Лицензия и оборудование по-прежнему устанавливают границы: Обслуживание 2.4 триллионов параметров — это проект для дата-центра, а специальная лицензия требует указания названия модели для очень крупных продуктов плюс отдельного разрешения для крупных модельных сервисов или компаний по предоставлению услуг помощников в программировании/офисе, превышающих порог дохода.
03

Результаты тестов

Frontend Code Arena — 1668 Elo (4-е место, ранний)

Ранний результат человеческих предпочтений для завершенной работы во фронтенде. Это убедительное доказательство для создания UI, но не полный рейтинг программной инженерии.

Terminal Bench 2.1 — 86.6 (Данные Alibaba)

Высокий результат терминального агента, о котором сообщает разработчик, позади заявленных 88.8 у GPT-5.6 Sol. Различные среды тестирования агентов делают прямое сравнение моделей несовершенным.

SWE-bench Pro — 67.7 (Данные Alibaba)

Достойный балл за ремонт репозиториев, который все еще отстает от самых сильных результатов семейства Claude в таблице разработчика.

PaperBench — 93.0 (Данные Alibaba)

Мощный сигнал для исследовательской работы, полезный контекст для планирования и долгих рассуждений, но не прямой бенчмарк программирования.

Artificial Analysis Программирование / Агентные — 71.8 / 58.4

Независимые композитные данные отстают от GLM-5.3 (74.8 / 59.1) и подтверждают позицию флагмана GLM выше Qwen. Qwen пока остается чуть впереди GLM-5.3-Flash в этих сырых индексах.

04

Вердикт

Qwen3.8-Max опускается на 6-е место в программировании с баллом 9.2, скорректированным по формуле. Он остается отличным визуальным, чувствительным к стоимости конкурентом с длинным контекстом, но последние независимые данные больше не позволяют ставить его выше флагмана GLM-5.3. Grok 4.6 занимает 4-е место, GLM-5.3 — 5-е, Qwen — 6-е, а GLM-5.3-Flash — 7-е. Используйте Qwen там, где его мультимодальный хостируемый продукт и цена соответствуют задаче, а затем предоставьте CI и код-ревью решать, действительно ли он превосходит эти модели в вашем репозитории.

05

Часто задаваемые вопросы