Место #4 Кодинг — ИИ, который пишет код для продакшена
Alibaba / Qwen Team

Qwen3.8-Max

Qwen3.8-Max занимает #4 для кода как выгодный претендент: контекст 1M, ввод изображений и видео, сильный ранний фронтенд-сигнал и API заметно дешевле премиальных моделей. Рейтинг предварительный: главные цифры опубликованы поставщиком, а независимые проверки ремонта пока редкие и неоднозначные.

Обновлено 14 августа 2026 Agentic CodingVision + Video1M Context
Лучше всего для

Qwen3.8-Max занимает #4 для кода как выгодный претендент: контекст 1M, ввод изображений и видео, сильный ранний фронтенд-сигнал и API заметно дешевле премиальных моделей. Рейтинг предварительный: главные цифры опубликованы поставщиком, а независимые проверки ремонта пока редкие и неоднозначные.

Почему он побеждает

Alibaba заявляет 86,6 в Terminal Bench 2.1; ранний Frontend Code Arena ставит Qwen3.8-Max #4 с 1668 Elo. Модель принимает текст, изображения и видео, имеет 2,4T общих / 95B активных параметров, контекст 1M и совместимые API за $2/$6 на миллион входных/выходных токенов.

Обратите внимание

Быстрый и недорогой претендент не становится автоматически чемпионом кода. Результат зависит от harness, 67,7 в SWE-bench Pro ниже лидеров, а некоторые ранние баг-тесты слабые. Перед доступом к продакшену должен решить собственный CI.

01

Что это на самом деле

Интерес Qwen3.8-Max не в том, что он выигрывает каждую строку. Важна комбинация большого контекста, визуального ввода, агентских амбиций и цены, позволяющей повторять попытки. Программирование — это попробовать, проверить, попробовать снова; меньший счёт за токены делает этот цикл практичнее.

При $2 за вход и $6 за выход на миллион токенов API заметно дешевле прежних $3/$15 Kimi. Это помогает, когда агент перечитывает репозиторий или второй моделью проверяют патч. Дёшево не значит верно, но тесты, повторы и независимое ревью становятся менее дорогими.

В раннем срезе Frontend Code Arena Qwen3.8-Max — #4 с 1668 Elo. Люди выбирают готовый интерфейс, не зная модель. Это полезно для прототипа, но красивая страница может скрывать хрупкий код, а ранг изменится с голосами.

Текст, скриншот, дизайн, запись и много кода помещаются в сессию 1M — большой верстак, не гарантия. Alibaba заявляет 86,6 в Terminal Bench 2.1, но harness, инструменты и повторы влияют на цифры. 67,7 в SWE-bench Pro не выводят модель в лидеры по решению задач в реальных репозиториях, а смешанные баг-тесты требуют осторожности со старым кодом.

Потому #4 остаётся предварительным: модель сильна для фронтенда, визуальной отладки и долгого контекста. Открытые веса теперь позволяют частное размещение текстовой версии, но решают всё ещё CI, стоимость инфраструктуры, лицензия и ревью diff.

Для фронтенда место в Arena полезнее, чем кажется. Пользователь не видит, было ли у модели красивое внутреннее рассуждение; он видит, понятны ли навигация, отступы, состояния ошибок и следующий шаг. Поэтому слепое предпочтение готового интерфейса — хороший сигнал для прототипа и продуктовой работы. Но оно не заменяет проверку доступности, адаптации под экран, скорости загрузки и кода под экраном. Эти четыре вещи должны быть и в задании, и в критериях приёмки.

Миллион токенов не следует понимать как приглашение загрузить весь репозиторий без порядка. Лучше собрать рабочую папку: цель, нужные файлы, воспроизводимая ошибка, тесты и архитектурные решения сначала; дополнительную историю — только при необходимости. Тогда агент строит и проверяет гипотезы, а не молча просматривает тысячи страниц. При сложной ошибке Qwen может дать сильное первое расследование. Человек всё равно выбирает изменение, достаточно небольшое для безопасного merge.

Для честного сравнения с текущим агентом нужны одна задача, одни инструменты, один лимит времени и одинаковые тесты. Записывайте не только то, заработал ли патч в итоге, но и число попыток, токенов и минут человека. Экономика Qwen ценна, когда она увеличивает число хороших проверенных попыток, а не просто количество сгенерированного текста.

Лучший первый опыт — не бесконечный проект, а задача с падающим тестом и ясным критерием приёмки. Попросите Qwen объяснить план до правки, запустите тест после неё и сравните с текущим помощником на той же ошибке. Так команда измеряет качество исправления, время и расход токенов вместе, а не влюбляется в одну цифру на таблице лидеров.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Цена позволяет больше настоящих попыток: $2/$6 на миллион токенов делают итеративную отладку и второе ревью доступнее прежних $3/$15 Kimi.
  • Фронтенд начинает сильно: 1668 Elo (#4) в Frontend Code Arena — хороший UI-сигнал, но не полное доказательство инженерной надёжности.
  • Визуальные и длинные задачи подходят модели: текст, скриншоты, схемы и видео с 1M контекста полезны для design-to-code и диагностики.
  • Заявленный терминальный результат высок: 86,6 в Terminal Bench 2.1 говорит, что система умеет работать с инструментами и обратной связью.
  • Рассуждением можно управлять: reasoning_effort имеет три уровня, а preserve_thinking включён по умолчанию.
  • Внедрение не требует особой интеграции: API совместимы с OpenAI и Anthropic; модель можно испытать в существующем агенте.

Честные ограничения

  • Ключевая coding-оценка пока не независима: harness, промпт, повторы и инструменты меняют таблицу производителя.
  • Решение задач в существующих репозиториях — явный пробел: 67,7 в SWE-bench Pro и смешанные баг-наборы не дают оснований считать это победой.
  • Большой контекст может продлить неверный план: всё равно нужны малые коммиты, тесты и контрольные точки.
  • Качество, скорость и цена образуют треугольник: высокое reasoning тратит выход и квоту; считать по проверенному патчу.
  • Доступ и задержка различаются по регионам: проверить оплату, квоты и доступность там, где работает команда.
  • Открытые веса не решают вопросы железа и лицензии: текстовая модель 2,4T/95B активных уже доступна, но self-hosting требует дата-центра, а лицензия содержит условия для очень крупных продуктов и сервисов.
03

Результаты тестов

Frontend Code Arena — 1668 Elo (#4, ранний)

Сильный человеческий сигнал UI, не полный инженерный рейтинг.

Terminal Bench 2.1 — 86,6 (Alibaba)

Высокий терминальный результат; harness ограничивают прямое сравнение.

SWE-bench Pro — 67,7 (Alibaba)

Достойно, но ниже лучших ремонтов.

PaperBench — 93,0 (Alibaba)

Сигнал планирования, не прямой тест кода.

IFBench — 82,8 (Alibaba)

Хорошее следование подробным критериям приёмки.

04

Вердикт

Qwen3.8-Max заменяет Kimi K3 на #4 в Coding: ранние фронтенд- и терминальные сигналы сочетаются с гораздо лучшей экономикой API. Это сильный кандидат рядом с нынешним агентом для визуальной работы, длинного контекста и экономной итерации. Выше пока не поднимается: поставщицкие результаты, не лидерский SWE-bench Pro и смешанные сообщения о багах требуют прямого сравнения с CI и ревью.

05

Часто задаваемые вопросы