Qwen3.8-Max удобно представить как новый мощный двигатель в хорошо оснащённой мастерской. Двигатель — флагман Alibaba с 2,4 триллиона параметров, из которых на запрос активны 95 миллиардов. Мастерская — Qwen Studio с чатом, Deep Research, изображениями, видео и веб-артефактами. Для обычной задачи мастерская может значить почти столько же, сколько двигатель.
Сразу заметна цена: $2 за вход и $6 за выход на миллион токенов, кеш $0,25. Это даёт место для долгого анализа и второй проверки. Длинное рассуждение всё равно оплачивается как выход, поэтому не каждая задача дёшева. Но более дешёвая попытка позволяет проверять ответ, а не верить первой убедительной формулировке.
Модель рассматривает текст, изображения и видео в контексте до одного миллиона токенов. Стратегия, таблица, макет, скриншот панели и запись сломанного процесса могут лежать на одном столе. Это не идеальная память и не идеальное суждение, но исчезает часть неточных передач между исследованием и визуальной работой.
Результаты многообещающие, но не окончательные. Alibaba заявляет сильные показатели PaperBench, IFBench, OSWorld-Verified и Terminal Bench; ранний срез Frontend Code Arena ставит модель на #4 с 1668 Elo. Особенно интересны конкретные демонстрации автономной работы: по данным Alibaba, за 10–16 дней без надзора модель с пустой папки построила саморазвивающийся harness, сделала 265 коммитов, открыла 127 pull request и завела 151 issue. Компания также описывает конкурс мультимодальных диалогов, где точность выросла с 0,60 до 0,853 за 45 отправок, а также длительные симуляции проектирования чипов и электронной коммерции. Это отчёты Alibaba, не независимое подтверждение, но они хорошо показывают замысел команды: не один ответ, а длинная профессиональная цепочка работы.
Особая осторожность нужна в коде: 67,7 в SWE-bench Pro не выводит модель в лидеры по решению задач в реальных репозиториях, и первые баг-тесты разнятся. Красивый интерфейс и надёжное исправление старого проекта — разные умения. Поэтому Qwen3.8-Max заслуживает #5 как универсальная и экономная альтернатива: проверить его на ограниченной реальной задаче, перепроверить источники и дождаться независимых результатов.
Для повседневного выбора полезнее спросить не «самая ли это умная модель?», а «где сегодня теряется время?». Тот, кто постоянно переносит сведения между PDF, таблицами, скриншотами и короткими записями экрана, может выиграть от одной мультимодальной рабочей поверхности. Тот, чья работа уже живёт в Gmail, Google Docs, Outlook или корпоративной среде с настроенными правами, порой сэкономит больше времени со встроенным там помощником. Экосистема — это не только перечень функций, но и число передач работы между ними.
Демонстрации автономности стоит читать как кейсы, а не как обещание. Двести шестьдесят пять коммитов не доказывают, что каждый из них правильный, безопасный и пригодный для поддержки. Ценность в самом рисунке работы, который показывает Alibaba: разложить цель, применять инструменты, проверять результат и продолжать, не теряя контекста. Команде разумнее начать с небольшого обратимого процесса — исследования с источниками, прототипа или анализа по чек-листу — прежде чем отдавать агенту критическую задачу.
Есть и простое бытовое преимущество семейства Qwen: не обязательно заводить отдельный сервис для каждого шага. Можно начать с исследования, затем рассмотреть скриншот и подготовить черновик или визуальный материал в одном месте. Но удобство не должно превращаться в доверие вслепую: сохраняйте первоисточники, просите проверяемые ссылки и перепроверяйте выводы, от которых зависят деньги, репутация или важное решение.
С 14 августа первые веса Max действительно доступны. Загружаемый checkpoint работает с текстом, имеет нативный контекст 262 144 токена и расширяется примерно до 1,01M; хостируемый Max добавляет зрение, инструменты и миллион по умолчанию. 2,4T общих параметров всё равно требуют дата-центра, а коммерческие пороги лицензии нужно проверить до развёртывания.