Qwen3.8-Max ressemble à un moteur neuf et puissant installé dans un atelier déjà bien fourni. Le moteur est le modèle phare d’Alibaba : 2,4 billions de paramètres au total, dont 95 milliards actifs par requête. L’atelier est Qwen Studio, avec chat, Deep Research, image, vidéo et artefacts web. Pour une tâche ordinaire, l’atelier compte presque autant que le moteur.
Son attrait immédiat est le prix. $2 en entrée et $6 en sortie par million de tokens, cache à $0,25, laissent de la place pour une analyse longue et une seconde vérification. Le raisonnement long reste facturé en sortie ; tout n’est donc pas bon marché. Mais un essai moins coûteux aide à vérifier une réponse au lieu de croire la première phrase convaincante.
Le modèle regarde texte, images et vidéo avec jusqu’à un million de tokens de contexte. Document de stratégie, tableur, maquette, capture de tableau de bord et vidéo d’un parcours défaillant peuvent rester sur la même table. Ce n’est ni une mémoire parfaite ni un jugement parfait, mais cela évite des passages imprécis entre recherche et travail visuel.
Les résultats sont prometteurs, pas définitifs. Alibaba annonce de très bons scores sur PaperBench, IFBench, OSWorld-Verified et Terminal Bench ; le premier aperçu Frontend Code Arena le place #4 à 1668 Elo. Les démonstrations concrètes d’autonomie sont particulièrement intéressantes : selon Alibaba, le modèle a travaillé 10 à 16 jours sans supervision depuis un dossier vide, construit un harness auto-évolutif et produit 265 commits, 127 pull requests et 151 issues. L’entreprise décrit aussi un défi de dialogue multimodal où la précision est passée de 0,60 à 0,853 en 45 soumissions, ainsi que de longues simulations de conception de puces et de commerce électronique. Ce sont des rapports Alibaba, non une validation indépendante, mais ils donnent une image parlante de l’objectif : une longue chaîne de travail professionnel, pas seulement une bonne réponse.
La prudence est maximale en code : 67,7 à SWE-bench Pro ne place pas le modèle parmi les leaders pour résoudre des problèmes dans de vrais dépôts, et les premiers tests de bugs sont mixtes. Construire une interface séduisante et réparer un ancien projet sont deux compétences différentes. Qwen3.8-Max mérite le #5 comme alternative polyvalente et économique : l’essayer sur une tâche réelle et bornée, contrôler les sources et laisser les résultats indépendants décider s’il devient l’outil par défaut.
Pour le choix quotidien, une autre question est plus utile que « est-ce le modèle le plus intelligent ? » : où le travail se perd-il aujourd’hui ? Une personne qui recopie sans cesse des éléments entre PDF, tableurs, captures et enregistrements d’écran peut gagner avec une même surface multimodale. Celle qui travaille déjà dans Gmail, Google Docs, Outlook ou un environnement d’entreprise aux permissions établies gagnera parfois davantage avec l’assistant déjà présent. Un écosystème n’est pas seulement une liste de fonctions : c’est aussi le nombre de passages de relais qu’il évite.
Les démonstrations d’autonomie doivent être lues comme des études de cas, pas comme une promesse. Deux cent soixante-cinq commits n’établissent pas que chacun est juste, sûr et maintenable. L’intérêt est la forme de travail qu’Alibaba cherche à montrer : découper un but, employer des outils, vérifier les résultats et poursuivre sans perdre le fil. Pour une équipe, le bon essai est un processus petit et réversible—recherche sourcée, prototype ou analyse avec une liste de contrôle—avant de confier une tâche critique.
Depuis le 14 août, les premiers poids Max sont réellement disponibles. Le checkpoint téléchargeable est textuel, utilise 262 144 tokens nativement et peut s’étendre à environ 1,01M ; Max hébergé ajoute vision, outils et 1M par défaut. Les 2,4T paramètres totaux exigent toujours un datacenter, et les seuils commerciaux de la licence doivent être vérifiés avant déploiement.