Qwen3.8-Max est plus facile à comprendre comme un nouveau moteur puissant garé dans un atelier très fréquenté. Le moteur est le modèle phare d’Alibaba : une conception « Sparse Mixture-of-Experts » avec 2,4 billions de paramètres au total et 95 milliards d’actifs sur une requête. L’atelier est Qwen Studio, où ce moteur côtoie le chat, la Recherche Profonde (Deep Research), la génération d’images, la génération de vidéos et des outils de création d’artefacts web. Pour un utilisateur ordinaire, l’atelier peut compter tout autant que le moteur.
L’attrait pratique immédiat réside dans sa valeur. Le tarif affiché par QwenCloud est de 2 $ par million de tokens d’entrée et de 6 $ par million de tokens de sortie, avec une entrée en cache à 0,25 $. Cela ne rend pas chaque tâche bon marché — les raisonnements longs sont facturés comme des sorties — mais cela rend les analyses à grand contexte et les expérimentations répétées beaucoup plus faciles à justifier que les tarifs premium des leaders absolus. Si Kimi K3 était le modèle polyvalent et capable qui nécessitait un budget attentif, Qwen3.8-Max est l’alternative tout aussi ambitieuse qui laisse plus de place dans le budget pour une deuxième tentative et une révision adéquate.
Il est également conçu pour examiner le problème, et non pas seulement pour en lire la description. Le modèle accepte le texte, les images et la vidéo avec jusqu’à un million de tokens de contexte. Imaginez que vous examiniez le lancement d’un produit avec son document stratégique, sa feuille de calcul, sa maquette, la capture d’écran de son tableau de bord et l’enregistrement d’un flux de travail défectueux, le tout sur le même bureau. Cela ne donne pas par magie au modèle une mémoire ou un jugement parfaits, mais cela élimine plusieurs des étapes de traduction laborieuses qui séparent généralement la recherche du travail visuel.
L’histoire de la famille de produits est inhabituellement utile pour le travail quotidien. Qwen Studio propose le chat, la Recherche Profonde, la génération d’images, la génération de vidéos et des artefacts de développement. Le checkpoint téléchargeable n’est pas identique à ce produit hébergé : il est uniquement textuel, utilise nativement un contexte de 262K et peut s’étendre à environ 1,01M ; le modèle Max hébergé ajoute la vision, la prise en charge d’un mode sans réflexion, des outils intégrés et un contexte par défaut de 1M. Cette distinction évite qu’une fonctionnalité annoncée sur la carte du modèle ne devienne une mauvaise surprise lors du déploiement.
La version ouverte promise est désormais une réalité. Qwen3.8-2.4T-A95B est téléchargeable sur Hugging Face et ModelScope, avec 512 experts dont 10 assignés plus un expert partagé actif par token. Ce n’est toujours pas un modèle pour un ordinateur portable : le stockage et l’exécution de 2,4 billions de paramètres relèvent d’un projet à l’échelle d’un centre de données. La licence personnalisée est large pour un usage ordinaire, mais les très gros produits doivent afficher le nom du modèle, et les grandes entreprises de services de modèles ou d’assistants de programmation/bureautique peuvent avoir besoin d’une licence commerciale distincte.
L’histoire des performances est prometteuse, mais pas complète. Alibaba fait état d’excellents résultats sur PaperBench, IFBench, OSWorld-Verified, Terminal Bench 2.1, ainsi que dans un vaste tableau multimodal. Dans le premier aperçu de Frontend Code Arena, Qwen3.8-Max se classe n°4 à 1668 Elo. Plus intéressant encore, Alibaba décrit plusieurs démonstrations de travail autonome inhabituellement concrètes : une exécution non surveillée de 10 à 16 jours à partir d’un dossier vide qui a construit un environnement de test auto-évolutif, a effectué 265 commits, ouvert 127 pull requests et consigné 151 issues ; un concours d’intention de dialogue multimodal dont la précision est passée de 0,60 à 0,853 sur 45 soumissions ; et des simulations prolongées de conception de puces et de commerce électronique. Ce sont les propres rapports d’Alibaba, et non une validation indépendante, mais ils donnent une image utile du travail professionnel à plusieurs étapes visé par l’équipe. L’évaluation indépendante doit encore faire le travail lent et un peu rébarbatif qui rend un classement digne de confiance.
Cette prudence est d’autant plus importante en programmation. Le résultat rapporté par Qwen sur Terminal Bench est solide, mais son score de 67,7 sur SWE-bench Pro ne le place pas parmi les leaders de pointe dans la résolution de problèmes sur de vrais dépôts de code. Quelques premiers tests pratiques de correction de bugs sont également mitigés. Un benchmark peut montrer qu’un modèle dispose d’une puissante boîte à outils ; seule une exécution reproductible sur votre dépôt montre s’il se souvient de l’objectif, utilise les bonnes commandes et corrige le bug au lieu d’en écrire un nouveau, magnifiquement expliqué.
Le produit a également ses limites. La disponibilité, les quotas, la facturation et le débit varient selon les régions, tandis que l’auto-hébergement exige une infrastructure sérieuse et un examen des licences. Pour l’instant, Qwen3.8-Max décroche la 6ème place avec un 9,0, juste derrière Grok 4.6. Utilisez-le pour une tâche bien délimitée, vérifiez ses faits et son code, et laissez les résultats indépendants — et non l’enthousiasme de la semaine de lancement — décider s’il deviendra votre modèle par défaut.