Classé #8 Écosystème du quotidien — Les assistants IA leaders
Alibaba / Qwen Team

Qwen3.8-Max

Qwen3.8 existe désormais sous deux formes importantes : le produit hébergé Qwen3.8-Max avec vision, outils intégrés et un contexte par défaut d'un million de tokens, et le premier checkpoint téléchargeable de la gamme Max de Qwen. Le modèle ouvert est un modèle textuel de 2,4T au total et 95B actifs, doté d'un contexte natif de 262K extensible à environ un million de tokens.

Mis à jour 30 août 2026 Multimodal1M ContextDeep Research

Mise à jour du classement Le classement « Écosystème Quotidien » a été revu depuis la dernière mise à jour de cette critique (30 août 2026). Le rang affiché ci-dessus est toujours à jour. N° 1 actuel : Claude Opus 5.5

9.0sur 10
Site officiel
Idéal pour

Qwen3.8 existe désormais sous deux formes importantes : le produit hébergé Qwen3.8-Max avec vision, outils intégrés et un contexte par défaut d'un million de tokens, et le premier checkpoint téléchargeable de la gamme Max de Qwen. Le modèle ouvert est un modèle textuel de 2,4T au total et 95B actifs, doté d'un contexte natif de 262K extensible à environ un million de tokens.

Pourquoi ça Gagne

Qwen3.8-2.4T-A95B est disponible sur Hugging Face et ModelScope, avec une compatibilité officielle vLLM, SGLang et TokenSpeed. Alibaba rapporte 93,0 sur PaperBench et 86,6 sur Terminal Bench 2.1. Le Max hébergé ajoute l'entrée image/vidéo, un mode sans réflexion (non-thinking), des outils intégrés, un contexte par défaut de 1M, et une tarification d'API de 2 $/6 $.

À surveiller

Il s'agit d'une version très récente. L'impressionnant et vaste tableau de benchmarks provient d'Alibaba et non d'un laboratoire indépendant ; les premiers retours indépendants sur la programmation sont mitigés, et l'accès, les quotas et la facturation peuvent s'avérer peu pratiques. Qwen est un écosystème de plus en plus complet, mais son intégration aux services que de nombreux lecteurs utilisent déjà est encore moins fluide que celle de Google, Microsoft ou OpenAI, en particulier en dehors de l'Asie.

01

Ce que c'est réellement

Qwen3.8-Max est plus facile à comprendre comme un nouveau moteur puissant garé dans un atelier très fréquenté. Le moteur est le modèle phare d’Alibaba : une conception « Sparse Mixture-of-Experts » avec 2,4 billions de paramètres au total et 95 milliards d’actifs sur une requête. L’atelier est Qwen Studio, où ce moteur côtoie le chat, la Recherche Profonde (Deep Research), la génération d’images, la génération de vidéos et des outils de création d’artefacts web. Pour un utilisateur ordinaire, l’atelier peut compter tout autant que le moteur.

L’attrait pratique immédiat réside dans sa valeur. Le tarif affiché par QwenCloud est de 2 $ par million de tokens d’entrée et de 6 $ par million de tokens de sortie, avec une entrée en cache à 0,25 $. Cela ne rend pas chaque tâche bon marché — les raisonnements longs sont facturés comme des sorties — mais cela rend les analyses à grand contexte et les expérimentations répétées beaucoup plus faciles à justifier que les tarifs premium des leaders absolus. Si Kimi K3 était le modèle polyvalent et capable qui nécessitait un budget attentif, Qwen3.8-Max est l’alternative tout aussi ambitieuse qui laisse plus de place dans le budget pour une deuxième tentative et une révision adéquate.

Il est également conçu pour examiner le problème, et non pas seulement pour en lire la description. Le modèle accepte le texte, les images et la vidéo avec jusqu’à un million de tokens de contexte. Imaginez que vous examiniez le lancement d’un produit avec son document stratégique, sa feuille de calcul, sa maquette, la capture d’écran de son tableau de bord et l’enregistrement d’un flux de travail défectueux, le tout sur le même bureau. Cela ne donne pas par magie au modèle une mémoire ou un jugement parfaits, mais cela élimine plusieurs des étapes de traduction laborieuses qui séparent généralement la recherche du travail visuel.

L’histoire de la famille de produits est inhabituellement utile pour le travail quotidien. Qwen Studio propose le chat, la Recherche Profonde, la génération d’images, la génération de vidéos et des artefacts de développement. Le checkpoint téléchargeable n’est pas identique à ce produit hébergé : il est uniquement textuel, utilise nativement un contexte de 262K et peut s’étendre à environ 1,01M ; le modèle Max hébergé ajoute la vision, la prise en charge d’un mode sans réflexion, des outils intégrés et un contexte par défaut de 1M. Cette distinction évite qu’une fonctionnalité annoncée sur la carte du modèle ne devienne une mauvaise surprise lors du déploiement.

La version ouverte promise est désormais une réalité. Qwen3.8-2.4T-A95B est téléchargeable sur Hugging Face et ModelScope, avec 512 experts dont 10 assignés plus un expert partagé actif par token. Ce n’est toujours pas un modèle pour un ordinateur portable : le stockage et l’exécution de 2,4 billions de paramètres relèvent d’un projet à l’échelle d’un centre de données. La licence personnalisée est large pour un usage ordinaire, mais les très gros produits doivent afficher le nom du modèle, et les grandes entreprises de services de modèles ou d’assistants de programmation/bureautique peuvent avoir besoin d’une licence commerciale distincte.

L’histoire des performances est prometteuse, mais pas complète. Alibaba fait état d’excellents résultats sur PaperBench, IFBench, OSWorld-Verified, Terminal Bench 2.1, ainsi que dans un vaste tableau multimodal. Dans le premier aperçu de Frontend Code Arena, Qwen3.8-Max se classe n°4 à 1668 Elo. Plus intéressant encore, Alibaba décrit plusieurs démonstrations de travail autonome inhabituellement concrètes : une exécution non surveillée de 10 à 16 jours à partir d’un dossier vide qui a construit un environnement de test auto-évolutif, a effectué 265 commits, ouvert 127 pull requests et consigné 151 issues ; un concours d’intention de dialogue multimodal dont la précision est passée de 0,60 à 0,853 sur 45 soumissions ; et des simulations prolongées de conception de puces et de commerce électronique. Ce sont les propres rapports d’Alibaba, et non une validation indépendante, mais ils donnent une image utile du travail professionnel à plusieurs étapes visé par l’équipe. L’évaluation indépendante doit encore faire le travail lent et un peu rébarbatif qui rend un classement digne de confiance.

Cette prudence est d’autant plus importante en programmation. Le résultat rapporté par Qwen sur Terminal Bench est solide, mais son score de 67,7 sur SWE-bench Pro ne le place pas parmi les leaders de pointe dans la résolution de problèmes sur de vrais dépôts de code. Quelques premiers tests pratiques de correction de bugs sont également mitigés. Un benchmark peut montrer qu’un modèle dispose d’une puissante boîte à outils ; seule une exécution reproductible sur votre dépôt montre s’il se souvient de l’objectif, utilise les bonnes commandes et corrige le bug au lieu d’en écrire un nouveau, magnifiquement expliqué.

Le produit a également ses limites. La disponibilité, les quotas, la facturation et le débit varient selon les régions, tandis que l’auto-hébergement exige une infrastructure sérieuse et un examen des licences. Pour l’instant, Qwen3.8-Max décroche la 6ème place avec un 9,0, juste derrière Grok 4.6. Utilisez-le pour une tâche bien délimitée, vérifiez ses faits et son code, et laissez les résultats indépendants — et non l’enthousiasme de la semaine de lancement — décider s’il deviendra votre modèle par défaut.

02

Forces et limites honnêtes

Points Forts

  • Beaucoup de capacités phares pour le prix de l’API : QwenCloud affiche 2 $ par million de tokens d’entrée et 6 $ par million de tokens de sortie, avec une entrée en cache à 0,25 $. C’est environ la moitié du prix de sortie de Kimi K3 dans le classement précédent et bien en dessous des tarifs les plus élevés de Claude, ce qui rend l’expérimentation sérieuse beaucoup moins douloureuse.
  • Il peut examiner plus que du texte : Qwen3.8-Max prend en charge nativement le texte, les images et la vidéo et dispose d’une fenêtre de contexte d’un million de tokens. Un long rapport, une capture d’écran de l’interface utilisateur, un graphique et un court enregistrement d’écran peuvent donc faire partie d’une seule et même investigation au lieu de transferts séparés entraînant des pertes d’informations.
  • La famille Qwen offre aux utilisateurs ordinaires plus qu’un simple chatbot : Qwen Studio combine le chat avec la Recherche Profonde (Deep Research), les artefacts de développement web, la génération d’images et de vidéos, et est disponible sur le web ainsi que sur les principales plateformes de bureau et mobiles. Ces outils de médias génératifs sont des produits de la famille ; ne confondez pas cela avec une affirmation selon laquelle le modèle Max produit à lui seul toutes ces sorties.
  • Les démonstrations de travail autonome sont inhabituellement concrètes : Alibaba affirme que Qwen3.8-Max a fonctionné sans surveillance pendant 10 à 16 jours à partir d’un dossier vide, construisant un environnement de test auto-évolutif qui a effectué 265 commits, 127 pull requests et 151 issues. Il fait également état d’un défi d’intention multimodale à 45 soumissions dont la précision est passée de 0,60 à 0,853. Il s’agit de démonstrations du fournisseur, mais elles illustrent le type de flux de travail professionnel soutenu que vise Alibaba.
  • Son premier signal public sur le frontend est véritablement compétitif : L’Arène de Code Frontend (Frontend Code Arena) classe le modèle n°4 à 1668 Elo dans un premier aperçu, avec des résultats particulièrement forts sur les produits de consommation. Ce n’est pas un verdict complet sur la programmation, mais c’est une preuve utile que Qwen peut créer des interfaces que les gens préfèrent.
  • Le niveau Max est enfin téléchargeable : Qwen3.8-2.4T-A95B est disponible sur Hugging Face et ModelScope avec 2,4T de paramètres au total / 95B actifs, un contexte natif de 262 144 tokens et une extension jusqu’à environ 1,01M. vLLM, SGLang et TokenSpeed sont cités comme environnements d’exécution (runtimes) compatibles.

Limites Honnêtes

  • Considérez le grand tableau de benchmarks comme une preuve du fournisseur, non comme une vérité établie : Les chiffres d’Alibaba sont utiles, mais de nombreuses comparaisons utilisent des harnais et des configurations d’agents qui peuvent modifier le résultat. Les suites de tests indépendantes ne sont pas encore tout à fait à jour, de sorte que les affirmations concernant PaperBench et Terminal Bench doivent guider un essai, et non le remplacer.
  • Résoudre des problèmes dans de vrais dépôts de code n’est pas encore une victoire évidente : Alibaba rapporte 67,7 sur SWE-bench Pro, derrière les résultats les plus forts de Claude, et les premiers rapports indépendants de correction de bugs ont été beaucoup plus faibles que le tableau de lancement. Pour un patch de production, faites passer le même problème par Qwen et par votre leader actuel avant de changer de modèle par défaut.
  • L’écosystème est large, mais pas universellement intégré : Qwen Studio dispose d’une famille d’outils attrayante, mais il ne s’intègre pas automatiquement dans Gmail, les fichiers Office, les navigateurs, les calendriers ou les autorisations d’entreprise de la plupart des lecteurs. La portée et la disponibilité des services d’Alibaba peuvent également être plus pratiques en Asie qu’ailleurs.
  • Une fenêtre de contexte de 1M est une capacité, pas une mémoire parfaite : Elle peut contenir une énorme quantité de matériel, mais des pages non pertinentes, des objectifs vagues et des faits noyés au milieu peuvent toujours induire le modèle en erreur. Divisez les grands projets en points de contrôle et gardez les documents sources disponibles pour vérification.
  • L’accès anticipé peut être un peu compliqué : Les testeurs ont signalé des frictions concernant les quotas, la facturation et le débit, tandis que le paramètre de raisonnement élevé du modèle peut consommer une quantité substantielle de tokens de sortie. Commencez par une tâche bien délimitée et suivez le coût d’un résultat final vérifié, et pas seulement le tarif des tokens annoncé.
  • Ouvert ne signifie pas sans effort ou sans restriction : Un checkpoint de 2,4T relève de l’échelle d’un centre de données, même avec 95B actifs par token. La licence personnalisée exige que le nom du modèle soit affiché au-delà de 100 millions d’utilisateurs mensuels ou 20 millions de dollars de revenus mensuels, et une licence distincte est requise pour les grandes entreprises de services de modèles ou d’assistants de travail en IA générant plus de 50 millions de dollars de revenus annuels.
03

Aperçu des Benchmarks

Frontend Code Arena — 1668 Elo (N°4, précoce)

Un signal précoce de préférence humaine pour les travaux frontend terminés. C'est encourageant, mais le classement et le score Elo évolueront à mesure que d'autres comparaisons arriveront.

PaperBench — 93,0 (Rapporté par Alibaba)

Un résultat rapporté par le fournisseur pour un travail complexe de type recherche. Cela soutient l'ambition du modèle, mais n'est pas une garantie indépendante.

IFBench — 82,8 (Rapporté par Alibaba)

Un excellent score de suivi des instructions rapporté par le fournisseur, pertinent lorsqu'une tâche comporte de nombreuses contraintes et étapes.

Terminal Bench 2.1 — 86,6 (Rapporté par Alibaba)

Un résultat élevé pour un agent de terminal, en dessous du score GPT-5.6 Sol cité et au-dessus de plusieurs rivaux dans le tableau d'Alibaba ; les différences dans les environnements d'agents sont importantes ici.

SWE-bench Pro — 67,7 (Rapporté par Alibaba)

Une performance respectable en ingénierie logicielle, mais pas un score leader de la catégorie dans la réparation de dépôts de code.

04

Le Verdict

Qwen3.8-Max se place au 6ème rang avec une note corrigée par formule de 9,0 dans l’Écosystème Quotidien. Grok 4.6 le devance car son 9,5 combine des preuves indépendantes plus solides avec une distribution d’agents prêts à l’emploi plus large. Qwen reste attrayant pour les personnes qui naviguent entre les documents, les entrées visuelles, la recherche, les images, la vidéo et la programmation à un coût d’exploitation moindre. Essayez-le sur une tâche bien délimitée et maintenez les citations, les tests et la vérification humaine dans la boucle.

05

Foire aux questions