Imaginez que vous choisissez un atelier, pas un simple marteau. Un modèle local doit passer la porte, laisser de la place sur l’établi, comprendre le matériau et utiliser les outils sans expédier les données privées ailleurs. Qwen3.8-27B est convaincant parce que ces contraintes se rejoignent dans un checkpoint. Ce modèle dense vision-langage de 27 milliards de paramètres repose sur la fondation hybride de Qwen3.5 : trois couches Gated DeltaNet puis une couche d’attention complète se répètent. L’attention linéaire améliore l’efficacité ; l’attention complète périodique relie encore les détails éloignés.
Le mot « multimodal » compte ici. Ce n’est pas un modèle de texte auquel on aurait ajouté un bouton décoratif pour téléverser une image. Qwen l’entraîne et le distribue comme un modèle image-texte vers texte, avec entrées natives pour les images et la vidéo. Un agent de code local peut examiner une capture d’écran, lire une boîte de dialogue d’erreur, la comparer aux fichiers sources et utiliser des outils sans commencer par expédier l’image à un service de vision cloud distinct. La fiche du modèle décrit aussi des tâches portant sur les documents, les graphiques, le navigateur, le mobile et des vidéos longues d’une heure. Qwen3.8-27B ressemble ainsi davantage à un établi privé polyvalent qu’à un moteur spécialisé dans l’autocomplétion.
Les chiffres de lancement expliquent l’enthousiasme. Qwen annonce 61,7 sur SWE-bench Pro, 73,0 sur Terminal Bench 2.1, 42,2 sur DeepSWE 1.1 et 90,3 sur LiveCodeBench v6. Pour les agents multimodaux, il annonce 84,3 sur OSWorld-Verified, 64,8 sur WebArena-Verified et 70,7 sur CoWorkBench. Face à Qwen3.6-27B, les gains apparaissent dans la réparation de dépôts, le terminal, le travail de bureau et l’utilisation d’ordinateur, plutôt que dans un examen opportunément choisi. Cette largeur est plus intéressante qu’un chiffre isolé.
Les premières mesures extérieures vont désormais dans la même direction générale. Artificial Analysis attribue à la configuration xhigh 52 à son Intelligence Index et 51 à son Agentic Index ; ce dernier dépasse de peu le résultat historique d’Opus 4.8 en effort max dans l’instantané cité. Dans le classement Image-to-WebDev d’Arena, Qwen3.8-27B était #7 avec un score de 1574 et 1 686 votes le 25 août, avec une plage de classement fondée sur la confiance allant de la cinquième à la dixième place. Qu’un modèle téléchargeable de 27B se mêle statistiquement à des systèmes cloud de pointe sur la transformation d’une capture en interface est remarquable. Ces essais ne reproduisent pas la configuration locale exacte de Qwen, mais ils apportent une preuve indépendante que le tableau de lancement ne décrivait pas un mirage.
Mais un benchmark est un appareil de laboratoire, pas une loi naturelle. Les résultats SWE-bench Pro et DeepSWE de Qwen utilisent le harness Claude Code, un contexte long et des réglages d’échantillonnage déclarés. Qwen a aussi corrigé des tâches problématiques de SWE-bench Pro et réévalué les baselines. CoWorkBench et QwenSWEBench sont des tests internes. MathVision emploie un prompt fixe et des annotations corrigées ; certains essais d’agents visuels reposent sur des graders ou scaffolds particuliers. Rien de cela ne rend les résultats inutiles. Cela nous dit ce qui a été mesuré : Qwen3.8 dans un système choisi avec soin. Ollama, LM Studio, llama.cpp ou un agent maison peuvent produire un autre résultat.
Le récit matériel demande la même honnêteté. Les shards de poids BF16 officiels totalisent environ 55,6 Go avant l’overhead du moteur. Le fichier Q4_K_M d’Unsloth pèse environ 17,1 Go, et le projecteur visuel ajoute environ 0,93 Go. Un téléchargement de 18 Go peut donc tenir sur un GPU de 24 Go, mais les six gigaoctets restants ne sont pas un luxe inutilisé : ils doivent accueillir les tampons et le cache KV qui mémorise les tokens précédents. Plus le contexte s’allonge, plus il consomme de mémoire. Une carte de 24 Go est un point de départ crédible pour un travail local utile, pas la promesse de 262 144 tokens à vitesse maximale et pleine précision de cache.
Qwen donne aux opérateurs des commandes exceptionnellement complètes. La fenêtre native atteint 262 144 tokens, et la fiche du modèle documente une extension YaRN vers un million dans vLLM, SGLang et TokenSpeed. Le raisonnement est actif par défaut, avec les niveaux d’effort low, medium et xhigh, tandis que preserve_thinking peut conserver le contexte de raisonnement au fil d’une conversation d’agent. Qwen a également entraîné une tête de prédiction multi-token, que les systèmes d’inférence compatibles peuvent employer pour accélérer le décodage.
Le réglage d’usine est mauvais pour beaucoup de tâches ordinaires. Qwen utilise xhigh par défaut, et Artificial Analysis a enregistré 160 millions de tokens de sortie sur son indice, contre une médiane de 43 millions pour des modèles ouverts comparables. Dans l’essai local de Simon Willison, un simple SVG de pélican a consommé 22 276 tokens de raisonnement et 21 minutes ; la désactivation de la réflexion a ramené l’exécution à 137 secondes. Ce n’est pas une régression de qualité, mais une leçon d’exploitation : commencez par un effort low ou medium — voire sans réflexion pour les transformations simples — et ne promouvez une tâche vers xhigh que si cette recherche supplémentaire vaut l’attente. YaRN statique, l’échantillonnage et la conservation de l’état de raisonnement exigent la même attention.
Le bon premier essai doit être volontairement banal. Chargez le quant que vous pouvez garder en mémoire, choisissez une fenêtre de contexte qui laisse de la marge, puis confiez à Qwen une tâche réelle avec une ligne d’arrivée visible : réparer un test qui échoue, extraire des chiffres d’un rapport privé ou reproduire une interface à partir d’une capture. Notez si la tâche s’est achevée, combien de reprises elle a demandées, sa vitesse et la quantité de corrections humaines restantes. Exécutez ensuite Qwen3.6 ou votre modèle actuel dans les mêmes conditions. Cette expérience mesure votre atelier, pas le laboratoire de quelqu’un d’autre.
Pour l’instant, Qwen3.8-27B est le meilleur choix par défaut au croisement de la confidentialité, des capacités, du multimodal et du matériel accessible. De plus grands modèles ouverts peuvent être plus intelligents dans des domaines étroits ou difficiles, et de plus petits peuvent être plus rapides. Qwen occupe le milieu utile : assez puissant pour un travail sérieux, assez petit pour vivre sous un bureau et assez ouvert pour que ce bureau puisse vous appartenir entièrement.