Classé #1 IA locale / privée — Votre cerveau, votre machine, vos règles
Alibaba (Qwen Team)

Qwen3.8-27B

Qwen3.8-27B est l'un des rares modèles locaux dont les compromis correspondent au matériel que les gens possèdent réellement : un checkpoint dense de 27B pour le texte, les images, la vidéo, le code et les agents utilisant des outils. Une version 4 bits tient sur un GPU de classe 24 Go, tandis que la licence Apache 2.0 permet de garder le travail privé et de l'utiliser commercialement.

Mis à jour 26 août 2026 Open WeightsApache 2.027B Dense
9.2sur 10
Site officiel
Idéal pour

Qwen3.8-27B est l'un des rares modèles locaux dont les compromis correspondent au matériel que les gens possèdent réellement : un checkpoint dense de 27B pour le texte, les images, la vidéo, le code et les agents utilisant des outils. Une version 4 bits tient sur un GPU de classe 24 Go, tandis que la licence Apache 2.0 permet de garder le travail privé et de l'utiliser commercialement.

Pourquoi ça Gagne

Les essais indépendants donnent désormais un véritable appui au récit du lancement : Qwen3.8-27B obtient 52 à l'Artificial Analysis Intelligence Index et 51 à son Agentic Index, tandis que le classement Image-to-WebDev d'Arena le place #7 parmi des systèmes de pointe bien plus grands. Les scores de Qwen en code et en utilisation d'ordinateur restent solides, et le modèle réunit un contexte de 262K, un raisonnement réglable, la vision et la vidéo natives, ainsi qu'une licence Apache 2.0.

À surveiller

Les composites indépendants confortent les capacités générales et agentiques du modèle, mais la plupart des scores précis en code et en utilisation d'ordinateur proviennent encore des propres bancs d'essai de Qwen. Le réglage de raisonnement xhigh par défaut peut devenir péniblement lent et bavard sur du matériel local ; commencez par low ou medium, ou désactivez la réflexion pour le travail interactif ordinaire. La quantification Q4 et les limites du cache KV séparent toujours un téléchargement de 18 Go d'un usage pratique avec 262K de contexte.

01

Ce que c'est réellement

Imaginez que vous choisissez un atelier, pas un simple marteau. Un modèle local doit passer la porte, laisser de la place sur l’établi, comprendre le matériau et utiliser les outils sans expédier les données privées ailleurs. Qwen3.8-27B est convaincant parce que ces contraintes se rejoignent dans un checkpoint. Ce modèle dense vision-langage de 27 milliards de paramètres repose sur la fondation hybride de Qwen3.5 : trois couches Gated DeltaNet puis une couche d’attention complète se répètent. L’attention linéaire améliore l’efficacité ; l’attention complète périodique relie encore les détails éloignés.

Le mot « multimodal » compte ici. Ce n’est pas un modèle de texte auquel on aurait ajouté un bouton décoratif pour téléverser une image. Qwen l’entraîne et le distribue comme un modèle image-texte vers texte, avec entrées natives pour les images et la vidéo. Un agent de code local peut examiner une capture d’écran, lire une boîte de dialogue d’erreur, la comparer aux fichiers sources et utiliser des outils sans commencer par expédier l’image à un service de vision cloud distinct. La fiche du modèle décrit aussi des tâches portant sur les documents, les graphiques, le navigateur, le mobile et des vidéos longues d’une heure. Qwen3.8-27B ressemble ainsi davantage à un établi privé polyvalent qu’à un moteur spécialisé dans l’autocomplétion.

Les chiffres de lancement expliquent l’enthousiasme. Qwen annonce 61,7 sur SWE-bench Pro, 73,0 sur Terminal Bench 2.1, 42,2 sur DeepSWE 1.1 et 90,3 sur LiveCodeBench v6. Pour les agents multimodaux, il annonce 84,3 sur OSWorld-Verified, 64,8 sur WebArena-Verified et 70,7 sur CoWorkBench. Face à Qwen3.6-27B, les gains apparaissent dans la réparation de dépôts, le terminal, le travail de bureau et l’utilisation d’ordinateur, plutôt que dans un examen opportunément choisi. Cette largeur est plus intéressante qu’un chiffre isolé.

Les premières mesures extérieures vont désormais dans la même direction générale. Artificial Analysis attribue à la configuration xhigh 52 à son Intelligence Index et 51 à son Agentic Index ; ce dernier dépasse de peu le résultat historique d’Opus 4.8 en effort max dans l’instantané cité. Dans le classement Image-to-WebDev d’Arena, Qwen3.8-27B était #7 avec un score de 1574 et 1 686 votes le 25 août, avec une plage de classement fondée sur la confiance allant de la cinquième à la dixième place. Qu’un modèle téléchargeable de 27B se mêle statistiquement à des systèmes cloud de pointe sur la transformation d’une capture en interface est remarquable. Ces essais ne reproduisent pas la configuration locale exacte de Qwen, mais ils apportent une preuve indépendante que le tableau de lancement ne décrivait pas un mirage.

Mais un benchmark est un appareil de laboratoire, pas une loi naturelle. Les résultats SWE-bench Pro et DeepSWE de Qwen utilisent le harness Claude Code, un contexte long et des réglages d’échantillonnage déclarés. Qwen a aussi corrigé des tâches problématiques de SWE-bench Pro et réévalué les baselines. CoWorkBench et QwenSWEBench sont des tests internes. MathVision emploie un prompt fixe et des annotations corrigées ; certains essais d’agents visuels reposent sur des graders ou scaffolds particuliers. Rien de cela ne rend les résultats inutiles. Cela nous dit ce qui a été mesuré : Qwen3.8 dans un système choisi avec soin. Ollama, LM Studio, llama.cpp ou un agent maison peuvent produire un autre résultat.

Le récit matériel demande la même honnêteté. Les shards de poids BF16 officiels totalisent environ 55,6 Go avant l’overhead du moteur. Le fichier Q4_K_M d’Unsloth pèse environ 17,1 Go, et le projecteur visuel ajoute environ 0,93 Go. Un téléchargement de 18 Go peut donc tenir sur un GPU de 24 Go, mais les six gigaoctets restants ne sont pas un luxe inutilisé : ils doivent accueillir les tampons et le cache KV qui mémorise les tokens précédents. Plus le contexte s’allonge, plus il consomme de mémoire. Une carte de 24 Go est un point de départ crédible pour un travail local utile, pas la promesse de 262 144 tokens à vitesse maximale et pleine précision de cache.

Qwen donne aux opérateurs des commandes exceptionnellement complètes. La fenêtre native atteint 262 144 tokens, et la fiche du modèle documente une extension YaRN vers un million dans vLLM, SGLang et TokenSpeed. Le raisonnement est actif par défaut, avec les niveaux d’effort low, medium et xhigh, tandis que preserve_thinking peut conserver le contexte de raisonnement au fil d’une conversation d’agent. Qwen a également entraîné une tête de prédiction multi-token, que les systèmes d’inférence compatibles peuvent employer pour accélérer le décodage.

Le réglage d’usine est mauvais pour beaucoup de tâches ordinaires. Qwen utilise xhigh par défaut, et Artificial Analysis a enregistré 160 millions de tokens de sortie sur son indice, contre une médiane de 43 millions pour des modèles ouverts comparables. Dans l’essai local de Simon Willison, un simple SVG de pélican a consommé 22 276 tokens de raisonnement et 21 minutes ; la désactivation de la réflexion a ramené l’exécution à 137 secondes. Ce n’est pas une régression de qualité, mais une leçon d’exploitation : commencez par un effort low ou medium — voire sans réflexion pour les transformations simples — et ne promouvez une tâche vers xhigh que si cette recherche supplémentaire vaut l’attente. YaRN statique, l’échantillonnage et la conservation de l’état de raisonnement exigent la même attention.

Le bon premier essai doit être volontairement banal. Chargez le quant que vous pouvez garder en mémoire, choisissez une fenêtre de contexte qui laisse de la marge, puis confiez à Qwen une tâche réelle avec une ligne d’arrivée visible : réparer un test qui échoue, extraire des chiffres d’un rapport privé ou reproduire une interface à partir d’une capture. Notez si la tâche s’est achevée, combien de reprises elle a demandées, sa vitesse et la quantité de corrections humaines restantes. Exécutez ensuite Qwen3.6 ou votre modèle actuel dans les mêmes conditions. Cette expérience mesure votre atelier, pas le laboratoire de quelqu’un d’autre.

Pour l’instant, Qwen3.8-27B est le meilleur choix par défaut au croisement de la confidentialité, des capacités, du multimodal et du matériel accessible. De plus grands modèles ouverts peuvent être plus intelligents dans des domaines étroits ou difficiles, et de plus petits peuvent être plus rapides. Qwen occupe le milieu utile : assez puissant pour un travail sérieux, assez petit pour vivre sous un bureau et assez ouvert pour que ce bureau puisse vous appartenir entièrement.

02

Forces et limites honnêtes

Points Forts

  • Un agent local multimodal réellement pratique : Le même checkpoint lit textes, captures d’écran, schémas, documents et vidéos, puis peut raisonner et appeler des outils. Nul besoin de faire transiter un flux privé par des modèles séparés de vision et de code simplement pour examiner un bug d’interface ou extraire un tableau avant de modifier du code.
  • Les gains du lancement disposent maintenant d’un appui indépendant : Dans les essais de Qwen, Qwen3.8-27B passe des 53,5 de Qwen3.6-27B à 61,7 sur SWE-bench Pro, de 63,4 à 73,0 sur Terminal Bench 2.1, et de 13,3 à 42,2 sur DeepSWE 1.1. De son côté, Artificial Analysis lui attribue 52 à l’Intelligence Index et 51 à l’Agentic Index, des résultats inhabituellement élevés pour un modèle ouvert de 27B.
  • La taille de 27B est utile, pas seulement réduite : Les poids Q4_K_M d’Unsloth occupent environ 17,1 Go et le projecteur visuel environ 0,93 Go. Un GPU de 24 Go ou une machine Apple Silicon correctement équipée peut donc héberger le modèle de façon réaliste, avec une marge qui dépend du moteur, de la précision du cache et de la longueur de contexte.
  • Le contexte long et les commandes de réflexion sont exceptionnellement complets : Le contexte natif est de 262 144 tokens ; Qwen documente une extension YaRN jusqu’à 1M pour vLLM, SGLang et TokenSpeed. La réflexion peut être désactivée, réglée sur low, medium ou xhigh, et préservée entre les tours de longues boucles d’agent. Ces possibilités comptent, car xhigh est le réglage par défaut, pas le point de départ raisonnable pour chaque tâche.
  • Licence ouverte et écosystème de déploiement rapide : Le checkpoint officiel est sous Apache 2.0. Qwen documente la prise en charge de vLLM, SGLang et TokenSpeed ; Ollama liste déjà une version qwen3.8:27b de 18 Go, et Unsloth publie des quantifications GGUF d’environ 9 Go à 31,5 Go.

Limites Honnêtes

  • La confirmation indépendante est générale, pas une reproduction de chaque affirmation : Artificial Analysis et Arena confortent désormais le récit sur l’intelligence générale, les agents et le code visuel. Qwen a encore réalisé la plupart des comparaisons phares, mêlant tests publics et QwenSWEBench, CoWorkBench et RecreationBench internes. SWE-bench Pro et DeepSWE utilisent un harness Claude Code : ils mesurent un système associant modèle et scaffold, pas les seuls poids dans chaque application locale.
  • Vingt-quatre gigaoctets ne donnent pas accès à tout le contexte de 262K : Les poids du modèle ne sont que la première valise. Le projecteur visuel, les tampons du moteur et le cache KV qui grossit prennent eux aussi de la mémoire. Une carte de 24 Go peut exécuter une version 4 bits, mais les très longs prompts exigent un cache réduit ou quantifié, un offload CPU partiel ou davantage de mémoire.
  • La quantification change ce qui est mesuré : Le tableau de benchmarks de Qwen n’établit pas que chaque GGUF 4 bits conserve exactement la même qualité de raisonnement, de vision et d’utilisation des outils. L’écart peut être faible ou propre à une tâche, mais un choix de production doit être testé avec le quant et le réglage de contexte précisément prévus.
  • Le réglage par défaut peut transformer un travail rapide en longue méditation : Qwen utilise xhigh par défaut. Le simple test SVG de Simon Willison a demandé 21 minutes et 22 276 tokens de raisonnement, contre 137 secondes avec la réflexion désactivée. Commencez par un effort low ou medium pour le travail interactif, réservez xhigh aux tâches réellement difficiles, et souvenez-vous que les réglages d’échantillonnage, les schémas d’outils, les templates de chat et YaRN statique influencent aussi le résultat.
03

Aperçu des Benchmarks

Réparation de dépôts — SWE-bench Pro : 61,7

Qwen annonce 61,7 contre 53,5 pour Qwen3.6-27B. Les modèles ont été évalués avec le harness Claude Code, une température de 1,0, un top-p de 0,95, un contexte de 256K et un jeu affiné où des tâches problématiques ont été corrigées.

Agent terminal — Terminal Bench 2.1 : 73,0

Soit 9,6 points de plus que Qwen3.6-27B dans le tableau de Qwen. C'est un signal fort pour le travail en ligne de commande en plusieurs étapes, même si vitesse et réussite locales dépendent toujours du scaffold de l'agent et des outils disponibles.

Utilisation d'ordinateur — OSWorld-Verified : 84,3

La plus grande surprise pratique : ce checkpoint ouvert et compact dépasse tous les comparateurs du tableau de Qwen, dont Opus 4.6 Max à 72,7. Une reproduction indépendante est particulièrement importante, car les résultats d'utilisation d'ordinateur sont sensibles au harness qui entoure le modèle.

Empreinte locale — Q4_K_M plus projecteur visuel : environ 18 Go

Les métadonnées du dépôt indiquent un GGUF Q4_K_M de 17,1 Go et un projecteur visuel BF16 d'environ 0,93 Go. Les fichiers tiennent donc sur du matériel de classe 24 Go, tandis que la mémoire restante détermine le contexte utilisable et la concurrence.

Composite indépendant — Artificial Analysis Intelligence Index : 52

La configuration xhigh obtient 52, à égalité avec GPT-5.6 Luna en effort max dans l'instantané cité, et se classe première dans la catégorie des modèles ouverts de 4B à 40B d'Artificial Analysis. Elle a produit 160 millions de tokens de sortie sur l'ensemble de l'indice, contre une médiane de 43 millions : le résultat documente donc aussi une verbosité exceptionnelle.

Code visuel — Arena Image-to-WebDev : #7, score 1574

Le 25 août, le modèle 27B occupait la septième place parmi 44 systèmes avec 1 686 votes et une plage de classement de 5 à 10, se mêlant statistiquement à des modèles bien plus grands et coûteux. Arena fournit des préférences plutôt qu'un benchmark contrôlé sur un quant local, mais étaye indépendamment la force pratique du modèle en vision et en code.

04

Le Verdict

Qwen3.8-27B reste notre recommandation #1 en IA locale / privée parce qu’il offre l’ensemble le plus utile pour un particulier : solides capacités de code et d’agent, vision et vidéo natives, longue fenêtre de contexte, liberté d’Apache 2.0 et empreinte quantifiée pouvant tenir sur un seul GPU grand public haut de gamme. Artificial Analysis et Arena rendent désormais ce classement moins dépendant des tableaux de lancement de Qwen. Il ne bat pas chaque modèle plus grand, et des essais indépendants par API ne prouvent pas que toutes les versions Q4 locales se comportent de façon identique. Considérez le score de 9,2 comme une recommandation forte mais sensible à la configuration : commencez sous xhigh, testez précisément le quant, les outils et le contexte que vous déploierez, et conservez une revue humaine pour les actions lourdes de conséquences.

05

Foire aux questions