Guide classé

IA locale / privée — Votre cerveau, votre machine, vos règles

Voici une idée radicale : et si vous pouviez faire tourner une IA véritablement intelligente sur votre propre matériel, sans qu'aucune de vos données ne quitte jamais votre machine ? Pas de serveurs cloud. Pas de collecte de données. Pas de frais d'abonnement. Juste vous, votre portable et une intelligence qui respecte votre vie privée par conception. Bienvenue dans la révolution des modèles open-weight.

La décision d'abord

Notre classement

Commencez par le gagnant, puis comparez les compromis qui pourraient changer votre choix.

#1 IA Locale / Privée

Qwen3.8 — 27B

Alibaba (Qwen Team)

Qwen3.8-27B est l'un des rares modèles locaux dont les compromis correspondent au matériel réellement possédé : un checkpoint dense de 27B pour texte, image, vidéo, code et agents à outils. Une version 4 bits tient sur un GPU de classe 24 Go, tandis qu'Apache 2.0 permet un travail privé et un usage commercial.

Pourquoi ça Gagne

Qwen annonce 61,7 à SWE-bench Pro, 73,0 à Terminal Bench 2.1, 42,2 à DeepSWE 1.1, 84,3 à OSWorld-Verified et 70,7 à CoWorkBench. Le modèle offre 262 144 tokens natifs, YaRN optionnel vers 1M, effort de raisonnement réglable, conservation du raisonnement entre tours et compréhension native des images et vidéos.

L'Accroc

Ce sont des preuves du jour de lancement, pas une vérité établie. Les scores principaux viennent surtout de la table de Qwen ; certains emploient le harness Claude Code, des tâches corrigées, des prompts particuliers ou des suites internes. Le paquet Q4_K_M courant approche 18 Go avec son projecteur visuel, mais overhead et cache KV limitent encore le contexte sur une carte 24 Go.

9.2 Note éditoriale
Lire l'avis
Idéal pour

Qwen3.8-27B est l'un des rares modèles locaux dont les compromis correspondent au matériel réellement possédé : un checkpoint dense de 27B pour texte, image, vidéo, code et agents à outils. Une version 4 bits tient sur un GPU de classe 24 Go, tandis qu'Apache 2.0 permet un travail privé et un usage commercial.

Pourquoi ça Gagne

Qwen annonce 61,7 à SWE-bench Pro, 73,0 à Terminal Bench 2.1, 42,2 à DeepSWE 1.1, 84,3 à OSWorld-Verified et 70,7 à CoWorkBench. Le modèle offre 262 144 tokens natifs, YaRN optionnel vers 1M, effort de raisonnement réglable, conservation du raisonnement entre tours et compréhension native des images et vidéos.

À surveiller

Ce sont des preuves du jour de lancement, pas une vérité établie. Les scores principaux viennent surtout de la table de Qwen ; certains emploient le harness Claude Code, des tâches corrigées, des prompts particuliers ou des suites internes. Le paquet Q4_K_M courant approche 18 Go avec son projecteur visuel, mais overhead et cache KV limitent encore le contexte sur une carte 24 Go.

#2

Un modèle MoE incroyablement efficace de 284B/13B paramètres actifs qui domine les flux de travail agentiques et de codage tout en s'adaptant confortablement sur du matériel de milieu de gamme.

9.1 Note éditoriale
Lire l'avis
#3

GLM-5.3

Z.ai (Zhipu AI)

Le modèle local le plus intéressant que l'on ne peut pas encore télécharger. GLM-5.3 conserve la base MoE 744B de GLM-5.2 et progresse fortement en code et agents par le seul post-entraînement. Z.ai promet les poids environ deux semaines après le lancement ; jusque-là, c'est un service hébergé avec un avenir auto-hébergé crédible.

9.2 Note éditoriale
Lire l'avis
#4

Kimi K3

Moonshot AI

Le premier modèle à poids ouverts qui ressemble à un cerveau fermé de pointe. 2,8 billions de paramètres en mixture-of-experts, vision native, un contexte complet d'un million de tokens et une licence qui autorise un usage commercial — le tout téléchargeable sur une machine que vous contrôlez. Le problème, c'est la machine : il faut un datacenter, pas un bureau.

8.5 Note éditoriale
Lire l'avis
#5

Gemma 4

Google DeepMind

Pas un modèle — cinq. Gemma 4 de Google DeepMind est une famille couvrant tout, d'un modèle de 2 milliards de paramètres qui tourne sur votre téléphone à un mastodonte dense de 31 milliards de paramètres pour serveurs. Chaque membre a une architecture différente, des forces différentes et des besoins matériels différents. Le E2B tient dans 1 Go de RAM. Le 12B Unified fait tourner une IA multimodale complète sur un GPU de laptop. Le 26B MoE n'active que 3,8B de paramètres par token. Tous Apache 2.0, tous open-weight, tous à vous. Ce guide passe en revue chacun pour que vous sachiez exactement quel Gemma correspond à votre matériel et votre utilisation.

8.2 Note éditoriale
Lire l'avis
Questions et réponses

Foire aux questions