Lorsqu’on parle d’IA locale, la conversation tourne généralement autour des compromis. Soit vous obtenez un modèle massif qui nécessite une ferme de serveurs pour fonctionner, soit un petit modèle qui a du mal à maintenir le contexte sur une session de codage complexe. DeepSeek-V4-Flash-0731 brise cette dichotomie.
Publié le 31 juillet 2026 sous la forme d’une pure mise à niveau du post-entraînement, Flash-0731 conserve exactement la même architecture MoE de 284 milliards de paramètres au total, dont 13 milliards actifs, que sa version préliminaire. Pourtant, les capacités libérées par cette mise à jour sont stupéfiantes. Sur Terminal Bench 2.1, il bondit à 82.7 et égale presque le poids lourd fermé Opus 4.8. Sur DeepSWE, il passe d’un modeste 7.3 à un impressionnant 54.4. Cela démontre qu’un agent de pointe n’a pas besoin de mille milliards de paramètres : il faut surtout apprendre à un modèle très efficace à utiliser précisément les outils, à naviguer dans un terminal et à se remettre de ses propres erreurs.
La magie de Flash-0731 réside dans sa parcimonie. Puisque seuls 13 milliards de paramètres sont actifs pendant l’inférence, il exige nettement moins de bande passante mémoire que les énormes modèles denses ou les MoE plus lourds tels que GLM-5.2. Avec une quantification soignée dans les formats GGUF dynamiques d’Unsloth, la version 3 bits tient dans environ 103 Go de RAM. Un seuil décisif est ainsi franchi : la programmation autonome de pointe devient accessible aux développeurs individuels équipés de 128 Go de mémoire unifiée, et non plus seulement aux équipes d’entreprise disposant de grappes multi-GPU.
Il est totalement aveugle aux images, et les tests indépendants actuels d’intelligence générale le placent derrière les nouveaux modèles GLM et Qwen Flash. Pour son usage prévu — un agent de texte et de code économique sur une machine de classe 128 Go — il reste performant, mais n’est plus sans égal.
La licence MIT, le contexte de 1M et la prise en charge de DSpark font toujours de DeepSeek un plan de référence utile pour une IA locale efficace. La différence, c’est que ce plan se trouve désormais sur la quatrième étagère plutôt que sur la première : une option ciblée sur le texte et le code pour les personnes capables de lui consacrer environ 103 Go et qui n’ont pas besoin de vision native.