Classé #4 IA locale / privée — Votre cerveau, votre machine, vos règles
DeepSeek

DeepSeek-V4-Flash-0731

Un MoE efficace de 284 milliards de paramètres, dont 13 milliards actifs, spécialisé dans le texte et le code et toujours séduisant sur les machines de classe 128 Go. De nouveaux concurrents multimodaux ont mis fin à sa brève prétention au trône des agents locaux.

Mis à jour 29 août 2026 Open WeightsMIT1M Context
9.0sur 10
Site officiel
Idéal pour

Un MoE efficace de 284 milliards de paramètres, dont 13 milliards actifs, spécialisé dans le texte et le code et toujours séduisant sur les machines de classe 128 Go. De nouveaux concurrents multimodaux ont mis fin à sa brève prétention au trône des agents locaux.

Pourquoi ça Gagne

Des progrès agentiques spectaculaires par rapport à sa version préliminaire : il atteint 82.7 sur Terminal Bench 2.1 et 54.4 sur DeepSWE. Sa quantification 4 bits, presque sans perte, ne pèse que 155 Go.

À surveiller

Il se limite au texte, nécessite environ 103 Go même dans une version agressive à trois bits et la plupart de ses meilleurs scores agentiques proviennent de tests du fournisseur. Qwen et GLM Flash proposent désormais des ensembles plus performants ou plus complets pour les agents privés.

01

Ce que c'est réellement

Lorsqu’on parle d’IA locale, la conversation tourne généralement autour des compromis. Soit vous obtenez un modèle massif qui nécessite une ferme de serveurs pour fonctionner, soit un petit modèle qui a du mal à maintenir le contexte sur une session de codage complexe. DeepSeek-V4-Flash-0731 brise cette dichotomie.

Publié le 31 juillet 2026 sous la forme d’une pure mise à niveau du post-entraînement, Flash-0731 conserve exactement la même architecture MoE de 284 milliards de paramètres au total, dont 13 milliards actifs, que sa version préliminaire. Pourtant, les capacités libérées par cette mise à jour sont stupéfiantes. Sur Terminal Bench 2.1, il bondit à 82.7 et égale presque le poids lourd fermé Opus 4.8. Sur DeepSWE, il passe d’un modeste 7.3 à un impressionnant 54.4. Cela démontre qu’un agent de pointe n’a pas besoin de mille milliards de paramètres : il faut surtout apprendre à un modèle très efficace à utiliser précisément les outils, à naviguer dans un terminal et à se remettre de ses propres erreurs.

La magie de Flash-0731 réside dans sa parcimonie. Puisque seuls 13 milliards de paramètres sont actifs pendant l’inférence, il exige nettement moins de bande passante mémoire que les énormes modèles denses ou les MoE plus lourds tels que GLM-5.2. Avec une quantification soignée dans les formats GGUF dynamiques d’Unsloth, la version 3 bits tient dans environ 103 Go de RAM. Un seuil décisif est ainsi franchi : la programmation autonome de pointe devient accessible aux développeurs individuels équipés de 128 Go de mémoire unifiée, et non plus seulement aux équipes d’entreprise disposant de grappes multi-GPU.

Il est totalement aveugle aux images, et les tests indépendants actuels d’intelligence générale le placent derrière les nouveaux modèles GLM et Qwen Flash. Pour son usage prévu — un agent de texte et de code économique sur une machine de classe 128 Go — il reste performant, mais n’est plus sans égal.

La licence MIT, le contexte de 1M et la prise en charge de DSpark font toujours de DeepSeek un plan de référence utile pour une IA locale efficace. La différence, c’est que ce plan se trouve désormais sur la quatrième étagère plutôt que sur la première : une option ciblée sur le texte et le code pour les personnes capables de lui consacrer environ 103 Go et qui n’ont pas besoin de vision native.

02

Forces et limites honnêtes

Points Forts

  • La domination agentique sans l’embonpoint : Ce n’est pas simplement un modèle ouvert de plus, mais une puissante machine spécialisée dans les agents. Avec 82.7 sur Terminal Bench 2.1, un score proche d’Opus 4.8, et 54.4 sur DeepSWE, Flash-0731 démontre que le post-entraînement peut libérer une utilisation des outils et un raisonnement en plusieurs étapes dignes des meilleurs modèles, sans faire grossir le modèle de base.
  • Une efficacité matérielle sans précédent : Avec seulement 13 milliards de paramètres actifs sur 284 milliards au total, il ne demande qu’une fraction de la bande passante mémoire de ses concurrents. Grâce aux GGUF dynamiques d’Unsloth, la version 3 bits tient dans environ 103 Go de RAM et peut donc fonctionner sur des MacBook dotés de 128 Go de mémoire unifiée. Pour les développeurs exigeants qui travaillent en local, il est réellement accessible.
  • La liberté d’une licence MIT : DeepSeek maintient son engagement envers l’open source avec une licence MIT. Vous pouvez télécharger les poids, les quantifier et les déployer commercialement sans restriction. Aucune condition cachée, aucun verrouillage dans une API : seulement de la puissance en local.
  • Un contexte de 1M conçu pour les gros volumes : Flash-0731 conserve l’immense fenêtre de contexte de 1M de la version préliminaire et se prête donc à l’analyse de dépôts de code entiers. Il prend en charge le décodage spéculatif DSpark, qui peut nettement augmenter le débit lors du traitement de journaux ou de dépôts volumineux.

Limites Honnêtes

  • Texte et code uniquement : Comme beaucoup de modèles spécialisés dans la programmation, il ne dispose pas de vision native. Impossible de lui fournir des captures d’écran d’interface ou des diagrammes pour l’aider à déboguer. Si votre workflow repose largement sur des entrées multimodales, il faudra lui adjoindre un modèle de vision.
  • Les capacités générales ne sont plus au niveau des meilleurs modèles : Son score d’environ 50 sur l’Artificial Analysis Intelligence Index reste derrière les nouveaux modèles GLM et Qwen Flash, situés entre le milieu et le haut de la cinquantaine. DeepSeek demeure un spécialiste plutôt que l’atelier privé le plus polyvalent.
  • Les risques d’une quantification agressive : Faire tenir une quantification 3 bits dans 103 Go est remarquable, mais pousser la compression aussi loin peut parfois dégrader les raisonnements complexes. Vous devrez vérifier que cette version 3 bits conserve exactement les comportements agentiques nuancés dont votre banc d’essai a besoin.
03

Aperçu des Benchmarks

Terminal Bench 2.1 — 82.7

Un bond spectaculaire dans l'utilisation agentique du terminal, qui le place à proximité de Claude 4.8 Opus (85.0).

DeepSWE — 54.4

Une progression incroyable par rapport au 7.3 de la version préliminaire, qui illustre toute la puissance de son post-entraînement du 31 juillet.

Architecture — 284B au total / 13B actifs

Une architecture Mixture-of-Experts très parcimonieuse qui réduit les FLOPs et la bande passante mémoire, tout en maintenant de solides performances sur du matériel contraint.

AutomationBench Public — 25.1

Il atteint presque le double du score de GLM-5.2 (12.9), ce qui démontre sa supériorité dans l'exécution autonome en plusieurs étapes.

04

Le Verdict

DeepSeek-V4-Flash-0731 passe à la 4e place de la catégorie IA locale / privée avec une note de 9,0. Sa quantification de classe 103 Go, sa licence MIT, son contexte de 1M et sa spécialisation solide dans le texte et le terminal en font toujours une option convaincante pour une machine dotée de 128 Go. Il ne mérite plus d’être qualifié de « référence absolue » : Qwen3.8-27B est infiniment plus facile à faire tourner, GLM-5.3-Flash est plus performant et multimodal, tandis que Qwen3.8-Flash-Next active moins de calcul. Choisissez DeepSeek lorsque les agents consacrés au texte et au code comptent davantage que les entrées visuelles et que sa quantification précise donne de bons résultats dans votre banc d’essai.

05

Foire aux questions