Publié fin juillet, DeepSeek-V4-Flash-0731 est le dernier modèle de la série DeepSeek-V4, conçue pour offrir une forte efficacité en contexte long : réduire les coûts de calcul et de mémoire sans dégrader les capacités du modèle, tout en explorant des architectures à plus faible latence.
- Le modèle reprend exactement l’architecture et la taille du DeepSeek-V4-Flash-Preview d’avril (284 milliards de paramètres, dont 13 milliards activés, et un contexte d’un million de tokens) mais intègre de nouvelles recettes de post-entraînement destinées notamment à renforcer ses capacités agentiques.
- Avec V4-Flash, le pari de DeepSeek n’est pas d’égaler la frontière en intelligence brute, mais de maximiser la densité d’intelligence par paramètre actif et par dollar.
- Selon Artificial Analysis 1, son coût moyen est de seulement 0,03 dollar par test, soit environ cent fois moins qu’un modèle de frontière comme Claude Fable 5 (3,15 dollars).
- À architecture et capacités de base inchangées, l’amélioration du post-entraînement permet ainsi d’accroître fortement l’efficacité économique du modèle. Avec un million de tokens de contexte, DeepSeek-V4-Flash-0731 ne consomme qu’environ 10 % des calculs (FLOPs) par token généré et 7 % de la mémoire (KV cache) de DeepSeek-V3.2, le modèle précédent.
- V4-Flash-0731 se montre par ailleurs plus performant que DeepSeek-V4-Pro, pour un tiers de son prix. Ces deux modèles appartiennent à la même famille architecturale et utilisent les mêmes facteurs de compression de l’attention pour améliorer l’efficacité en contexte long. Ils diffèrent néanmoins par leur échelle : 43 couches, une dimension de 4 096, 256 experts et 13 milliards de paramètres activés pour Flash, contre 61 couches, une dimension de 7 168, 384 experts et 49 milliards de paramètres activés pour Pro.
- Sur les benchmarks agentiques publiés par DeepSeek, V4-Flash-0731 dépasse V4-Pro-Preview sur les neuf évaluations présentées : 82,7 contre 72,1 sur Terminal Bench 2.1, 54,4 contre 12,8 sur DeepSWE, 76,7 contre 52,7 sur CyberGym, ou encore 70,3 contre 55,9 sur Toolathlon-Verified.
- Le rapport d’avril estimait encore V4-Pro-Max à trois à six mois de la frontière américaine sur le plan du raisonnement ; Flash-0731 réduit l’écart en ce qui concerne l’exécution agentique.
- Depuis sa sortie le 31 juillet 2026, V4-Flash occupe la première place du classement hebdomadaire d’usage d’OpenRouter, grâce à un rapport performance-prix qui se traduit rapidement en trafic réel.
- Côté licence, DeepSeek-V4-Flash-0731 est, comme la plupart des modèles récents de DeepSeek, publié sous licence MIT : utilisation commerciale, modification et redistribution autorisées. Kimi K3, à l’inverse, impose à toute entreprise réalisant plus de 20 millions de dollars de chiffre d’affaires annuel de conclure un accord commercial spécifique.
- DeepSeek publie également le module « draft » couplé aux versions initiales de V4-Flash et V4-Pro, utilisé pour le décodage spéculatif — une technique qui accélère l’inférence en faisant prédire plusieurs tokens à la fois par un petit modèle, prédictions ensuite vérifiées par le modèle principal — ainsi que le code permettant de l’entraîner 2. Moonshot, de son côté, conserve un avantage structurel à servir K3 sur sa propre infrastructure : son draft, dérivé par fine-tuning d’une couche MTP elle-même pré-entraînée avec le modèle de base, n’est pas publié.
Dans un échange avec des investisseurs datant du mois de mai 3, le cofondateur de DeepSeek, Liang Wenfeng, insistait sur le fait que la publication des poids ne permet pas automatiquement aux fournisseurs tiers d’égaler le coût d’inférence de DeepSeek : atteindre le même coût par token exige de nombreuses optimisations que peu d’entreprises ont la capacité de mettre en place.
- Il y décrivait également le principal écart entre la Chine et les États-Unis : les capacités de calcul et les GPU. Le manque de calcul réduit directement la taille des modèles et le nombre d’expériences pouvant être menées en parallèle, donc la qualité des modèles ; il dit chercher à obtenir le plus grand nombre de GPU possible, dès lors que leur prix reste raisonnable.
- Le modèle économique possède, selon lui, une base solide : même sans nouvelle rupture technologique, la vente d’API pourrait suffire à rendre DeepSeek rentable et à soutenir une société cotée.
Sources
- Voir : Comparison of Models : Intelligence, Performance & Price Analysis.
- Voir : DSpark : Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation, 6 juillet 2026.
- Fred Gao, DeepSeek’s Liang Wenfeng Breaks His Silence, 23 juillet 2026.