DeepSeek V4-Flash-0731 : prix, performances et avis
Introduction : DeepSeek revient avec un modèle pensé pour l’échelle
DeepSeek vient de mettre à jour son modèle rapide sous le nom officiel DeepSeek-V4-Flash-0731. Il ne s’agit donc pas exactement de « DeepSeek Flash V4 », mais de la version finalisée de V4-Flash, accessible dans l’API avec l’identifiant deepseek-v4-flash. Cette révision remplace la préversion publiée au printemps 2026 et conserve la même architecture, tout en bénéficiant d’un nouveau post-entraînement destiné principalement à renforcer le codage agentique, l’utilisation d’outils et les workflows autonomes.
Cette sortie est importante parce que DeepSeek ne cherche pas seulement à rivaliser avec les meilleurs LLM sur les benchmarks. L’entreprise attaque le marché par le coût. À 0,14 dollar par million de tokens d’entrée et 0,28 dollar par million de tokens de sortie, V4-Flash se place très en dessous des tarifs de GPT-5.6, Gemini 3.6 Flash et Claude. La question n’est donc plus simplement de savoir s’il est le modèle le plus performant, mais s’il offre aujourd’hui le meilleur rapport entre intelligence, vitesse et dépense réelle.

Qu’est-ce que DeepSeek V4-Flash-0731 ?
La famille DeepSeek V4 a d’abord été présentée en avril 2026 avec deux variantes. DeepSeek-V4-Pro vise les tâches les plus complexes, tandis que V4-Flash privilégie la vitesse et l’efficacité. La version Flash repose sur une architecture Mixture-of-Experts de 284 milliards de paramètres, mais seuls 13 milliards sont activés pour un token donné. Ce fonctionnement permet de conserver une grande capacité globale sans mobiliser l’ensemble du réseau à chaque requête.
La version 0731 ne change pas cette structure. DeepSeek indique qu’elle résulte essentiellement d’un nouveau post-entraînement. Les progrès sont donc liés à l’alignement, au raisonnement et à la capacité à accomplir des tâches en plusieurs étapes, davantage qu’à une augmentation brute du nombre de paramètres. Le modèle intègre également un module de décodage spéculatif DSpark, conçu pour accélérer la génération sans utiliser un second modèle séparé.
V4-Flash accepte un contexte maximal d’un million de tokens et peut produire jusqu’à 384 000 tokens de sortie. Il prend en charge les appels d’outils, le JSON, le mode raisonnement, la complétion FIM et l’API Responses. DeepSeek propose aussi des interfaces compatibles avec les formats OpenAI et Anthropic, ce qui réduit le travail nécessaire pour migrer une application existante.
Une architecture conçue pour le très long contexte
Le principal apport technique de DeepSeek V4 ne se limite pas au nombre de tokens acceptés. La série combine Compressed Sparse Attention et Heavily Compressed Attention afin de réduire le coût du traitement des longues séquences. Elle ajoute également des Manifold-Constrained Hyper-Connections, destinées à stabiliser la circulation de l’information dans le réseau, ainsi que l’optimiseur Muon pour améliorer la convergence pendant l’entraînement.
Dans son rapport technique, DeepSeek affirme que V4-Pro ne consomme plus que 27 % des opérations d’inférence par token et 10 % du cache KV nécessaires à DeepSeek-V3.2 lorsque le contexte atteint un million de tokens. La déclinaison Flash est encore plus légère. Ces chiffres proviennent du laboratoire lui-même, mais ils expliquent pourquoi DeepSeek peut proposer une fenêtre contextuelle très large à un tarif particulièrement agressif.
Pour les développeurs, ce contexte ouvre des usages concrets : analyser plusieurs dépôts de code, conserver l’historique d’un agent, traiter une documentation complète, synthétiser de nombreux contrats ou maintenir une conversation métier longue. Il faut néanmoins distinguer la capacité théorique à accepter un million de tokens de la qualité réelle de récupération d’informations à toutes les positions du contexte.
Prix de DeepSeek V4-Flash face aux principaux concurrents
Les tarifs ci-dessous correspondent aux prix API standard annoncés le 6 août 2026. Ils sont exprimés en dollars par million de tokens. Les offres batch, les outils payants, les modes prioritaires et les taxes ne sont pas inclus.
| Modèle | Entrée | Entrée en cache | Sortie | Coût pour 1 M entrée + 1 M sortie |
|---|---|---|---|---|
| DeepSeek V4-Flash | 0,14 $ | 0,0028 $ | 0,28 $ | 0,42 $ |
| GPT-5.6 Luna | 0,20 $ | 0,02 $ | 1,20 $ | 1,40 $ |
| Gemini 3.6 Flash | 1,50 $ | 0,15 $ | 7,50 $ | 9,00 $ |
| Claude Sonnet 5 | 2,00 $ | 0,20 $ | 10,00 $ | 12,00 $ |
| Claude Opus 5 | 5,00 $ | 0,50 $ | 25,00 $ | 30,00 $ |
DeepSeek facture donc ce scénario environ 3,3 fois moins cher que GPT-5.6 Luna, 21 fois moins cher que Gemini 3.6 Flash, 29 fois moins cher que le tarif promotionnel de Claude Sonnet 5 et 71 fois moins cher que Claude Opus 5. Son entrée mise en cache est cinquante fois moins chère que son entrée non mise en cache.

Cette comparaison doit cependant rester prudente. Un million de tokens de sortie est un scénario artificiel, et les modèles ne consomment pas tous la même quantité de tokens pour résoudre une tâche. Un modèle plus cher peut revenir moins cher s’il répond correctement en moins d’étapes, évite les répétitions ou nécessite moins de validation humaine. Le prix par token mesure le coût de calcul facturé, pas directement le coût d’un résultat exploitable.
Autre avertissement important : DeepSeek annonce officiellement une hausse prochaine et potentiellement importante de ses tarifs API. Le prix actuel ressemble donc à une stratégie d’acquisition très agressive et ne doit pas être considéré comme garanti à long terme.
Quelles performances pour la version 0731 ?
La mise à jour produit un saut notable par rapport à la préversion. Dans les résultats publiés par DeepSeek, V4-Flash-0731 atteint 82,7 sur Terminal Bench 2.1, contre 61,8 pour la préversion et 72,1 pour V4-Pro Preview. Il obtient aussi 54,4 sur DeepSWE, contre 7,3 pour l’ancien Flash, ainsi que 70,3 sur Toolathlon-Verified et 25,1 sur AutomationBench Public.
Ces scores montrent que la version 0731 est surtout un modèle d’agent et de codage. Elle dépasse GLM-5.2 sur tous les benchmarks affichés dans la carte officielle de DeepSeek. Face à Claude Opus 4.8, elle reste généralement derrière, mais l’écart devient limité sur Terminal Bench 2.1, Agents’ Last Exam et AutomationBench. Sur NL2Repo ou Cybergym, l’avantage de Claude demeure plus visible.
Le niveau de raisonnement choisi influence fortement les résultats. La documentation prévoit trois réglages : low, high et max. Le rapport V4 montre que le passage vers un effort supérieur améliore nettement GPQA Diamond, HLE, LiveCodeBench et SWE Verified, mais augmente mécaniquement la quantité de tokens générés, la latence et le coût final.
Il faut aussi rappeler que les benchmarks publiés par un fournisseur ne constituent pas un audit indépendant. DeepSeek précise avoir utilisé son propre harness minimal avec le niveau de raisonnement maximal pour plusieurs évaluations de code. Les comparaisons restent utiles pour observer la progression du modèle, mais elles ne suffisent pas à prédire son comportement dans une application réelle.
DeepSeek V4-Flash face à GPT-5.6
OpenAI positionne GPT-5.6 Luna comme son modèle rapide et économique. Son tarif d’entrée est assez proche de celui de DeepSeek, mais sa sortie coûte plus de quatre fois plus cher. Sur Terminal Bench 2.1, OpenAI publie un score de 84,7 pour Luna, 87,4 pour Terra et 88,8 pour Sol, contre 82,7 annoncé par DeepSeek pour V4-Flash-0731.
L’avantage de GPT-5.6 semble donc rester réel sur le codage agentique de pointe, surtout avec Terra ou Sol. DeepSeek conserve cependant un rapport prix-performance remarquable. Pour des agents exécutant un grand nombre d’actions, des traitements asynchrones, de la classification, de la génération de code répétitive ou des boucles de correction, la différence de facturation peut devenir considérable.
GPT-5.6 conserve aussi un avantage d’écosystème : outils natifs, intégration avec Codex, fonctionnalités multimodales et infrastructure destinée aux entreprises. DeepSeek compense en facilitant la migration avec des formats compatibles et en permettant le déploiement à partir de poids téléchargeables.
Face à Gemini 3.6 Flash et Claude
Gemini 3.6 Flash coûte 1,50 dollar en entrée et 7,50 dollars en sortie au tarif standard. Google propose en échange un modèle multimodal, relié à ses fonctions de recherche, de grounding et à son écosystème cloud. DeepSeek est beaucoup moins cher pour le texte, le code et les agents, mais il ne remplace pas automatiquement Gemini lorsqu’une application dépend de l’analyse native d’images, d’audio ou de vidéo.
Claude Sonnet 5 et Claude Opus 5 se situent dans une autre catégorie tarifaire. Anthropic facture actuellement Sonnet 5 à 2 dollars en entrée et 10 dollars en sortie dans le cadre d’un prix promotionnel valable jusqu’au 31 août 2026. Opus 5 coûte 5 et 25 dollars. En contrepartie, Anthropic positionne ces modèles sur le codage complexe, les agents professionnels, la qualité rédactionnelle et les environnements d’entreprise.
La comparaison la plus honnête n’oppose donc pas un vainqueur absolu à des perdants. DeepSeek domine sur le prix brut et se rapproche des meilleurs modèles dans plusieurs tâches agentiques. GPT-5.6 conserve une avance de performance sur certains benchmarks de codage. Claude reste une référence pour les workflows complexes et la fiabilité professionnelle. Gemini est plus naturel pour les produits fortement multimodaux ou intégrés aux services Google.
Pour quels usages choisir DeepSeek V4-Flash ?
V4-Flash paraît particulièrement pertinent pour les assistants de programmation, les agents de support, l’extraction structurée, la recherche dans de grands corpus, les pipelines RAG, les automatisations internes et les applications dont le volume rend les API occidentales trop coûteuses. Son contexte d’un million de tokens et son prix de cache peuvent aussi convenir aux agents persistants qui réutilisent régulièrement une base documentaire importante.
Il est moins évident pour les tâches où quelques points de précision supplémentaires justifient une dépense élevée : recherche scientifique critique, cybersécurité avancée, production juridique, analyse financière sensible ou agents capables de modifier directement des systèmes de production. Dans ces cas, le coût du modèle représente souvent une fraction du coût du risque.
Les entreprises européennes devront également examiner la localisation des données, les conditions contractuelles, la conformité, les politiques de conservation et les exigences sectorielles avant toute intégration. Un modèle peu cher n’est réellement économique que s’il peut être utilisé dans un cadre juridique et opérationnel acceptable.
Conclusion : un nouveau seuil pour le prix de l’intelligence
DeepSeek V4-Flash-0731 n’est pas le meilleur LLM dans toutes les catégories. Les résultats disponibles montrent encore un avantage pour GPT-5.6 ou Claude sur plusieurs tâches de très haut niveau. En revanche, il redéfinit clairement le prix auquel un modèle compétent en raisonnement, en code et en agents peut être exploité.
À 0,42 dollar pour un million de tokens d’entrée et un million de sortie, il devient difficile à ignorer pour les développeurs qui construisent des produits à fort volume. Son contexte d’un million de tokens, ses interfaces compatibles et ses poids accessibles renforcent encore son attractivité. La réserve principale concerne la stabilité du tarif, puisque DeepSeek a déjà annoncé une augmentation prochaine.
Le véritable impact de V4-Flash ne sera donc peut-être pas de battre systématiquement les modèles américains, mais d’obliger l’ensemble du marché à justifier chaque dollar facturé. Pour de nombreux projets, le choix ne se fera plus entre un modèle « bon » et un modèle « excellent », mais entre une performance maximale et une intelligence suffisamment élevée pour être déployée massivement.
