Introduction
DeepSeek V4 Flash 0731 est entré en version bêta publique avec une promesse familière : offrir des capacités améliorées de codage et d'agent à des prix API extrêmement bas.
Les développeurs ont rapidement transformé cette affirmation en expériences concrètes.
L'un des exemples les plus partagés provient d'une exécution d'Hermes Agent, où DeepSeek V4 Flash a généré un jeu de tir 3D à la première personne jouable à partir d'une seule invite initiale. Le projet aurait pris 32 minutes, avec un coût d'utilisation du modèle de seulement 0,07 $.
Le résultat final comprend :
- Des déplacements à la première personne.
- Des sauts.
- Des tirs.
- Des collisions physiques avec l'environnement.
- Des objets de couverture et des cibles.
- Un compteur de munitions dans l'interface.

CSA et HCA réduisent le coût des contextes longs
DeepSeek V4 prend en charge une fenêtre de contexte d'un million de tokens.
Les systèmes d'attention traditionnels deviennent extrêmement coûteux à cette échelle, car chaque nouveau token peut nécessiter d'examiner une grande partie du contexte précédent et de maintenir un cache KV volumineux.
Le rapport technique de DeepSeek décrit une conception d'attention hybride combinant :
- Attention parcimonieuse compressée (CSA)
- Attention fortement compressée (HCA)
La stratégie globale consiste à éviter un calcul d'attention complet et coûteux sur tout l'historique à chaque étape.
Le système compresse et filtre le contexte, permettant au modèle de concentrer le calcul sur les informations les plus utiles.
DeepSeek rapporte que, dans un contexte d'un million de tokens, V4 Pro nécessite :
27 % des FLOPs d'inférence par token de DeepSeek V3.2.
- 10 % de la capacité du cache KV.
Ces pourcentages exacts proviennent des rapports techniques sur le V4 Pro, et non d'un audit distinct pour Flash.
V4 Flash utilise la même famille d'architecture et bénéficie donc des mêmes principes de conception pour les contextes longs.
Les effets concrets incluent une réduction :
- de la mémoire du cache KV.
- de la pression sur la mémoire GPU.
- du volume de données déplacées.
- du calcul par token.
- des coûts de service pour les contextes longs.
FP4 et FP8 réduisent le stockage
ainsi que le trafic mémoire
Le modèle V4 Flash publié utilise des poids en précision mixte.
DeepSeek indique :
Précision mixte FP4 + FP8
Une précision réduite diminue la quantité de données à stocker, à charger depuis la mémoire, à transférer entre dispositifs et à traiter lors de l'inférence.
C'est important car l'inférence des modèles de langage modernes est souvent limitée par la bande passante mémoire, pas seulement par la puissance de calcul brute.
Si le matériel et les noyaux sont conçus pour exécuter efficacement ce format, une représentation plus petite des données peut améliorer le débit.
La faible précision n'est pas gratuite.
Une mauvaise quantification dégrade la qualité du modèle.
La publication de DeepSeek a été conçue et entraînée autour du schéma de précision choisi, et ne repose pas uniquement sur une quantification communautaire post-hoc.
Aucun changement d'architecture entre l'aperçu et la version 0731
DeepSeek indique que la version officielle 0731 conserve la même architecture et la même taille de modèle que l'aperçu V4 Flash.
L'entreprise n'a pas refait un pré-entraînement complet pour cette mise à jour.
Elle a plutôt refait le processus de post-entraînement.
L'article source résume les changements comme suit :
- Nouveau fine-tuning supervisé.
- Nouvel apprentissage par renforcement GRPO.
- Déchiffrage spéculatif DSpark.
- Meilleur comportement agentique.
- Plus grand débit de service.
Le rapport technique de DeepSeek décrit le processus de post-entraînement plus large du V4 ainsi :
- Développement indépendant de modules experts spécialisés.
- Fine-tuning supervisé et apprentissage par renforcement avec GRPO.
- Distillation en ligne de politiques.
- Intégration des capacités expertes dans un modèle unique.
La mise à jour 0731 se concentre sur l'amélioration de ces capacités dans des flux de travail agentiques réels.
DSpark accélère la génération de tokens
DeepSeek-V4-Flash-0731 est fourni avec un module de déchiffrage spéculatif DSpark.
Le déchiffrage spéculatif utilise un chemin de brouillon plus petit ou moins coûteux pour proposer plusieurs tokens futurs.
Le modèle principal valide ces propositions par lots.
Le processus simplifié est le suivant :
Le module de brouillon propose des tokens
→ Le modèle principal valide simultanément
→ Les tokens acceptés sont générés
→ Les chemins rejetés sont corrigés
Lorsque les prédictions du brouillon sont précises, le système peut générer plusieurs tokens acceptés avec moins de raisonnement séquentiel coûteux du modèle principal.
DeepSeek propose le support DSpark à la fois pour vLLM et SGLang.
Pour vLLM, la fiche officielle du modèle utilise :
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Pour SGLang, l'option correspondante est :
--speculative-algorithm DSPARK
DeepSeek précise que les poids du modèle cible et du modèle de brouillon sont stockés dans le même point de contrôle, donc SGLang n'a pas besoin d'un chemin de modèle de brouillon séparé.
Le déchiffrage spéculatif améliore principalement la vitesse de service et le débit.
Il n'explique pas à lui seul l'amélioration des capacités de raisonnement du modèle.
Ces gains proviennent du processus de post-entraînement actualisé.
La publication officielle améliore les scores des benchmarks agentiques
DeepSeek rapporte des gains importants sur plusieurs tests orientés agents par rapport à l'aperçu V4 Flash.
| Benchmark | V4 Flash 0731 | Aperçu V4 Flash | Aperçu V4 Pro |
|---|---|---|---|
| Terminal Bench 2.1 | 82,7 | 61,8 | 72,1 |
| NL2Repo | 54,2 | 39,4 | 38,5 |
| CyberGym | 76,7 | 38,7 | 52,7 |
| DeepSWE | 54,4 | 7,3 |
12,8 |
| Toolathlon-Verified | 70,3 | 49,7 | 55,9 |
| Agents' Last Exam | 25,2 | 15,8 | 16,5 |
| AutomationBench Public | 25,1 | 10,8 | 12,8 |
| DSBench-FullStack | 68,7 | 37,0 | 41,8 |
| DSBench-Hard | 59,6 | 25,8 | 31,1 |

DeepSeek précise que les benchmarks agentiques publics ont été exécutés avec la configuration suivante :
Mode minimal de DeepSeek Harness
reasoning_effort = max
top_p = 0,95
temperature = 1,0
Au moment de la mise à jour officielle, ce cadre de test n'avait pas encore été rendu public.
DSBench-FullStack et DSBench-Hard sont des benchmarks internes à DeepSeek.
Leurs scores peuvent donc servir de preuve de référence selon les rapports de l'entreprise, mais ils ne peuvent pas être vérifiés indépendamment comme une suite de benchmarks entièrement publique.
Ce que mesurent Terminal Bench et Toolathlon
Terminal Bench 2.1
Terminal Bench évalue la capacité d'un agent à accomplir des tâches dans un environnement terminal.
Le modèle peut devoir inspecter des fichiers, exécuter des commandes, installer des dépendances, déboguer des pannes, modifier du code et vérifier l'achèvement.
Un score élevé reflète la performance combinée du modèle, du cadre agentique, de la stratégie d'outils, du budget de raisonnement et de l'environnement d'exécution.
Toolathlon-Verified
Toolathlon évalue des tâches de longue durée à travers plusieurs applications et outils logiciels.
Ce benchmark inclut des scénarios impliquant des calendriers, des systèmes de fichiers, Notion, WooCommerce, Kubernetes et BigQuery.
Les tâches nécessitent de nombreuses interactions avec les outils et sont validées par des évaluateurs basés sur l'exécution.
Le score de 70,3 rapporté par DeepSeek constitue une forte progression par rapport au modèle d'aperçu.
Mais cela ne doit pas être interprété comme une garantie de succès de 70,3 % pour chaque automatisation métier réelle.
Les progrès sur les benchmarks ne garantissent pas un succès en une seule tentative pour chaque jeu
L'exemple de jeu de la source révèle une différence importante entre les performances sur benchmark et la création de code créative.
V4 Flash obtient de bons résultats dans les évaluations agentiques officielles, mais une comparaison de jeu a tout de même nécessité trois itérations.
Les benchmarks peuvent mesurer le taux de succès sur des ensembles de tâches bien définis et des règles d'évaluation connues.
Les projets créatifs peuvent contenir des exigences visuelles vagues, des problèmes de compatibilité navigateur, des bugs de moteur physique, des ressources manquantes, des jugements de qualité subjectifs et aucun kit de test unique ne peut définir le succès.
Dans ce type de scénario, un modèle à faible coût est particulièrement utile car le flux de travail peut supporter plusieurs itérations.
Sa valeur ne réside pas nécessairement dans une génération parfaite dès la première tentative.
Cela peut être :
Qualité acceptable
×
Grand nombre de tentatives abordables
Creez un site vitrine et genere des leads en quelques minutes
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
V4 Flash prend en charge plusieurs formats d'API
DeepSeek met ses modèles à disposition via les moyens suivants :
- Interface Chat Completions compatible OpenAI.
- API Responses compatible OpenAI.
- API compatible Anthropic.
- Sortie JSON.
- Appels d'outils.
- Complétion de préfixe de discussion.
- Complétion de remplissage intermédiaire en mode non-pensée.
L'URL de base compatible OpenAI est :
https://api.deepseek.com
L'URL de base compatible Anthropic est :
https://api.deepseek.com/anthropic
DeepSeek indique que V4 Flash est actuellement le seul modèle API V4 prenant en charge l'API Responses.
La prise en charge de V4 Pro sera planifiée séparément.
La compatibilité avec l'API Responses permet également au modèle d'être utilisé dans Codex via la configuration documentée de DeepSeek.
Le mode réflexion est activé par défaut
DeepSeek V4 Flash prend en charge les modes réflexion et non-réflexion.
Le mode réflexion est le mode par défaut.
Pour l'inférence locale, la fiche officielle du modèle prend en charge trois niveaux d'effort de raisonnement :
low
high
max
DeepSeek recommande :
temperature = 1.0
top_p = 0.95
pour les scénarios d'agents.
Pour les niveaux d'effort de raisonnement high et max, l'entreprise recommande de permettre une longueur de sortie maximale allant jusqu'à 384 000 jetons.
Des réglages de raisonnement plus élevés peuvent améliorer les performances sur les tâches difficiles, mais peuvent également augmenter la latence, le volume de sortie, le coût API et la durée des boucles d'agents.
Les systèmes de production doivent évaluer le niveau d'effort le plus bas capable de répondre de manière fiable aux besoins des tâches.
Les poids sont publiés sous licence MIT
DeepSeek a publié les poids de V4 Flash 0731 sur Hugging Face sous licence MIT.
Cela rend le modèle exceptionnellement permissif en termes de licence par rapport à de nombreuses publications commerciales majeures.
Les développeurs peuvent utiliser le dépôt de modèles officiel avec les moteurs pris en charge, notamment :
- vLLM.
- SGLang.
- Transformers.
- Docker Model Runner.
- Les versions quantifiées compatibles avec llama.cpp.
- Les versions communautaires compatibles avec LM Studio.
Ce modèle est de grande taille.
Le modèle principal possède 284B paramètres, et le checkpoint 0731 contient également un composant DSpark.
Son exécution à une vitesse utilisable nécessite d'importantes ressources mémoire et matérielles.
Le fait que les poids soient téléchargeables ne signifie pas que le modèle complet puisse fonctionner de manière fluide sur un ordinateur portable grand public ordinaire.
Les versions quantifiées communautaires peuvent réduire les besoins en mémoire, mais peuvent modifier la précision, le débit, la capacité contextuelle, le comportement DSpark et la fiabilité des appels d'outils.
V4 Flash est-il toujours le meilleur rapport qualité-prix ?
Les sources concluent que V4 Flash ne produit pas les meilleurs résultats à chaque comparaison, mais qu'il est difficile à battre en termes de rapport qualité-prix.
C'est un résumé raisonnable des exemples, avec une réserve importante :
Le rapport qualité-prix dépend de l'ensemble du workflow.
V4 Flash est particulièrement attractif dans les cas suivants :
- Volume de requêtes élevé.
- Erreurs faciles à détecter.
- Tâches pouvant être réessayées automatiquement.
- Bon effet de mise en cache du contexte.
- Coût de révision humaine faible.
- Code compact acceptable.
- Applications pouvant utiliser des modèles à poids ouverts.
En revanche, les modèles frontières plus chers peuvent globalement rester plus économiques dans les cas suivants :
- Un résultat échoué entraîne une perte importante.
- La fiabilité au premier passage est cruciale.
- Les tâches nécessitent des connaissances plus approfondies.
- Les agents ne peuvent pas réessayer en toute sécurité.
- Le coût de révision humaine est élevé.
- Les modèles plus petits produisent des sorties difficiles à maintenir.
La bonne comparaison n'est pas :
le prix par jeton
mais :
le coût par tâche réussie et validée
Comment évaluer V4 Flash pour des projets réels
Étape 1 : Choisir des tâches représentatives
Ne testez pas uniquement des démos soignées.
Utilisez des tâches correspondant à la charge de travail de production, y compris des scénarios difficiles et complexes.
Étape 2 : Fixer l'environnement d'agent
Maintenez la cohérence des invites, des outils, des limites de temps, des stratégies de réessai, des frameworks, des sandbox, des suites de tests et des réglages de raisonnement entre les différents modèles.
Étape 3 : Enregistrer les coûts complets
Suivez les entrées sans cache, les entrées avec cache, les jetons de sortie, les appels d'outils, les nombres de réessais, les temps d'exécution, les révisions humaines et les tentatives échouées.
Étape 4 : Mesurer l'acceptabilité, pas seulement la similarité visuelle
Pour le code, exécutez des tests et vérifiez la maintenabilité.
Pour les jeux, vérifiez les contrôles, les collisions, les performances et la compatibilité navigateur.
Étape 5 : Tester le comportement du cache
Lorsqu'un contexte stable est réutilisé à plusieurs reprises sur plusieurs étapes d'agent, un modèle au prix de cache très bas devient plus précieux.
Étape 6 : Comparer le premier passage et le succès final
Un modèle qui réussit après trois tentatives bon marché peut avoir un meilleur rapport qualité-prix qu'un modèle qui réussit du premier coup à un prix élevé.
Lorsque les réessais sont lents ou risqués, la situation peut aussi être inverse.
Questions fréquentes
Qu'est-ce que DeepSeek V4 Flash 0731 ?
DeepSeek V4 Flash 0731 est la version post-entraînée officielle du modèle V4 d'experts mixtes à plus petite échelle de DeepSeek. Elle remplace la version d'aperçu, ajoute le module de décodage spéculatif DSpark et se concentre principalement sur les tâches d'agents de codage et d'utilisation d'outils.
Quel est le coût de l'API DeepSeek V4 Flash ?
Les prix réguliers actuellement publiés par DeepSeek sont : 0,0028 $ par million de jetons d'entrée avec cache atteint, 0,14 $ par million de jetons d'entrée sans cache, et 0,28 $ par million de jetons de sortie. L'entreprise a annoncé que les politiques futures doubleront les prix pendant les heures de pointe désignées.
DeepSeek V4 Flash a-t-il vraiment créé un jeu 3D pour 0,07 $ ?
Un développeur a rapporté qu'une exécution de Hermes Agent a généré un jeu de tir à la première personne jouable en 32 minutes pour un coût de 0,07 $. Il s'agit d'une étude de cas sur les réseaux sociaux, et non d'un benchmark standardisé ; les coûts pour d'autres tâches peuvent donc être plus élevés ou plus faibles.
Combien de paramètres DeepSeek V4 Flash possède-t-il ?
Le rapport technique V4 liste un total de 284 milliards de paramètres pour le modèle Flash principal, avec 13 milliards de paramètres activés par jeton. Le dépôt complet de la version 0731 peut afficher environ 304 milliards de paramètres, car il inclut le composant de décodage spéculatif DSpark associé.
Pourquoi DeepSeek V4 Flash est-il si bon marché ?
Son faible coût provient de l'activation parcimonieuse des experts mixtes, de l'attention compressée sur les contextes longs, de la précision mixte FP4/FP8, de la mise en cache des invites, du décodage spéculatif et du service à haute concurrence. Seule une petite partie des experts totaux est activée par jeton.
DeepSeek V4 Flash est-il meilleur que Claude Opus 5 ou GPT-5.6 ?
Aux prix API actuels, il est beaucoup moins cher et s'est montré compétitif dans plusieurs démonstrations communautaires. Opus 5 et GPT-5.6 peuvent encore offrir une meilleure fiabilité ou qualité au premier passage sur certaines tâches, et ces comparaisons virales ne sont pas des benchmarks contrôlés.
DeepSeek V4 Flash peut-il être exécuté localement ?
Oui. DeepSeek a publié les poids sous licence MIT et fournit des instructions d'utilisation pour vLLM et SGLang. Le modèle complet est extrêmement volumineux ; un déploiement local pratique nécessite donc une grande quantité de mémoire accélérateur ou des solutions de quantification communautaires agressives.
V4 Flash prend-il en charge Codex et l'API Responses ?
Oui. DeepSeek indique que la version Flash officielle prend nativement en charge l'API Responses et a été adaptée pour une utilisation avec Codex. L'API V4 Pro actuelle ne prend pas encore en charge l'API Responses.
Outils associés
- API DeepSeek : point de terminaison hébergé officiel pour DeepSeek V4 Flash et d'autres modèles pris en charge.
- [DeepSeek V4 Flash
0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) : Dépôt officiel du modèle, contenant les poids, les benchmarks, la licence et les guides de déploiement.
- vLLM : Un moteur d'inférence à haut débit offrant des recettes officielles pour V4 Flash et DSpark.
- SGLang : Un framework de service LLM avec prise en charge documentée intégrée pour V4 Flash et DSpark.
- DeepSpec : Dépôt de recherche de DeepSeek sur le décodage spéculatif et la méthode DSpark.
- Codex : Un environnement de codage intelligent pouvant se connecter à V4 Flash via l'interface compatible API Responses de DeepSeek.
Liens connexes
- Mise à jour officielle de DeepSeek V4 Flash : Journal des modifications du 31 juillet, comprenant le statut officiel de sortie, les benchmarks et la portée de l'API.
- Modèles et tarifs de l'API DeepSeek : Prix actuels des jetons, longueur du contexte, limites de sortie, nombre de requêtes simultanées, et avis sur la tarification future en période de pointe.
- Rapport technique DeepSeek V4 : Article principal décrivant l'architecture MoE, l'attention CSA/HCA, la précision, l'entraînement et le contexte de million de jetons.
- Fiche du modèle DeepSeek V4 Flash : Tableau de benchmarks officiel 0731, encodage de chat, configuration DSpark et licence MIT.
- Intégration DeepSeek Codex : Guide officiel pour utiliser V4 Flash avec Codex et l'API Responses.
- Article Toolathlon : Article de recherche décrivant le benchmark multi-outils à long terme utilisé pour l'évaluation officielle.
- Recette V4 Flash pour vLLM : Guide matériel et de service adapté au déploiement de V4 Flash.
Résumé
DeepSeek V4 Flash 0731 a suscité une grande attention car les développeurs rapportent avoir construit des démos interactives complètes pour quelques centimes seulement. Un jeu de tir à la première personne aurait coûté seulement 0,07 $, tandis que d'autres comparaisons sur les réseaux sociaux montrent des coûts de tâche des dizaines de fois inférieurs à ceux de Claude Opus 5 ou GPT-5.6.
Ces exemples ne sont pas des benchmarks contrôlés, mais la tarification officielle de l'API soutient leur idée centrale. V4 Flash facture 0,14 $ par million de jetons d'entrée non mis en cache, 0,28 $ par million de jetons de sortie, et seulement 0,0028 $ pour les entrées avec cache, un montant étonnamment bas.
Son économie provient de l'ensemble du système : un noyau MoE de 284B avec 13B de paramètres activés par jeton, une attention à contexte long compressé, des poids FP4/FP8, une fenêtre de contexte d'un million de jetons, des capacités de service efficaces, et le décodage spéculatif DSpark. La mise à jour 0731 conserve l'architecture d'aperçu et améliore le comportement de l'agent grâce à un nouveau post-entraînement.
La preuve officielle la plus solide réside dans l'amélioration des benchmarks. Terminal Bench 2.1 passe de 61,8 à 82,7, Toolathlon-Verified de 49,7 à 70,3, tandis que le modèle conserve son niveau de tarification Flash.
La force de V4 Flash ne réside pas dans le fait qu'il surpasse tout lors de toutes les comparaisons — mais dans son coût marginal extrêmement faible qui rend
possibles des expériences d'agent répétées, à une échelle que de nombreux modèles à tarification de pointe ne peuvent pas se permettre en pratique.



