Introduction
DeepSeek V4 Flash 0731 a suscité une combinaison inhabituelle de réactions.
Les développeurs sont impressionnés par ses scores en matière d'agents de codage.
Les équipes d'infrastructure s'intéressent à son contexte d'un million de jetons et à son faible nombre de paramètres actifs.
Les plateformes d'IA proposent une utilisation gratuite et des remises agressives.
Et les réseaux sociaux se remplissent de captures d'écran de prototypes dont les factures d'inférence rapportées se mesurent en centimes plutôt qu'en dollars.
Les exemples les plus largement partagés dans l'article source comprenaient :
- Un petit prototype de shooter spatial 3D aurait été généré pour environ 0,07 RMB.
- Un prototype de style Counter-Strike aurait été produit pour environ 0,50 RMB.
- Un tableau de bord d'utilisation personnelle affichant 87 millions de jetons pour 31,57 RMB.
- OpenCode signalant 8 billions de jetons DeepSeek Flash le 1er août.
- Cline augmentant son quota gratuit après avoir constaté que le modèle était moins cher à subventionner que prévu.
- Nous Portal offrant temporairement une remise de 90 % sur V4 Flash 0731.
Ces exemples capturent l'enthousiasme, mais ils peuvent aussi brouiller plusieurs choses distinctes :
- Le prix officiel de l'API DeepSeek.
- La tarification avec ou sans correspondance de cache.
- L'accès gratuit ou subventionné par des tiers.
- Le nombre d'appels d'outils effectués par un agent.
- La quantité de sortie et de raisonnement caché générée.
- Le coût du modèle seul par rapport au coût du produit complet.
Le modèle est véritablement peu coûteux.
Cela ne signifie pas que chaque application coûtera sept centimes.
La question utile n'est pas de savoir si une démo virale est exactement reproductible. C'est de savoir comment DeepSeek a réalisé un bond de capacité aussi important sans modifier l'architecture de base — et ce que la nouvelle économie signifie pour les développeurs.
Le cycle mondial des remises
Le prix officiel de l'API était déjà bas avant l'application des promotions tierces.
DeepSeek liste actuellement les prix suivants par million de jetons :
| Type d'utilisation | Prix DeepSeek V4 Flash |
|---|---|
| Entrée, correspondance de cache | $0,0028 |
| Entrée, absence de correspondance de cache | $0,14 |
| Sortie | $0,28 |
L'API prend en charge :
- Une fenêtre de contexte d'un million de jetons.
- Jusqu'à 384 000 jetons de sortie.
- Les modes de réflexion et de non-réflexion.
- Trois niveaux d'effort de raisonnement dans la fiche modèle 0731 :
low,highetmax. - Les appels d'outils.
- La sortie JSON.
- La complétion de préfixe de chat en version bêta.
- La complétion FIM en mode non-réflexion.
- Les Chat Completions compatibles OpenAI.
- L'API Responses.
- Une interface compatible Anthropic.
- Une limite de concurrence publiée de 2 500 par compte pour V4 Flash.
Ces prix officiels constituent la référence.
Les plateformes peuvent ensuite choisir de :
- Répercuter le prix tel quel.
- Ajouter une marge.
- Subventionner l'utilisation.
- Proposer un modèle gratuit limité.
- Regrouper le modèle dans un abonnement.
- Appliquer des crédits promotionnels.
- Acheminer le trafic via un autre fournisseur d'inférence.
C'est pourquoi un développeur peut payer le prix catalogue de DeepSeek tandis qu'un autre ne paie rien pendant une période limitée.
OpenCode signale huit billions de jetons en une seule journée
OpenCode a déclaré publiquement que DeepSeek Flash a traité 8 billions de jetons le 1er août via sa plateforme.
Le post décompose le chiffre comme suit :
5 T de jetons d'utilisation gratuite
+
3 T de jetons via OpenCode Go

La documentation Zen actuelle d’OpenCode répertorie une option DeepSeek V4 Flash Gratuit disponible pour une durée limitée.
C’est une distinction importante.
Le chiffre de huit billions de tokens décrit le trafic via OpenCode, et non l’utilisation directe rapportée par DeepSeek sur toutes les plateformes.
C’est néanmoins un signal fort que les modèles à faible coût peuvent générer une demande énorme lorsqu’ils sont intégrés dans un flux de travail d’agent de codage populaire.
Nous Portal réduit temporairement le prix de 90 %
Nous Research a annoncé une promotion de sept jours offrant DeepSeek V4 Flash 0731 à 90 % de réduction via Nous Portal, en partenariat avec Novita Labs.

Le message promotionnel a comparé le coût réduit avec Claude Fable 5 et a affirmé une différence de prix de plus de 1 000 fois sur des tâches comparables.
Cette comparaison dépend de plusieurs choix :
- Quel prix de fournisseur est utilisé.
- Si l’entrée ou la sortie domine.
- Si la mise en cache est disponible.
- Quel réglage de raisonnement est sélectionné.
- Combien de tokens chaque modèle nécessite pour terminer la tâche.
- Quel benchmark ou flux de travail définit « comparable ».
Une comparaison prix par token est utile, mais la mesure la plus significative est :
Coût total par tâche acceptée
Un modèle qui utilise moins de tokens coûteux peut être moins cher qu’un modèle à bas prix qui réessaie à plusieurs reprises.
À l’inverse, lorsqu’un modèle à bas prix est également suffisamment performant pour terminer la tâche rapidement, l’avantage de coût peut devenir énorme.
Cline triple son quota gratuit
Cline a d’abord annoncé une utilisation gratuite de V4 Flash 0731 via son agent de codage.
Un message public ultérieur a indiqué que le quota gratuit avait été triplé, car l’économie semblait durable.

Le catalogue de modèles actuel de Cline et le matériel ClinePass incluent DeepSeek V4 Flash comme option rapide et axée sur la valeur pour les tâches de codage ciblées.
Les quotas gratuits et la disponibilité des modèles peuvent changer, les utilisateurs doivent donc consulter la page du fournisseur en direct plutôt que de se fier à une ancienne capture d’écran.
La leçon plus large est plus durable.
Lorsque l’inférence devient suffisamment bon marché, une plateforme d’agents peut utiliser l’accès gratuit comme acquisition de clients sans absorber
le même coût qu'il aurait avec un modèle frontal premium.
Les captures d'écran des coûts communautaires nécessitent un contexte
L'article source comprend un tableau de bord montrant :
- 31,57 RMB de dépenses.
- 2 282 requêtes API.
- 87 027 995 jetons.

La capture d'écran est utile car elle démontre l'ordre de grandeur que les développeurs peuvent observer dans des schémas d'utilisation favorables.
Elle ne révèle pas suffisamment d'informations pour reconstruire la facture avec précision.
Les variables manquantes comprennent :
- Le ratio entre jetons d'entrée et de sortie.
- Le pourcentage de hits de cache.
- La version du modèle utilisée à chaque date.
- L'effort de raisonnement.
- Le nombre d'appels d'outils.
- Les requêtes échouées.
- Les crédits promotionnels.
- Les remises du fournisseur.
- Si tous les jetons étaient facturables au même tarif.
Une longue invite système répétée peut être extrêmement bon marché lorsqu'elle touche le cache.
Une longue invite unique envoyée une seule fois est facturée au prix d'entrée sans hit de cache.
La sortie est également beaucoup plus coûteuse que l'entrée en cache.
Pour les systèmes d'agents, ces différences dominent la facture finale.
Flash Blitz : Ce qui a changé le 31 juillet
DeepSeek V4 Preview a été lancé le 24 avril 2026.
La famille comprenait :
- DeepSeek V4 Pro.
- DeepSeek V4 Flash.
La version Preview a établi l'architecture principale :
- Mélange d'experts éparse.
- Contexte d'un million de jetons.
- Attention efficace sur les contextes longs.
- Faibles nombres de paramètres activés par rapport à la capacité totale.
- Modes de réflexion et de non-réflexion.
- Poids ouverts sous licence MIT.
V4 Flash Preview a été positionné comme l'alternative plus petite, plus rapide et moins chère à V4 Pro.
La mise à jour du 31 juillet a changé sa position concurrentielle.
DeepSeek déclare que V4 Flash 0731 utilise la même architecture et la même taille de modèle que V4 Flash Preview.
La mise à jour a été produite en exécutant un nouveau processus de post-entraînement.
Sous forme simplifiée :
Même architecture de base pré-entraînée
+
nouveau post-entraînement et optimisation d'agent
=
comportement d'agent de codage beaucoup plus fort
Cela importe car cela montre combien de capacité peut rester latente dans un modèle pré-entraîné.
L'architecture et le nombre de paramètres ne constituent pas l'intégralité du produit.
Le post-entraînement détermine l'efficacité avec laquelle le modèle :
- Utilise les outils.
- Planifie un travail en plusieurs étapes.
- Gère les retours du terminal.
- Se remet des erreurs.
- Écrit et modifie des fichiers.
- Suit un protocole d'agent.
- Répartit l'effort de raisonnement.
- Fonctionne dans un cadre d'exécution.
Architecture de base et détails des points de contrôle
La fiche modèle originale de V4 Flash décrit le modèle de base comme suit :
| Spécification | DeepSeek V4 Flash |
|---|---|
| Paramètres MoE de base totaux | 284B |
| Paramètres activés | 13B |
| Longueur du contexte | 1M |
| Licence | MIT |
| Modalité principale | Texte |
| Précision de base | FP8 / précision mixte faible selon le point de contrôle |
La fiche modèle 0731 indique que la nouvelle version a la même structure que la variante DSpark et comprend un module de décodage spéculatif attaché.
Cela explique pourquoi certaines métadonnées de fichiers de modèle peuvent afficher
un nombre total de points de contrôle plus important que le chiffre de 284B du MoE de base.
La description la plus claire est :
Le modèle MoE sous-jacent de V4 Flash reste d’environ 284B au total avec 13B paramètres actifs, tandis que la version 0731 inclut le composant supplémentaire de décodage spéculatif DSpark dans le point de contrôle publié.
Décodage spéculatif DSpark
Le décodage spéculatif utilise un processus de rédaction rapide pour proposer plusieurs jetons futurs.
Le modèle principal vérifie ensuite ces propositions.
Lorsque les prédictions sont acceptées, le système peut produire plusieurs jetons avec moins de travail séquentiel.
La fiche du modèle 0731 de DeepSeek fournit un support explicite de DSpark pour vLLM et SGLang.
Pour vLLM, la configuration pertinente est :
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Pour SGLang, la fiche du modèle utilise :
--speculative-algorithm DSPARK
DSpark n’améliore pas en soi le raisonnement du modèle.
Il s’agit d’une optimisation d’inférence destinée à réduire la latence de décodage ou à augmenter le débit tout en préservant la distribution de sortie du modèle cible dans la configuration prise en charge.
Le bond des benchmarks
DeepSeek publie la comparaison suivante pour V4 Flash 0731 :
| Benchmark | V4 Flash 0731 | V4 Flash Preview | V4 Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82,7 | 61,8 | 72,1 |
| NL2Repo | 54,2 | 39,4 | 38,5 |
| CyberGym | 76,7 | 38,7 | 52,7 |
| DeepSWE | 54,4 | 7,3 | 12,8 |
| Toolathlon-Verified | 70,3 | 49,7 | 55,9 |
| Agents’ Last Exam | 25,2 | 15,8 | 16,5 |
| AutomationBench Public | 25,1 | 10,8 | 12,8 |
| DSBench-FullStack | 68,7 | 37,0 | 41,8 |
| DSBench-Hard | 59,6 | 25,8 | 31,1 |
L’augmentation la plus spectaculaire est DeepSWE :
7,3 → 54,4
CyberGym double presque :
38,7 → 76,7
Terminal Bench 2.1 augmente de plus de vingt points :
61,8 → 82,7
Le nouveau modèle Flash dépasse également V4 Pro Preview sur tous les benchmarks du tableau publié par DeepSeek.
C’est un changement majeur pour un modèle initialement positionné principalement comme l’option moins chère et plus rapide.
La méthodologie des benchmarks est importante
Le tableau ne doit pas être lu comme une pure comparaison des points de contrôle bruts.
La fiche du modèle de DeepSeek comprend plusieurs notes importantes.
Pour les tâches publiques d’agents de code, l’entreprise a utilisé :
DeepSeek Harness mode minimal
Effort de raisonnement : max
Température : 1,0
Top-p : 0,95
DeepSeek Harness n’avait pas été publié publiquement au moment de la vérification.
Cela signifie que les chercheurs extérieurs ne peuvent pas encore reproduire l’environnement logiciel exact utilisé pour les résultats publiés des agents de code.
Deux tests sont également internes :
- DSBench-FullStack.
- DSBench-Hard.
Les benchmarks internes peuvent être utiles pour le développement de produits, mais les équipes indépendantes ne peuvent pas inspecter leurs tâches cachées ni leurs contrôles de contamination.
L’interprétation correcte est la suivante :
DeepSeek rapporte une grande amélioration dans sa pile d’agents et sa configuration d’évaluation choisies. La reproductibilité publique s’améliorera lorsque le harness, les prompts, les journaux et la configuration complète d’évaluation seront disponibles.
La qualité du harness peut changer le score
Un benchmark de codage mesure souvent un système complet :
Modèle
+
prompt système
+
outils de dépôt
+
terminal
exécution
+
gestion du contexte
+
politique de nouvelle tentative
+
retour de test
+
logique de soumission de patch
Le même modèle peut obtenir des scores différents lorsqu'un seul composant change.
Un meilleur harnais peut :
- Sélectionner des fichiers plus pertinents.
- Préserver les sorties de terminal utiles.
- Empêcher le débordement du contexte.
- Relancer intelligemment les commandes ayant échoué.
- Interrompre les boucles improductives.
- Appliquer les patchs de manière plus fiable.
- Donner au modèle des résultats de test plus clairs.
Cela ne rend pas le modèle inutile.
Cela signifie que le résultat du benchmark appartient à la combinaison modèle-et-harnais.
Les chiffres élevés de 0731 suggèrent que DeepSeek a amélioré à la fois le comportement d'agent du modèle et le processus d'évaluation environnant.
Artificial Analysis lui attribue un score de 50
Artificial Analysis rapporte un score d'indice d'intelligence d'environ 50 pour DeepSeek V4 Flash 0731, soit environ dix points de plus que la version Flash précédente.
La société indépendante d'analyse des modèles décrit également V4 Flash comme exceptionnellement peu coûteuse par rapport à d'autres systèmes frontaliers bien connus.
Reuters a résumé les conclusions d'Artificial Analysis en rapportant un coût moyen de test de référence d'environ trois cents américains selon sa méthodologie.
Cette comparaison soutient l'argument de la valeur.
Cela ne signifie pas que chaque tâche de production coûte trois cents.
Artificial Analysis rapporte également des résultats plus faibles sur certaines mesures de fiabilité des connaissances.
Son article sur V4 Flash 0731 note :
- La précision omniscience est restée autour de 37 %.
- Le taux d'hallucinations a baissé mais est resté élevé, à environ 84 % selon cette évaluation.
Ces chiffres sont un rappel utile.
Un modèle peut être :
- Très performant pour les agents de codage.
- Extrêmement bon marché.
- Compétitif sur un indice composite.
- Toujours peu fiable sur certaines questions factuelles en environnement ouvert.
« Meilleure valeur » n'est pas la même chose que « meilleur pour chaque tâche ».
Tarification officielle de l'API
Le prix direct de l'API DeepSeek est :
| Catégorie de facturation | Prix par million de jetons |
|---|---|
| Entrée avec cache atteint | 0,0028 $ |
| Entrée sans cache | 0,14 $ |
| Sortie | 0,28 $ |
L'écart de prix entre un cache atteint et un cache manqué est énorme :
0,14 $ ÷ 0,0028 $ = 50
L'entrée en cache est cinquante fois moins chère que l'entrée non mise en cache.
Pour les agents de longue durée, la structure du prompt devient une architecture de coûts.
Exemple de calcul des coûts
Supposons qu'une requête utilise :
100 000 jetons d'entrée sans cache
20 000 jetons de sortie
Le coût direct du modèle est :
Entrée :
100 000 / 1 000 000 × 0,14 $
= 0,014 $
Sortie :
20 000 / 1 000 000 × 0,28 $
= 0,0056 $
Total :
0,0196 $
Cela représente moins de deux cents américains.
Supposons maintenant que le même préfixe de 100 000 jetons soit mis en cache :
Entrée en cache :
100 000 / 1 000 000 × 0,0028 $
= 0,00028 $
Sortie :
20 000 / 1 000 000 × 0,28 $
= 0,0056 $
Total :
0,00588 $
La sortie domine désormais la facture.
Ces exemples expliquent pourquoi les prototypes de codage à faible coût sont plausibles.
Ils n'incluent pas :
- La marge du fournisseur.
- Les frais d'API des outils.
- Les coûts de navigateur ou de recherche.
- Le calcul en bac à sable.
- Le stockage.
- Les tentatives infructueuses répétées.
- Le temps de développement humain.
Pourquoi les factures d'agents peuvent encore augmenter
Le codage par agent est rarement une seule requête.
Un flux de travail typique peut inclure :
- Lire le dépôt.
- Rechercher le code pertinent.
- Planifier la modification.
- Modifier plusieurs fichiers.
- Exécuter les tests.
- Inspecter le
échec.
7. Modifiez à nouveau.
8. Exécutez à nouveau les tests.
9. Examinez la différence.
10. Produisez la réponse finale.
Chaque étape peut générer un nouvel appel au modèle.
Une tâche apparemment simple peut devenir coûteuse lorsque :
- Le contexte du dépôt est rechargé à plusieurs reprises sans cache.
- Le modèle génère de longs raisonnements.
- Les tests échouent de nombreuses fois.
- L’agent lit inutilement de grands fichiers.
- Plusieurs agents parallèles dupliquent le travail.
- La compaction du contexte provoque le renvoi d’informations importantes.
- Le modèle ne s’arrête pas après avoir atteint une bonne solution.
V4 Flash réduit le coût de ces erreurs.
Il ne les élimine pas.
La mise en cache du contexte constitue le principal levier de coût
DeepSeek utilise une mise en cache du contexte basée sur le disque.
Lorsque le même préfixe est réutilisé, les jetons d’entrée correspondants peuvent bénéficier du prix réduit applicable aux accès au cache.
De bons candidats pour un préfixe stable incluent :
- Les instructions système.
- Les politiques du dépôt.
- Les définitions d’outils.
- Les longs documents de référence.
- Un instantané du projet inchangé.
- Le contexte d’entreprise répété.
Une conception d’invite simplifiée est :
Préfixe stable réutilisable
+
nouvelle demande utilisateur
+
dernier résultat d’outil
Une conception moins favorable à la mise en cache est :
Instructions réordonnées
+
résumé du dépôt réécrit
+
horodatages changeants
+
métadonnées de requête aléatoires
+
nouvelle demande utilisateur
De petits changements dans le préfixe peuvent réduire la réutilisation du cache.
Les développeurs doivent inspecter les champs d’utilisation des jetons plutôt que de supposer qu’une longue invite a été mise en cache.
DeepSeek propose également l’isolation par user_id pour la confidentialité et l’ordonnancement. La réutilisation du cache et l’isolation des utilisateurs doivent être conçues ensemble afin que le contexte d’un client ne soit pas accidentellement mélangé à celui d’un autre.
Démarrage rapide avec l’API
L’URL de base officielle reste :
https://api.deepseek.com
L’identifiant du modèle est :
deepseek-v4-flash
DeepSeek indique que l’identifiant API stable sert automatiquement la dernière version officielle de Flash.
C’est pratique, mais les équipes de production doivent enregistrer l’empreinte du modèle renvoyée et tester les modifications, car le comportement derrière un identifiant stable peut être mis à niveau.
Exemple en Python
from openai import OpenAI
client = OpenAI(
api_key="VOTRE_CLÉ_API_DEEPSEEK",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Examinez cette fonction et proposez une refactorisation sûre.",
}
],
)
print(response.choices[0].message.content)
Exemple avec cURL
Creez un site vitrine et genere des leads en quelques minutes
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "user",
"content": "Écrivez un petit CLI Python qui valide des fichiers JSON."
}
]
}'
Les développeurs doivent consulter la référence API en direct pour connaître les champs exacts d’effort de raisonnement et de mode de réflexion pris en charge par leur point de terminaison et leur version du SDK.
L’historique de réflexion doit être préservé
La documentation du mode de réflexion de DeepSeek indique que lorsqu’un tour inclut des appels d’outils, le reasoning_content du message de l’assistant doit être renvoyé dans les requêtes suivantes.
Un agent multitour doit conserver :
content
reasoning_content
tool_calls
L'abandon de l'état de raisonnement peut réduire la continuité ou provoquer des problèmes de validation des requêtes.
C'est particulièrement pertinent lors de l'intégration via un client compatible OpenAI qui ignore normalement les champs de raisonnement spécifiques au fournisseur.
Compatibilité OpenAI, Anthropic et Responses
DeepSeek fournit plus d'une interface.
OpenAI Chat Completions
Utilisez l'URL de base standard DeepSeek et l'ID du modèle :
deepseek-v4-flash
API compatible Anthropic
DeepSeek documente également une interface au format Anthropic.
Cela peut aider les logiciels conçus autour des messages de style Claude à se connecter à DeepSeek avec moins de modifications applicatives.
La compatibilité ne garantit pas un comportement identique.
Les champs spécifiques au fournisseur, l'historique de raisonnement, les schémas d'outils, le comportement de sécurité et la gestion des erreurs nécessitent toujours des tests.
API Responses
DeepSeek indique que la version 0731 prend nativement en charge le format de l'API Responses et a été adaptée pour une utilisation de type Codex.
Cela importe pour les produits d'agents de codage qui dépendent de plus en plus d'objets de réponse avec état, d'appels d'outils et de boucles d'agents structurées.
Poids ouverts sous licence MIT
DeepSeek a publié les poids de V4 Flash 0731 sur Hugging Face sous licence MIT.
Cela permet aux développeurs d'inspecter, de modifier, de déployer et de redistribuer le modèle conformément aux termes de la licence.
La publication des poids ouverts offre plus de contrôle qu'un modèle accessible uniquement par API.
Les équipes peuvent :
- Exécuter le modèle sur une infrastructure privée.
- Étudier son architecture.
- Créer des variantes quantifiées.
- Adapter les noyaux d'inférence.
- L'affiner ou le spécialiser.
- L'intégrer dans des systèmes internes.
- Éviter d'envoyer du code sensible à une API tierce.
La barrière pratique est le matériel.
« Poids ouverts » ne signifie pas « fonctionne sur un ordinateur portable standard ».
Déploiement avec vLLM
La fiche modèle officielle 0731 fournit un exemple vLLM pour un seul nœud 4×GB300 :
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code \
--kv-cache-dtype fp8 \
--block-size 256 \
--data-parallel-size 4 \
--enable-expert-parallel \
--moe-backend deep_gemm_mega_moe \
--attention-config '{"use_fp4_indexer_cache": true}' \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Cet exemple illustre la classe d'infrastructure attendue pour un service de pleine qualité.
Il ne doit pas être interprété comme la seule configuration prise en charge.
La recette vLLM pourrait ajouter la prise en charge d'autres topologies GPU au fil du temps.
Déploiement avec SGLang
L'exemple officiel SGLang est :
sglang serve \
--trust-remote-code \
--model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
--tp 4 \
--moe-runner-backend flashinfer_mxfp4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.90 \
--chunked-prefill-size 4096 \
--swa-full-tokens-ratio 0.1
Les poids cibles et de brouillon proviennent du même point de contrôle, donc la documentation indique de ne pas définir de chemin séparé pour le modèle de brouillon spéculatif.
Les moteurs d'inférence évoluent rapidement.
Utilisez la fiche modèle actuelle et la recette du moteur de service plutôt que de copier une ancienne commande de lancement de la version Preview.
Le déploiement local reste un projet d'infrastructure
Même si seulement environ
13B paramètres sont actifs pour un jeton, les poids complets du modèle doivent rester disponibles sur l’ensemble du système de service.
La planification du déploiement doit prendre en compte :
- Stockage total du modèle.
- Mémoire GPU.
- Parallélisme des experts.
- Bande passante d’interconnexion.
- Cache KV pour contexte long.
- Prise en charge de la quantification.
- Noyaux DSpark.
- Taille de lot.
- Concurrence.
- Latence de préremplissage.
- Débit de décodage.
Des quantifications plus petites peuvent permettre des expérimentations sur différents matériels, mais elles peuvent modifier la qualité, la vitesse ou la longueur de contexte prise en charge.
Pour la plupart des développeurs individuels, l’API directe ou un fournisseur hébergé sera plus facile et moins coûteux que l’auto-hébergement.
API officielle versus fournisseurs tiers
Il existe trois façons courantes d’utiliser V4 Flash.
| Route | Principal avantage | Principal compromis |
|---|---|---|
| API DeepSeek | Tarification officielle et modèle officiel actuel | Les données quittent votre environnement ; l’ID stable peut être mis à jour |
| Plateforme tierce | Quotas gratuits, agents intégrés, facturation simplifiée | Les promotions et le routage peuvent changer |
| Poids auto-hébergés | Contrôle maximal et confidentialité | Exigences matérielles et techniques importantes |
La route la moins chère dépend de la charge de travail.
Un quota gratuit de Cline ou OpenCode peut être idéal pour l’expérimentation.
L’API directe peut être idéale pour une utilisation à petite échelle prévisible.
L’auto-hébergement peut devenir attrayant uniquement à un volume soutenu suffisamment élevé ou lorsque les exigences de confidentialité dominent.
La meilleure ère pour le prototypage
L’article source compare l’IA peu coûteuse à la production de masse des automobiles.
L’analogie est imparfaite mais utile.
Lorsqu’une technologie devient nettement moins chère, le marché n’achète pas simplement la même quantité pour moins cher.
De nouvelles utilisations deviennent possibles.
Des modèles d’agents à faible coût peuvent soutenir des expériences qui auraient auparavant été rejetées avant même d’être testées.
Les exemples incluent :
- Un étudiant créant un premier prototype logiciel.
- Un fondateur solo générant et testant plusieurs idées de pages d’atterrissage.
- Une petite équipe effectuant une revue de code sur chaque demande d’extraction.
- Un projet open source offrant un tri gratuit des problèmes.
- Un chercheur traitant une grande collection de code ou de documents.
- Une entreprise créant des agents internes pour des tâches répétitives.
- Un développeur de jeux testant des mécaniques et des niveaux générés.
La valeur n’est pas que le modèle remplace tout le génie logiciel.
Elle réduit le coût de la question :
Cette idée vaut-elle la peine d’être développée davantage ?
Un prototype n’est pas un produit
La génération peu coûteuse peut produire une première démo convaincante.
Un produit en production nécessite toujours :
- Conception du produit.
- Sécurité.
- Tests.
- Accessibilité.
- Performances.
- Surveillance.
- Déploiement.
- Protection des données.
- Examen juridique.
- Maintenance.
- Support client.
Une facture de modèle de sept cents ne signifie pas une entreprise de sept cents.
Cela signifie que la première expérience computationnelle peut être assez peu coûteuse pour être tentée.
Cela change qui peut participer et combien d’idées peuvent être testées.
Un exemple d’espace de travail construit par la communauté
L’article source inclut un espace de travail documentaire léger présenté comme un exemple de ce que les développeurs construisaient avec des agents de codage peu coûteux.

Une capture d'écran ne peut pas établir quelle partie de l'application a été produite par le modèle, quelle quantité de modification humaine a été nécessaire, ni si le produit est sécurisé et maintenable.
Elle montre néanmoins le type de projet que les modèles de codage à faible coût rendent plus facile à prototyper.
Où V4 Flash s'intègre le mieux
V4 Flash 0731 est particulièrement intéressant lorsque :
- La tâche est fortement axée sur le code ou les outils.
- Le coût est un facteur important.
- Un grand contexte est utile.
- Un volume de requêtes élevé est attendu.
- Le flux de travail peut valider les résultats.
- Des tentatives occasionnelles sont acceptables.
- Un modèle de secours plus puissant est disponible pour les cas difficiles.
Il peut être moins adapté lorsque :
- La précision factuelle en monde ouvert est critique.
- Une première réponse soignée prime sur le coût.
- La tâche nécessite la compréhension d'images.
- L'organisation ne peut pas valider le code généré.
- Une garantie de conformité gérée est requise.
- Le flux de travail dépend d'un comportement d'API stable et épinglé à une version.
Un routeur de modèles peut combiner Flash avec un système plus puissant ou plus spécialisé.
Par exemple :
Modifications de routine du référentiel
→ V4 Flash
Décisions d'architecture ou de sécurité à haut risque
→ modèle plus puissant + examen humain
Les modèles bon marché changent l'architecture des agents
Lorsque les appels de modèles sont coûteux, les développeurs essaient de minimiser chaque requête.
Lorsque les appels deviennent bon marché, un agent peut se permettre de :
- Demander à un autre modèle de réviser le correctif.
- Exécuter une passe d'analyse de test séparée.
- Générer plusieurs solutions candidates.
- Comparer des implémentations alternatives.
- Utiliser un modèle pour la planification et un autre pour l'exécution.
- Revérifier son travail avant soumission.
Cela peut améliorer la fiabilité.
Cela peut aussi gaspiller des jetons.
L'objectif n'est pas une utilisation minimale de jetons.
C'est :
Le coût total le plus bas qui atteint la qualité requise
Les principaux risques derrière l'histoire des prix
- La version bêta publique peut changer
DeepSeek décrit l'API Flash officielle comme une version bêta publique.
Les prix, le comportement, les limites et les versions du modèle peuvent changer.
Les équipes de production devraient maintenir des tests de régression.
- Les scores de référence dépendent du harnais DeepSeek
Les meilleurs résultats d'agents de codage utilisent une configuration de harnais non publiée.
Une reproduction indépendante exacte n'est pas encore simple.
- Une entrée bon marché ne garantit pas un agent bon marché
La sortie, les tentatives, les outils et le contexte non mis en cache peuvent dominer le coût final.
- Le contexte long n'est pas gratuit
Une fenêtre d'un million de jetons est une limite de capacité, pas une recommandation d'envoyer un million de jetons dans chaque requête.
Les charges de pré-remplissage importantes augmentent la latence et le coût.
- La fiabilité en monde ouvert nécessite encore du travail
L'évaluation indépendante montre que la valeur et la force du codage peuvent coexister avec un taux d'hallucination élevé lors des tests factuels.
Les faits critiques doivent être vérifiés par rapport aux sources.
- Le code généré nécessite une révision
Les modèles à faible coût peuvent générer plus de code qu'une équipe ne peut en inspecter en toute sécurité.
Les tests automatisés, l'analyse statique, l'analyse des dépendances et la révision humaine restent nécessaires.
- L'accès promotionnel est temporaire
Les modèles gratuits et les remises de tiers peuvent disparaître.
Ne construisez pas un modèle économique permanent autour d'une subvention de sept jours ou à durée limitée.
- Des identifiants d'API stables peuvent masquer des mises à niveau
L'identifiant de modèle deepseek-v4-flash pointe vers la version actuelle.
Une mise à niveau derrière cet identifiant peut modifier les sorties sans changement de code dans votre application.
Liste de contrôle pratique pour maîtriser les coûts
- Stabiliser les préfixes réutilisables
Maintenez la cohérence des instructions système et des définitions d'outils pour améliorer la réutilisation du cache.
- Suivre séparément les jetons de cache atteints
Ne vous fiez pas uniquement au nombre total de jetons d'entrée.
- Limiter les sorties inutiles
Définissez un budget de sortie réaliste pour la tâche.
- Utiliser un effort de raisonnement plus faible pour les tâches courantes
Réservez max aux tâches qui bénéficient d'une réflexion plus longue.
- Plafonner les étapes de l'agent
Arrêtez les boucles qui ne progressent pas.
- Exécuter une validation peu coûteuse avant un autre appel de modèle
Utilisez des linters, des tests, des validateurs de schéma et des contrôles déterministes.
- Acheminer les cas difficiles
Faites remonter uniquement lorsque la tâche échoue à un test ou dépasse un seuil de risque.
- Mesurer le coût par résultat accepté
Incluez les tentatives échouées et la vérification humaine.
Encore une chose : DeepSeek Harness
L'article source se termine par une possible prochaine étape dans l'écosystème de développement de DeepSeek.
Tianyi Cui, identifié dans la source comme la personne responsable de DeepSeek Harness, a publié un message de recrutement pour des développeurs de projets open source de type harness pour agents.
Le message invitait les développeurs intéressés à partager un compte GitHub et des travaux open source représentatifs pour participer aux tests internes.

Le journal des modifications du 31 juillet de DeepSeek indique également que le mode minimal de DeepSeek Harness utilisé pour l'évaluation des benchmarks est « à venir prochainement ».
Au moment de la vérification, je n'ai pas localisé :
- Un dépôt public officiel pour DeepSeek Harness.
- Une page produit stable pour « DeepSeek Code ».
- Des instructions d'installation publiques.
- Une tarification.
- Une date de sortie.
- Une spécification complète des fonctionnalités.
Les éléments disponibles confirment cette conclusion plus restreinte :
DeepSeek teste un harness pour agents et prévoit de publier au moins une partie du framework, mais le nom final du produit, la portée publique et le calendrier de lancement restent non confirmés.
Le modèle, l'API et les poids ouverts sont disponibles dès maintenant.
Le harness reste un composant futur de l'écosystème.
Pourquoi un DeepSeek Harness pourrait être important
Un harness de première partie pourrait aider DeepSeek à contrôler toute la pile des agents de codage.
Il pourrait fournir :
- Une gestion native de l'historique de raisonnement.
- Des formats de prompt spécifiques au modèle.
- L'analyse des appels d'outils.
- La gestion du contexte.
- La recherche dans les dépôts.
- L'exécution en terminal.
- La reproductibilité des benchmarks.
- L'intégration de l'API Responses.
- Des flux de travail compatibles Codex.
- Des contrôles de coûts.
- Un routage automatique entre Flash et Pro.
DeepSeek documente déjà des intégrations avec des harness et des agents de codage externes.
Un outil interne pourrait transformer les optimisations spécifiques aux benchmarks en un produit utilisable par les développeurs ordinaires.
Il pourrait également révéler quelle part de l’amélioration des benchmarks de V4 Flash 0731 provient du checkpoint et quelle part provient de l’environnement d’exécution de l’agent.
À surveiller ensuite
Plusieurs évolutions détermineront si le moment V4 Flash devient un changement durable de l’écosystème.
Sortie officielle de V4 Pro
DeepSeek indique que la sortie officielle de V4 Pro suivra la mise à jour Flash.
L’écart de performance et de prix entre Pro et Flash influencera les décisions de routage.
Disponibilité de DeepSeek Harness
Une version publique améliorerait la reproductibilité des benchmarks et fournirait aux développeurs un framework agent natif au modèle.
Stabilité des prix
Le prix direct est déjà bas, mais les promotions de tiers pourraient ne pas durer.
Capacité des fournisseurs
Une inférence bon marché attire un trafic très élevé.
La latence, les limites de débit et la fiabilité compteront à mesure que l’utilisation évolue.
Prise en charge de l’inférence open source
vLLM, SGLang, les fournisseurs de matériel et les projets de quantification détermineront l’accessibilité de l’auto-hébergement.
Évaluations indépendantes
Davantage d’évaluations publiques devraient tester :
- Le codage.
- La sécurité.
- La fiabilité factuelle.
- Le contexte long.
- L’utilisation d’outils.
- Le coût par tâche réussie.
- Les performances sous différents environnements.
Questions fréquentes
Qu’est-ce que DeepSeek V4 Flash 0731 ?
DeepSeek V4 Flash 0731 est la version officielle du 31 juillet de V4 Flash, actuellement servie via l’API deepseek-v4-flash en version bêta publique. DeepSeek indique qu’elle conserve l’architecture et la taille de base du modèle Preview tout en améliorant considérablement les capacités d’agent grâce à un nouveau post-entraînement.
Combien coûte DeepSeek V4 Flash ?
L’API officielle de DeepSeek liste 0,14 $ par million de jetons d’entrée avec échec de cache, 0,0028 $ par million de jetons d’entrée avec succès de cache, et 0,28 $ par million de jetons de sortie. Les plateformes tierces peuvent proposer des prix différents, des quotas gratuits ou des réductions temporaires.
Un jeu 3D coûte-t-il vraiment seulement 0,07 RMB à générer ?
L’article source cite un exemple communautaire avec ce coût de modèle signalé. L’exemple n’est pas accompagné de prompts complets, de journaux de jetons, de données de cache, de nouvelles tentatives, de coûts d’outils ou d’enregistrements de travail humain, il doit donc être considéré comme une anecdote plutôt qu’un budget garanti.
Quels sont les principaux scores de benchmark de V4 Flash 0731 ?
DeepSeek rapporte 82,7 sur Terminal Bench 2.1, 76,7 sur CyberGym, 54,4 sur DeepSWE, 70,3 sur Toolathlon-Verified et 54,2 sur NL2Repo. Les évaluations publiques d’agents de code ont utilisé le mode minimal non publié de DeepSeek Harness avec un effort de raisonnement maximal.
DeepSeek V4 Flash 0731 est-il open source ?
Les poids du modèle et le dépôt sont publiés sous licence MIT, donc « poids ouverts » et « utilisation largement permissive » sont des descriptions exactes. L’exécution complète du checkpoint nécessite toujours une infrastructure multi-GPU substantielle.
DeepSeek V4 Flash peut-il fonctionner localement ?
Oui, DeepSeek publie les poids et les instructions de service pour vLLM et SGLang. Les exemples officiels à grande échelle utilisent du matériel multi-GPU avancé, donc un ordinateur portable normal n’est pas l’environnement cible pour le modèle complet.
Quelle est la fenêtre de contexte ?
L’API officielle et la fiche du modèle spécifient une fenêtre de contexte de 1 million de jetons. L’API liste également une
longueur de sortie maximale de 384 000 jetons, mais l'utilisation du contexte ou de la sortie maximaux peut considérablement augmenter la latence et l'utilisation des ressources.
Le code DeepSeek ou le harnais DeepSeek a-t-il été publié ?
DeepSeek a publiquement mentionné un mode minimal du harnais et a recruté des développeurs open source de harnais pour des tests internes. Un dépôt public complet, une spécification finale du produit et une date de sortie confirmée n'ont pas été trouvés lors de la vérification.
Outils associés
- API DeepSeek : La plateforme officielle pour les clés API, la facturation et l'accès direct aux modèles DeepSeek.
- DeepSeek V4 Flash 0731 sur Hugging Face : Point de contrôle officiel à poids ouverts, fiche modèle, tableau de référence, licence et instructions de déploiement.
- vLLM : Moteur de service open source à haut débit prenant en charge DeepSeek V4 et DSpark.
- SGLang : Cadre de service open source avec un chemin de déploiement publié pour V4 Flash 0731.
- OpenCode : Agent de codage open source dont le service Zen propose actuellement une option V4 Flash gratuite à durée limitée.
- Cline : Agent de codage open source et plateforme de modèles qui propose DeepSeek V4 Flash via son écosystème de fournisseurs.
- Portail Nous : Plateforme d'inférence multi-modèles qui a mené une promotion limitée de DeepSeek V4 Flash.
- Artificial Analysis : Plateforme indépendante d'analyse de modèles couvrant l'intelligence, la vitesse, le prix et le coût de référence.
Liens connexes
- Journal des modifications DeepSeek du 31 juillet : Statut de publication officiel, résultats de référence, notes méthodologiques, portée de l'API et déclaration post-entraînement.
- Modèles et tarification DeepSeek : Prix officiels actuels, longueur du contexte, limite de sortie, fonctionnalités et concurrence.
- Fiche modèle DeepSeek V4 Flash 0731 : Notes d'architecture, comparaison de référence, niveaux d'effort de raisonnement, configuration DSpark et licence MIT.
- Fiche technique du modèle DeepSeek V4 : Architecture V4 d'origine, nombre de paramètres, rapport technique et évaluation de la famille de modèles.
- Guide du mode réflexion DeepSeek : Orientation officielle pour la sortie de raisonnement et la préservation de
reasoning_contentlors des appels d'outils. - Intégrations d'agents DeepSeek : Exemple officiel pour connecter V4 Flash à un harnais de codage en terminal.
- Modèles OpenCode Zen : Catalogue de modèles actuel et informations sur les modèles gratuits à durée limitée.
- Évaluation Artificial Analysis V4 Flash 0731 : Score composite indépendant, prix, évaluation de l'agent et observations sur la fiabilité.
Résumé
DeepSeek V4 Flash 0731 conserve la base du modèle Preview.
Architecture et taille, mais utilise un nouveau post-entraînement pour produire une forte progression des performances des agents de codage. DeepSeek rapporte 82,7 sur Terminal Bench 2.1, 76,7 sur CyberGym et 54,4 sur DeepSWE, bien que les meilleurs résultats publics d'agents de codage dépendent d'une configuration DeepSeek Harness non publiée.
Le prix officiel de l'API est exceptionnellement bas : 0,14 $ par million de jetons d'entrée non mis en cache, 0,0028 $ par million de jetons d'entrée mis en cache et 0,28 $ par million de jetons de sortie. Les quotas gratuits et les réductions de tiers peuvent rendre l'accès encore moins cher, mais ces promotions sont temporaires et ne doivent pas être confondues avec le prix catalogue permanent.
La publication open-weight sous licence MIT, le contexte d'un million de jetons, les API compatibles Responses et Anthropic, ainsi que la prise en charge dans vLLM et SGLang rendent le modèle accessible via des voies hébergées et auto-gérées. Le déploiement local complet reste un projet d'infrastructure multi-GPU sérieux.
Les prototypes viraux à sept et cinquante cents sont des exemples plausibles de la faiblesse possible de la facture marginale du modèle, mais ils ne constituent pas des études complètes de coût produit. Les boucles d'agents, la longueur de sortie, les échecs de cache, les outils, les tests et le travail humain comptent toujours.
DeepSeek V4 Flash 0731 est important non pas parce que chaque application coûte désormais quelques centimes, mais parce que le codage agentique performant est devenu suffisamment abordable pour que beaucoup plus de développeurs puissent expérimenter à une échelle significative.



