DeepSeek V4 Flash 0731 以低 API 价格、百万 Token 上下文和较低激活参数引发价格竞争。本文从 0.07 元原型、缓存计费、第三方补贴和完整应用成本区分真实经济性。

DeepSeek V4 Flash 0731引发了一系列不同寻常的反应。
开发者对其编程智能体得分印象深刻。
基础设施团队对其100万token上下文和低激活参数数量感兴趣。
AI平台正在提供免费使用和激进折扣。
社交媒体上充斥着原型产品的截图,据报道其推理账单以美分而非美元计算。
源文章中最广泛分享的示例包括:
这些示例激发了热情,但也可能模糊了几个不同方面:
该模型确实非常便宜。
但这并不意味着每个应用都只需七分钱。
有意义的问题不在于某个爆款演示能否被精确复现,而在于DeepSeek如何在不改变基础架构的情况下实现了如此巨大的能力飞跃——以及新的经济模式对开发者意味着什么。
在第三方促销活动之前,官方API价格已经很低。
DeepSeek目前公布的每百万token价格如下:
| 使用类型 | DeepSeek V4 Flash价格 |
|---|---|
| 输入,缓存命中 | $0.0028 |
| 输入,缓存未命中 | $0.14 |
| 输出 | $0.28 |
该API支持:
low、high和max。这些官方价格是基准线。
平台随后可以选择:
这就是为什么一位开发者可能支付DeepSeek的标价,而另一位开发者可在限期内免费使用。
OpenCode公开表示,8月1日通过其平台处理了8万亿个DeepSeek Flash token。
该帖子将数据分解为:
5万亿token免费使用
+
3万亿token通过OpenCode Go
OpenCode在8月3日的推文中显示
DeepSeek Flash 于 8 月 1 日处理了 8 万亿个令牌——其中 5 万亿为免费,3 万亿通过 OpenCode Go 完成。该推文是对这些数字的官方声明,分解了免费与付费使用情况,并提供了有关 DeepSeek Flash 令牌处理量的支持背景。
OpenCode 当前的 Zen 文档中列出了一个限时提供的 DeepSeek V4 Flash 免费 选项。
这是一个重要的区别。
8 万亿令牌这一数字描述的是通过 OpenCode 的流量,而非 DeepSeek 在各平台直接上报的使用量。
这仍然是一个强烈的信号,表明低成本模型在被置于流行的编码代理工作流中时,能够产生巨大的需求。
Nous Research 宣布了一项为期七天的促销活动,通过 Nous Portal 与 Novita Labs 合作,以 90% 的折扣提供 DeepSeek V4 Flash 0731。
该促销帖将折扣后的成本与 Claude Fable 5 进行了比较,并声称在类似任务上价格差异超过 1000 倍。
该比较取决于几个选择:
按令牌价格进行比较是有用的,但更有意义的指标是:
每个验收任务的总成本
一个使用更少昂贵令牌的模型,可能比一个反复重试的低价模型更便宜。
相反,当一个低价模型也足够有能力快速完成任务时,成本优势可能会变得巨大。
Cline 最初宣布通过其编码代理免费提供 V4 Flash 0731 的使用。
随后的一篇公开帖子表示,免费配额已提高两倍,因为其经济效益似乎是可持续的。
Cline 当前的模型目录和 ClinePass 材料将 DeepSeek V4 Flash 列为面向专注编码任务的快速、高性价比选项。
免费配额和模型可用性可能会发生变化,因此用户应查看提供商的实时页面,而不是依赖旧截图。
更广泛的教训更具持久性。
当推理变得足够便宜时,代理平台可以利用免费访问作为客户获取手段,而无需承担
使用高端前沿模型时会面临的相同成本。
源文章包含一个仪表盘,显示:

这个截图很有用,因为它展示了开发者在有利的使用模式下可能看到的数量级。
它不足以让我们精确重建账单。
缺失的变量包括:
重复使用的长系统提示词在命中缓存时会非常便宜。
一次性的长独特提示词按缓存未命中的输入价格计费。
输出也比缓存输入贵得多。
对于智能体系统,这些差异主导了最终账单。
DeepSeek V4 Preview 于 2026 年 4 月 24 日发布。
该系列包含:
Preview 版本确立了主要架构:
V4 Flash Preview 被定位为 V4 Pro 的更小、更快、更便宜的替代品。
7月31日的更新改变了它的竞争地位。
DeepSeek 表示 V4 Flash 0731 使用与 V4 Flash Preview 相同的模型架构和规模。
此次更新是通过运行新的后训练流程实现的。
简化形式如下:
相同的预训练基座架构
+
新的后训练和智能体优化
=
更强的编码智能体行为
这一点很重要,因为它展示了一个预训练模型中可以潜藏着多大的能力。
架构和参数量并不是产品的全部。
后训练决定了模型如何有效地:
最初的 V4 Flash 模型卡对基础模型的描述如下:
| 规格 | DeepSeek V4 Flash |
|---|---|
| 基础 MoE 总参数 | 284B |
| 激活参数 | 13B |
| 上下文长度 | 1M |
| 许可证 | MIT |
| 主要模态 | 文本 |
| 基础精度 | FP8 / 混合低精度(视检查点而定) |
0731 模型卡显示,新版本与 DSpark 变体结构相同,并附带一个投机解码(speculative-decoding)模块。
这解释了为什么某些模型文件的元数据可能显示
与 284B 基础 MoE 的数字相比,检查点总数现在更大了。
最简洁的说法是:
V4 Flash 底层的 MoE 模型仍然约为 284B 总参数、13B 激活参数,而 0731 版本在发布的检查点中增加了 DSpark 投机解码组件。
投机解码使用一个快速的草稿模型来提出若干个未来 token。
主模型随后验证这些提议。
当预测被接受时,系统可以用更少的顺序计算生成多个 token。
DeepSeek 的 0731 模型卡声称
为vLLM和SGLang提供了明确的DSpark支持。
对于vLLM,相关配置如下:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
对于SGLang,模型卡片使用:
--speculative-algorithm DSPARK
DSpark本身并不会提升模型的推理能力。
它是一种推理优化手段,旨在降低解码延迟或提高吞吐量,同时保持目标模型在支持的配置下的输出分布。
DeepSeek发布了以下V4 Flash 0731的对比数据:
| 基准测试 | V4 Flash 0731 | V4 Flash预览版 | V4 Pro预览版 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |
增幅最大的是DeepSWE:
7.3 → 54.4
CyberGym几乎翻倍:
38.7 → 76.7
Terminal Bench 2.1提升了二十多个百分点:
61.8 → 82.7
新的Flash模型在DeepSeek发布的数据表中所有基准测试上也均超越了V4 Pro预览版。
对于一个最初主要定位为更便宜、更快的选择的模型来说,这是一个重大变化。
该表格不应被理解为原始检查点的纯粹对比。
DeepSeek的模型卡片包含了几项重要说明。
对于公开的代码智能体任务,该公司使用了:
DeepSeek Harness最小模式
推理强度:最大
温度:1.0
Top-p:0.95
在验证时,DeepSeek Harness尚未公开发布。
这意味着外部研究人员可能还无法复现已发布的代码智能体结果所使用的确切软件环境。
其中两项测试也是内部的:
内部基准测试对产品开发可能有帮助,但独立团队无法检查其隐藏任务或污染控制措施。
正确的解读是:
DeepSeek报告了在其选定的智能体堆栈和评估设置下的大幅改进。当Harness、提示词、日志和完整的评估配置可用时,公开可复现性将得到改善。
编码基准测试通常衡量的是一个完整系统:
模型
+
系统提示词
+
仓库工具
+
终端
执行
+
上下文管理
+
重试策略
+
测试反馈
+
补丁提交逻辑
当任何一个组件发生变化时,同一模型可能会得到不同的分数。
更好的Harness可能能够:
这并不会使模型变得无关紧要。
这意味着基准测试结果属于模型与Harness的组合。
0731版本的强劲数据表明DeepSeek在两方面都有所提升
模型的主体行为及其周围的评估过程。
Artificial Analysis 报告称,DeepSeek V4 Flash 0731 的智能指数得分约为 50,比之前的 Flash 版本高出约十分。
这家独立的模型分析公司还指出,与其他知名前沿系统相比,V4 Flash 的价格异常低廉。
路透社在总结 Artificial Analysis 的调查结果时称,按照其方法测算,平均基准测试成本约为 3 美分。
这一比较支持了其性价比论点。
但这并不意味着每项生产任务都只需 3 美分。
Artificial Analysis 还报告了若干知识可靠性指标上的较弱表现。
其关于 V4 Flash 0731 的文章指出:
这些数据是一个有用的提醒。
一个模型可以:
“最佳性价比”并不等于“最适合所有任务”。
DeepSeek 直接 API 的价格为:
| 计费类别 | 每 1M tokens 价格 |
|---|---|
| 缓存命中输入 | $0.0028 |
| 缓存未命中输入 | $0.14 |
| 输出 | $0.28 |
缓存命中与缓存未命中之间的价格差距巨大:
$0.14 ÷ $0.0028 = 50
缓存输入比未缓存输入便宜五十倍。
对于长时间运行的智能体而言,提示结构即成本结构。
假设一次请求使用:
100,000 个未缓存输入 tokens
20,000 个输出 tokens
直接模型成本为:
输入:
100,000 / 1,000,000 × $0.14
= $0.014
输出:
20,000 / 1,000,000 × $0.28
= $0.0056
总计:
$0.0196
这不到两美分。
现在假设同样的 100,000 token 前缀已被缓存:
缓存命中输入:
100,000 / 1,000,000 × $0.0028
= $0.00028
输出:
20,000 / 1,000,000 × $0.28
= $0.0056
总计:
$0.00588
此时输出费用成为账单的主要部分。
这些示例解释了为什么低成本的编码原型是可行的。
它们并不包含:
智能体编码很少只涉及一次请求。
一个典型的工作流程可能包括:
每一步都可能产生一次新的模型调用。
在以下情况下,看似很小的任务也可能变得昂贵:
V4 Flash 降低了这些失误的成本。
但并未消除它们。
上下文缓存是主要的成本杠杆
DeepSeek 使用基于磁盘的上下文缓存。
当相同的前缀被复用时,匹配的输入令牌可以获得更低的缓存命中价格。
适合作为稳定前缀的候选内容包括:
一个简化的提示词设计是:
稳定的可复用前缀
+
新的用户请求
+
最新的工具结果
一个不太利于缓存的设计是:
重排的指令
+
重写的仓库摘要
+
变化的时间戳
+
随机请求元数据
+
新的用户请求
细微的前缀变化可能会降低缓存复用率。
开发者应检查令牌使用字段,而不是假设长提示词已被缓存。
DeepSeek 还提供 user_id 隔离功能,用于隐私保护和调度。缓存复用和用户隔离应一起设计,以避免一个客户的上下文被意外混入另一个客户的上下文中。
官方基础 URL 为:
https://api.deepseek.com
模型 ID 为:
deepseek-v4-flash
DeepSeek 表示,稳定的 API ID 会自动提供最新的官方 Flash 版本。
这很方便,但生产团队应记录返回的模型指纹并测试变更,因为稳定 ID 背后的行为可能会被升级。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Review this function and propose a safe refactor.",
}
],
)
print(response.choices[0].message.content)
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "user",
"content": "Write a small Python CLI that validates JSON files."
}
]
}'
开发者应查看实时 API 参考文档,以确认其端点和 SDK 版本支持的确切推理强度(reasoning-effort)和思考模式(thinking-mode)字段。
DeepSeek 的思考模式文档指出,当一个轮次包含工具调用时,助手消息中的 reasoning_content 必须在后续请求中传回。
多轮代理应保留:
contentreasoning_contenttool_calls丢弃推理状态可能会降低连续性或导致请求验证问题。
这在通过通常忽略提供商特定推理字段的 OpenAI 兼容客户端进行集成时尤为重要。
DeepSeek 提供多种接口。
使用标准的 DeepSeek 基础 URL 和模型 ID:
deepseek-v4-flash
DeepSeek 还记录了 Anthropic 格式的接口。
这有助于构建在
围绕Claude风格的消息连接到DeepSeek,可以减少应用程序改动。
兼容性并不保证行为完全一致。
提供商特定字段、推理历史、工具架构、安全行为和错误处理仍需要测试。
DeepSeek表示,0731版本原生支持Responses API格式,并已适配为Codex风格的使用方式。
这对编码代理产品很重要,因为这些产品越来越依赖有状态的响应对象、工具调用和结构化的代理循环。
DeepSeek已在Hugging Face上以MIT许可证发布了V4 Flash 0731权重。
这允许开发者在遵守许可证条款的前提下检查、修改、部署和重新分发该模型。
相比仅提供API的模型,开放权重发布提供了更多控制权。
团队可以:
实际障碍在于硬件。
“开放权重”并不意味着“可以在普通笔记本电脑上运行”。
官方0731模型卡提供了单个4×GB300节点的vLLM示例:
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code \
--kv-cache-dtype fp8 \
--block-size 256 \
--data-parallel-size 4 \
--enable-expert-parallel \
--moe-backend deep_gemm_mega_moe \
--attention-config '{"use_fp4_indexer_cache": true}' \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
该示例展示了全质量服务所预期的基础设施级别。
不应将其解读为唯一受支持的配置。
vLLM配方未来可能会增加对其他GPU拓扑的支持。
官方SGLang示例为:
sglang serve \
--trust-remote-code \
--model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
--tp 4 \
--moe-runner-backend flashinfer_mxfp4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.90 \
--chunked-prefill-size 4096 \
--swa-full-tokens-ratio 0.1
目标权重和草稿权重来自同一检查点,因此文档说明无需单独设置推测性草稿模型路径。
推理引擎发展迅速。
请使用当前的模型卡和服务引擎配方,而不要从Preview版本复制旧的启动命令。
尽管仅约
对于任意给定token,13B参数为激活状态,这意味着完整模型权重在整个服务系统中必须始终保持可用。
部署规划必须考虑:
较小的量化可能支持在不同硬件上进行实验,但可能会改变质量、速度或受支持的上下文长度。
对于大多数个人开发者来说,使用直接API或
托管服务提供商会比自托管更简便、更具成本效益。
使用 V4 Flash 有三种常见方式。
| 路线 | 主要优势 | 主要权衡 |
|---|---|---|
| DeepSeek API | 官方定价和当前官方模型 | 数据离开你的环境;稳定 ID 可能会更新 |
| 第三方平台 | 免费额度、集成智能体、更简便的计费 | 促销活动和路由可能会发生变化 |
| 自托管权重 | 最大程度地控制和保护隐私 | 需要大量硬件和工程资源 |
最具成本效益的路线取决于你的工作负载。
免费的 Cline 或 OpenCode 额度可能非常适合实验。
直接 API 可能最适合可预测的小规模使用。
只有当使用量足够大且持续稳定,或隐私要求优先时,自托管才可能具有吸引力。
源文章将廉价 AI 比作汽车的大规模生产。
这个类比并不完美,但很有用。
当一项技术的成本大幅下降时,市场不会简单地用更少的钱购买相同数量的产品。
新的用例会变得可能。
低成本的智能体模型可以支持那些以前在测试前就会被否决的实验。
例如:
其价值不在于模型取代了所有软件工程。
而在于它降低了提出以下问题的成本:
这个想法值得进一步构建吗?
廉价的生成可以产出令人信服的首次演示。
但生产级产品仍然需要:
七美分的模型账单并不意味着七美分的业务。
它意味着第一次计算实验的代价可能足够低,值得尝试。
这改变了谁可以参与,以及可以测试多少想法。
源文章包含一个轻量级文档工作区,作为开发者使用廉价编码智能体所构建内容的一个示例展示。

DeepSeek 自己在 7 月 31 日的更新日志中也提到,用于基准评估的 DeepSeek Harness 极简模式“即将发布”。
截至核验时,我未能找到:
现有证据支持以下更窄范围的结论:
DeepSeek 正在测试一个智能体框架,并打算至少发布该框架的一部分,但最终产品名称、公开范围和发布时间仍未确认。
模型、API 和开放权重现已可用。
该框架仍是未来的生态组件。
第一方框架可能有助于 DeepSeek 控制完整的编码智能体技术栈。
它可能提供:
上下文管理。
DeepSeek 已经记录了与外部测试框架和编程代理的集成。
第一方工具可以将针对基准测试的优化转化为普通开发者可以使用的产品。
它还可以揭示 V4 Flash 0731 基准测试提升中有多少来自检查点,多少来自代理运行时。
几项进展将决定 V4 Flash 时刻是否会成为持久的生态系统转变。
DeepSeek 表示,官方 V4 Pro 版本将紧随 Flash 更新之后发布。
Pro 与 Flash 之间的性能和定价差距将影响路由决策。
公开发布将提高基准测试的可复现性,并为开发者提供模型原生的代理框架。
直接价格已经很低,但第三方促销可能不会持续。
廉价推理会吸引极高的流量。
随着使用规模扩大,延迟、速率限制和可靠性将变得至关重要。
vLLM、SGLang、硬件供应商和量化项目将决定自托管变得多容易实现。
更多公开评估应测试:
DeepSeek V4 Flash 0731 是 V4 Flash 的官方 7 月 31 日版本,目前通过 deepseek-v4-flash API 以公开测试版形式提供服务。DeepSeek 表示,它保留了 Preview 模型的基础架构和规模,同时通过新的后训练显著提升了代理能力。
DeepSeek 官方 API 的定价为:每百万缓存未命中输入 token 0.14 美元,每百万缓存命中输入 token 0.0028 美元,每百万输出 token 0.28 美元。第三方平台可能提供不同的价格、免费配额或临时折扣。
来源文章引用了社区示例中报告的模型成本。该示例没有附带完整的提示词、token 日志、缓存数据、重试次数、工具成本或人工工作记录,因此应将其视为轶事而非保证预算。
DeepSeek 报告 Terminal Bench 2.1 得分 82.7,CyberGym 得分 76.7,DeepSWE 得分 54.4,Toolathlon-Verified 得分 70.3,NL2Repo 得分 54.2。公开的代码代理评估使用了未发布的 DeepSeek Harness 极简模式,并采用最大推理努力。
模型权重和仓库根据 MIT 许可证发布,因此“开放权重”和“广泛许可使用”是准确的描述。运行完整检查点仍然需要大量多 GPU 基础设施。
可以,DeepSeek 发布了权重和部署说明。
用于 vLLM 和 SGLang。官方完整示例使用先进的多 GPU 硬件,因此普通笔记本电脑并非完整模型的目标运行环境。
官方 API 和模型卡指定的上下文窗口为 100 万 token。API 还列出了最大输出长度为 384K token,但使用最大上下文或最大输出会显著增加延迟和资源消耗。
DeepSeek 已公开提及 Harness 最小模式,并招募了开源 harness 开发者进行内部测试。验证过程中未找到完整的公共代码仓库、最终产品规格以及确认的发布日期。
reasoning_content 的官方指南。DeepSeek V4 Flash 0731 保留了预览版模型的基础
架构和规模保持不变,但新的后训练技术带来了编码智能体性能的重大飞跃。DeepSeek 报告在 Terminal Bench 2.1 上得分为 82.7,在 CyberGym 上为 76.7,在 DeepSWE 上为 54.4,不过最强劲的公开编码智能体结果依赖于尚未发布的 DeepSeek Harness 配置。
官方 API 定价异常低廉:每百万未缓存输入 token 0.14 美元,每百万缓存输入 token 0.0028 美元,每百万输出 token 0.28 美元。第三方免费额度和折扣可以使访问成本更低,但这些促销是临时性的,不应误认为是永久标价。
MIT 开放权重许可、100 万 token 上下文窗口、Responses 和 Anthropic 兼容 API,以及 vLLM 和 SGLang 的支持,使该模型在托管和自管部署路径上均易于使用。完整本地部署仍然是一项严肃的多 GPU 基础设施工程。
广为流传的七美分和五十美分原型是边际模型成本可以低至何种程度的有力例证,但它们并非完整的产品成本分析。智能体循环、输出长度、缓存未命中、工具、测试和人力成本仍然重要。
DeepSeek V4 Flash 0731 之所以重要,并非因为每项应用现在只需几美分,而是因为强大的智能体编码已变得足够实惠,让更多开发者能够以有意义的规模进行尝试。
从一句话开始,几分钟内拿到完整网站。