引言
DeepSeek V4 Flash 0731进入公开测试版,带着一个熟悉的承诺:以极低的API价格提供更强的编码和智能体能力。
开发者们迅速将这一说法转化为实际实验。
流传最广的案例之一来自一次Hermes Agent运行,其中DeepSeek V4 Flash仅凭一个初始提示词就生成了一款可游玩的第一人称3D射击游戏。据报道,该项目耗时32分钟,模型使用成本仅为0.07美元。
最终成果包括:
- 第一人称移动。
- 跳跃。
- 射击。
- 与环境的物理碰撞。
- 掩体物体和目标。
- 界面中的弹药计数器。

CSA和HCA降低长上下文成本
DeepSeek V4支持100万Token的上下文窗口。
传统的注意力系统在这样的规模下会变得极其昂贵,因为每个新Token可能需要检查大量的先前上下文并维护较大的KV缓存。
DeepSeek的技术报告描述了一种混合注意力设计,结合了:
- 压缩稀疏注意力(CSA)
- 重度压缩注意力(HCA)
总体策略是避免在每一步都对整个历史进行完整且昂贵的注意力计算。
系统会对上下文进行压缩和过滤,使模型能够将计算集中在最有用的信息上。
DeepSeek报告称,在100万Token的上下文环境中,V4 Pro需要:
- DeepSeek V3.2单Token推理FLOPs的27%。
- KV缓存容量的10%。
这些确切百分比是技术论文中针对V4 Pro报告的,并非Flash的单独审计数据。
V4 Flash使用相同的架构家族,因此受益于相同的长上下文设计原则。
实际效果包括降低了:
- KV缓存内存。
- GPU内存压力。
- 数据移动量。
- 每Token计算量。
- 长上下文服务成本。
FP4和FP8减少存储
以及内存流量
发布的 V4 Flash 模型使用了混合低精度权重。
DeepSeek 列出:
FP4 + FP8 混合精度
较低的精度减少了推理过程中必须存储、从内存加载、在设备之间传输以及处理的数据量。
这一点很重要,因为现代语言模型推理往往受限于内存带宽,而不仅仅是原始算术运算能力。
如果硬件和内核设计为高效执行这种格式,较小的数据表示可以提升吞吐量。
低精度并非天然免费。
糟糕的量化会降低模型质量。
DeepSeek 的发布是围绕所选精度方案进行设计和训练的,而不仅仅是依赖事后社区量化。
预览版与 0731 之间的架构未变
DeepSeek 表示,官方 0731 版本保持了与 V4 Flash 预览版相同的模型架构和规模。
该公司没有为本次更新再次进行完整的预训练。
而是重做了后训练流程。
源文章将变化总结为:
- 新的监督微调。
- 新的 GRPO 强化学习。
- DSpark 投机解码。
- 更好的智能体行为。
- 更高的服务吞吐量。
DeepSeek 的技术报告将更广泛的 V4 后训练过程描述为:
- 独立开发领域专家模块。
- 使用 GRPO 进行监督微调和强化学习。
- 在线策略蒸馏。
- 将专家能力整合到单一模型中。
0731 更新侧重于改善这些能力在实际智能体工作流中的表现。
DSpark 加速 Token 生成
DeepSeek-V4-Flash-0731 附带 DSpark 投机解码模块。
投机解码使用较小或更便宜的草稿路径来提出多个未来 token。
主模型批量验证这些提议。
简化流程如下:
草稿模块提出 token
→ 主模型同时验证
→ 接受的 token 被输出
→ 被拒绝的路径会被纠正
当草稿预测准确时,系统可以通过更少的主模型昂贵顺序推理生成多个被接受的 token。
DeepSeek 为 vLLM 和 SGLang 均提供 DSpark 支持。
对于 vLLM,官方模型卡使用:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
对于 SGLang,对应选项为:
--speculative-algorithm DSPARK
DeepSeek 表示,目标模型和草稿模型的权重存储在同一个检查点中,因此 SGLang 不需要单独的草稿模型路径。
投机解码主要提升服务速度和吞吐量。
它本身并不能解释模型的推理能力提升。
这些提升来自更新后的后训练流程。
官方发布提升了智能体基准测试成绩
DeepSeek 报告了与 V4 Flash 预览版相比,在多项智能体重点测试中的大幅提升。
| 基准测试 | V4 Flash 0731 | V4 Flash 预览版 | V4 Pro 预览版 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 |
12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

DeepSeek表示,公开的代码智能体基准测试使用了以下配置运行:
DeepSeek Harness最小模式
reasoning_effort = max
top_p = 0.95
temperature = 1.0
截至官方更新时,该测试框架尚未公开发布。
DSBench-FullStack和DSBench-Hard是DeepSeek的内部基准测试。
这意味着它们的分数可以作为公司报告的参考证据,但不像完全公开的基准测试套件那样可以独立核查。
Terminal Bench和Toolathlon衡量什么
Terminal Bench 2.1
Terminal Bench评估智能体在终端环境中完成任务的能力。
模型可能需要检查文件、运行命令、安装依赖、调试故障、修改代码并验证完成情况。
高分反映了模型、智能体框架、工具策略、推理预算和运行时环境的综合表现。
Toolathlon-Verified
Toolathlon评估跨多个软件应用和工具的长周期任务。
该基准包括涉及日历、文件系统、Notion、WooCommerce、Kubernetes和BigQuery的场景。
任务需要多次工具交互,并通过基于执行的评估器进行验证。
DeepSeek报告的70.3分相比预览模型有了大幅提升。
但这不应被解读为对每项真实业务自动化都有70.3%的成功保证。
基准提升并不保证每个游戏都能一次提示成功
消息来源中的游戏示例揭示了基准性能与创意编码之间的重要差异。
V4 Flash在官方智能体评估中表现强劲,但一个游戏对比仍然需要三次迭代。
基准可以衡量在定义明确的任务集和已知评估规则下的成功率。
而创意项目可能包含模糊的视觉要求、浏览器兼容性问题、物理引擎错误、资源缺失、主观质量评判,并且没有单一测试套件可以定义成功。
在这种场景下,低成本模型尤其有用,因为工作流可以承受多次迭代。
它的价值不一定在于首次生成就完美无缺。
它可能是:
可接受的质量
×
大量可负担的尝试次数
幾分鐘搭建展示站並增長獲客
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
V4 Flash支持多种API格式
DeepSeek通过以下方式开放模型:
- 兼容OpenAI的Chat Completions接口。
- 兼容OpenAI的Responses API。
- 兼容Anthropic的API。
- JSON输出。
- 工具调用。
- 聊天前缀补全。
- 非思考模式下的中间填充补全。
兼容OpenAI的Base URL为:
https://api.deepseek.com
兼容 Anthropic 的基础 URL 为:
```Plaintext
https://api.deepseek.com/anthropic
DeepSeek 表示 V4 Flash 是目前唯一支持 Responses API 的 V4 API 模型。
V4 Pro 的支持将另行规划。
Responses API 的兼容性还允许该模型通过 DeepSeek 的文档化配置在 Codex 中使用。
思考模式默认启用
DeepSeek V4 Flash 支持思考模式和非思考模式。
思考模式为默认模式。
对于本地推理,官方模型卡支持三种推理努力级别:
low
high
max
DeepSeek 推荐:
temperature = 1.0
top_p = 0.95
用于智能体场景。
对于 high 和 max 推理努力级别,该公司建议允许最大输出长度达 384K tokens。
更高的推理设置可以改善困难任务的表现,但也可能增加延迟、输出量、API 成本和智能体循环的耗时。
生产系统应评估能够可靠满足任务需求的最低努力级别。
权重以 MIT 许可证发布
DeepSeek 在 Hugging Face 上以 MIT 许可证发布了 V4 Flash 0731 权重。
这使得该模型与许多大型商业发布相比具有异常宽松的许可。
开发者可以将官方模型仓库与受支持的引擎一起使用,包括:
- vLLM。
- SGLang。
- Transformers。
- Docker Model Runner。
- 与 llama.cpp 兼容的量化版本。
- 与 LM Studio 兼容的社区构建版本。
该模型规模较大。
核心模型拥有 284B 参数,0731 检查点中另有一个 DSpark 组件。
以可用速度运行它需要大量的内存和硬件资源。
权重可下载并不意味着完整模型能在普通的消费级笔记本电脑上流畅运行。
社区量化版本可以降低内存需求,但可能改变准确性、吞吐量、上下文容量、DSpark 行为和工具调用可靠性。
V4 Flash 是否总是最具性价比的选择?
消息来源总结认为,V4 Flash 并非在每次对比中都能产生最佳结果,但在性价比方面很难被击败。
这是对示例的合理总结,但有一个重要前提:
性价比取决于完整的 workflow。
V4 Flash 在以下情况下尤其具有吸引力:
- 请求量高。
- 错误容易检测。
- 任务可以自动重试。
- 上下文缓存效果好。
- 人工审核成本低。
- 紧凑的代码可以接受。
- 应用可以使用开放权重模型。
而在以下情况下,更昂贵的 frontier 模型总体上可能仍然更经济:
- 一次失败的结果会造成较大损失。
- 首次通过的可靠性至关重要。
- 任务需要更深层的知识。
- 智能体无法安全重试。
- 人工审核成本高。
- 较小的模型会产生难以维护的输出。
正确的对比不是:
每 token 的价格
而是:
每个经过验证的成功任务的成本
如何为实际项目评估 V4 Flash
第 1 步:选择代表性任务
不要只测试精心打磨的演示。
使用与生产 workload 匹配的任务,包括困难和复杂的场景。
第 2 步:固定智能体环境
在不同模型之间保持提示词、工具、时间限制、重试策略、框架、沙箱、测试套件和推理设置的一致性。
第三步:记录完整成本
跟踪未命中缓存的输入、命中缓存的输入、输出令牌、工具调用、重试次数、运行时间、人工审核和失败尝试。
第四步:衡量可接受性,而非仅凭视觉相似度
对于代码,运行测试并检查可维护性。
对于游戏,检查控制、碰撞、性能和浏览器兼容性。
第五步:测试缓存行为
当稳定上下文在多个智能体步骤中被反复复用时,缓存命中价格极低的模型会变得更有价值。
第六步:比较首次通过和最终成功
一个经过三次廉价尝试才成功的模型,可能比一个以高价格一次成功的模型更具性价比。
当重试缓慢或存在风险时,情况也可能相反。
常见问题
什么是DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731是DeepSeek较小规模V4混合专家模型的官方后训练版本。它取代了预览版本,新增了DSpark投机解码模块,并重点聚焦于编码和工具使用型智能体任务。
DeepSeek V4 Flash API费用是多少?
DeepSeek目前公布的常规价格为:每百万个缓存命中输入令牌0.0028美元,每百万个缓存未命中输入令牌0.14美元,每百万个输出令牌0.28美元。该公司已宣布未来政策将在指定高峰时段将价格翻倍。
DeepSeek V4 Flash真的以0.07美元构建了一个3D游戏吗?
一位开发者报告称,Hermes Agent的一次运行在32分钟内以0.07美元的成本生成了一个可玩的第一人称射击游戏。这是一个社交媒体案例研究,而非标准化基准测试,因此其他任务的成本可能更高或更低。
DeepSeek V4 Flash有多少参数?
V4技术报告列出的核心Flash模型总参数为2840亿,每个令牌激活130亿参数。完整的0731版本仓库可能显示约3040亿参数,因为它包含了附带的DSpark投机解码组件。
为什么DeepSeek V4 Flash如此便宜?
其低成本源于稀疏混合专家激活、压缩长上下文注意力、FP4/FP8混合精度、提示缓存、投机解码和高并发服务。每个令牌仅激活总专家中的一小部分。
DeepSeek V4 Flash是否优于Claude Opus 5或GPT-5.6?
在当前的API定价下,它便宜得多,并在多个社区演示中表现出竞争力。Opus 5和GPT-5.6在某些任务上可能仍提供更强的首次通过可靠性或质量,而那些病毒式传播的比较并非受控基准测试。
DeepSeek V4 Flash可以本地运行吗?
可以。DeepSeek以MIT许可证发布权重,并提供vLLM和SGLang的使用指导。完整模型极其庞大,因此实际的本地部署需要大量的加速器内存或激进的社区量化方案。
V4 Flash是否支持Codex和Responses API?
支持。DeepSeek表示,官方Flash版本原生支持Responses API,并已适配用于Codex。当前的V4 Pro API尚不支持Responses API。
相关工具
- [DeepSeek API](https://api.
deepseek.com/):DeepSeek V4 Flash 及其他受支持模型的官方托管端点。
- DeepSeek V4 Flash 0731:官方模型仓库,包含权重、基准、许可证和部署指南。
- vLLM:一个高吞吐量推理引擎,为 V4 Flash 和 DSpark 提供官方配方。
- SGLang:一个 LLM 服务框架,内置 V4 Flash 和 DSpark 的文档化支持。
- DeepSpec:DeepSeek 的投机解码研究和 DSpark 方法仓库。
- Codex:一个智能编码环境,可通过 DeepSeek 的 Responses API 兼容接口连接 V4 Flash。
相关链接
- DeepSeek V4 Flash 官方更新:7 月 31 日更新日志,包含官方发布状态、基准和 API 范围。
- DeepSeek API 模型与定价:当前令牌价格、上下文长度、输出限制、并发数,以及未来高峰定价通知。
- DeepSeek V4 技术报告:描述 MoE 架构、CSA/HCA 注意力、精度、训练及百万令牌上下文的主要论文。
- DeepSeek V4 Flash 模型卡:官方 0731 基准表、聊天编码、DSpark 配置及 MIT 许可证。
- DeepSeek Codex 集成:通过 Codex 和 Responses API 使用 V4 Flash 的官方指南。
- Toolathlon 论文:描述官方评估所用长时多工具基准的研究论文。
- V4 Flash vLLM 配方:适用于 V4 Flash 部署的硬件和服务指南。
摘要
DeepSeek V4 Flash 0731 引起了广泛关注,因为开发者报告称仅需几美分就能构建完整的交互式演示。据报道,一款第一人称射击游戏仅花费 0.07 美元,而其他社交媒体上的对比显示,任务成本比 Claude Opus 5 或 GPT-5.6 低数十倍。
这些示例并非受控基准测试,但官方 API 定价支持了其核心观点。V4 Flash 每百万未缓存输入令牌收费 0.14 美元,每百万输出令牌收费 0.28 美元,缓存命中率仅为 0.0028 美元,低得惊人。
其经济性源于整个系统:一个每次令牌激活 13B 参数的 284B MoE 核心、压缩的长上下文注意力、FP4/FP8 权重、百万令牌上下文窗口、高效的服务能力,以及 DSpark 投机解码。0731 更新保留了预览架构,并通过新的后训练改进了智能体行为。
最有力的官方证据是基准的提升。Terminal Bench 2.1 从 61.8 升至 82.7,Toolathlon-Verified 从 49.7 升至 70.3,同时模型保持了 Flash 定价层级。
V4 Flash 的优势不在于它在所有对比中胜出——而在于其极低的边际成本使得
以许多前沿定价模型难以实现的规模,反复进行代理式实验,这在实践中是可行的。



