引言
DeepSeek V4 Flash 0731引发了一系列不同寻常的反应。
开发者对其编程智能体得分印象深刻。
基础设施团队对其100万token上下文和低激活参数数量感兴趣。
AI平台正在提供免费使用和激进折扣。
社交媒体上充斥着原型产品的截图,据报道其推理账单以美分而非美元计算。
源文章中最广泛分享的示例包括:
- 据报道,一个小型3D太空射击游戏原型的生成成本约为人民币0.07元。
- 据报道,一个反恐精英风格原型的生成成本约为人民币0.50元。
- 一个个人使用仪表盘显示8700万token仅花费人民币31.57元。
- OpenCode报告称8月1日处理了8万亿个DeepSeek Flash token。
- Cline在发现该模型的补贴成本低于预期后增加了免费额度。
- Nous Portal暂时对V4 Flash 0731提供90%折扣。
这些示例激发了热情,但也可能模糊了几个不同方面:
- DeepSeek官方API价格。
- 缓存命中与缓存未命中定价。
- 免费或受补贴的第三方访问。
- 智能体进行的工具调用次数。
- 生成的输出和隐藏推理量。
- 仅模型成本与完整产品成本之间的区别。
该模型确实非常便宜。
但这并不意味着每个应用都只需七分钱。
有意义的问题不在于某个爆款演示能否被精确复现,而在于DeepSeek如何在不改变基础架构的情况下实现了如此巨大的能力飞跃——以及新的经济模式对开发者意味着什么。
全球折扣循环
在第三方促销活动之前,官方API价格已经很低。
DeepSeek目前公布的每百万token价格如下:
| 使用类型 | DeepSeek V4 Flash价格 |
|---|---|
| 输入,缓存命中 | $0.0028 |
| 输入,缓存未命中 | $0.14 |
| 输出 | $0.28 |
该API支持:
- 100万token上下文窗口。
- 最多384K输出token。
- 思考和非思考模式。
- 0731模型卡中三个推理努力级别:
low、high和max。 - 工具调用。
- JSON输出。
- 测试版聊天前缀补全。
- 非思考模式下的FIM补全。
- 兼容OpenAI的Chat Completions。
- Responses API。
- 兼容Anthropic的接口。
- V4 Flash每个账户公布的并发限制为2,500。
这些官方价格是基准线。
平台随后可以选择:
- 原价转售。
- 加价。
- 补贴使用量。
- 提供有限免费模型。
- 将模型捆绑到订阅中。
- 提供促销积分。
- 通过其他推理提供商路由流量。
这就是为什么一位开发者可能支付DeepSeek的标价,而另一位开发者可在限期内免费使用。
OpenCode报告单日处理8万亿token
OpenCode公开表示,8月1日通过其平台处理了8万亿个DeepSeek Flash token。
该帖子将数据分解为:
5万亿token免费使用
+
3万亿token通过OpenCode Go
OpenCode在8月3日的推文中显示
DeepSeek Flash 于 8 月 1 日处理了 8 万亿个令牌——其中 5 万亿为免费,3 万亿通过 OpenCode Go 完成。该推文是对这些数字的官方声明,分解了免费与付费使用情况,并提供了有关 DeepSeek Flash 令牌处理量的支持背景。
OpenCode 当前的 Zen 文档中列出了一个限时提供的 DeepSeek V4 Flash 免费 选项。
这是一个重要的区别。
8 万亿令牌这一数字描述的是通过 OpenCode 的流量,而非 DeepSeek 在各平台直接上报的使用量。
这仍然是一个强烈的信号,表明低成本模型在被置于流行的编码代理工作流中时,能够产生巨大的需求。
Nous Portal 临时降价 90%
Nous Research 宣布了一项为期七天的促销活动,通过 Nous Portal 与 Novita Labs 合作,以 90% 的折扣提供 DeepSeek V4 Flash 0731。
该促销帖将折扣后的成本与 Claude Fable 5 进行了比较,并声称在类似任务上价格差异超过 1000 倍。
该比较取决于几个选择:
- 使用哪家提供商的价格。
- 输入或输出哪个占主导。
- 是否提供缓存。
- 选择哪种推理设置。
- 每个模型完成任务需要多少令牌。
- 哪个基准或工作流定义了“可比较”。
按令牌价格进行比较是有用的,但更有意义的指标是:
每个验收任务的总成本
一个使用更少昂贵令牌的模型,可能比一个反复重试的低价模型更便宜。
相反,当一个低价模型也足够有能力快速完成任务时,成本优势可能会变得巨大。
Cline 免费配额提高两倍
Cline 最初宣布通过其编码代理免费提供 V4 Flash 0731 的使用。
随后的一篇公开帖子表示,免费配额已提高两倍,因为其经济效益似乎是可持续的。
Cline 当前的模型目录和 ClinePass 材料将 DeepSeek V4 Flash 列为面向专注编码任务的快速、高性价比选项。
免费配额和模型可用性可能会发生变化,因此用户应查看提供商的实时页面,而不是依赖旧截图。
更广泛的教训更具持久性。
当推理变得足够便宜时,代理平台可以利用免费访问作为客户获取手段,而无需承担
使用高端前沿模型时会面临的相同成本。
社区成本截图需要背景信息
源文章包含一个仪表盘,显示:
- 支出 31.57 元人民币。
- 2,282 次 API 请求。
- 87,027,995 个令牌。

这个截图很有用,因为它展示了开发者在有利的使用模式下可能看到的数量级。
它不足以让我们精确重建账单。
缺失的变量包括:
- 输入与输出 token 的比例。
- 缓存命中百分比。
- 每天使用的模型版本。
- 推理投入程度。
- 工具调用次数。
- 失败的请求。
- 促销积分。
- 服务商折扣。
- 是否所有 token 都按同一费率计费。
重复使用的长系统提示词在命中缓存时会非常便宜。
一次性的长独特提示词按缓存未命中的输入价格计费。
输出也比缓存输入贵得多。
对于智能体系统,这些差异主导了最终账单。
Flash Blitz:7月31日的变化
DeepSeek V4 Preview 于 2026 年 4 月 24 日发布。
该系列包含:
- DeepSeek V4 Pro。
- DeepSeek V4 Flash。
Preview 版本确立了主要架构:
- 稀疏混合专家(Sparse Mixture of Experts)。
- 100 万 token 上下文。
- 高效的长上下文注意力机制。
- 相对于总容量,激活参数数量较低。
- 思考与非思考模式。
- 开源权重,采用 MIT 许可证。
V4 Flash Preview 被定位为 V4 Pro 的更小、更快、更便宜的替代品。
7月31日的更新改变了它的竞争地位。
DeepSeek 表示 V4 Flash 0731 使用与 V4 Flash Preview 相同的模型架构和规模。
此次更新是通过运行新的后训练流程实现的。
简化形式如下:
相同的预训练基座架构
+
新的后训练和智能体优化
=
更强的编码智能体行为
这一点很重要,因为它展示了一个预训练模型中可以潜藏着多大的能力。
架构和参数量并不是产品的全部。
后训练决定了模型如何有效地:
- 使用工具。
- 规划多步骤工作。
- 处理终端反馈。
- 从错误中恢复。
- 编写和编辑文件。
- 遵循智能体协议。
- 分配推理投入。
- 在运行框架内工作。
基础架构与检查点详情
最初的 V4 Flash 模型卡对基础模型的描述如下:
| 规格 | DeepSeek V4 Flash |
|---|---|
| 基础 MoE 总参数 | 284B |
| 激活参数 | 13B |
| 上下文长度 | 1M |
| 许可证 | MIT |
| 主要模态 | 文本 |
| 基础精度 | FP8 / 混合低精度(视检查点而定) |
0731 模型卡显示,新版本与 DSpark 变体结构相同,并附带一个投机解码(speculative-decoding)模块。
这解释了为什么某些模型文件的元数据可能显示
与 284B 基础 MoE 的数字相比,检查点总数现在更大了。
最简洁的说法是:
V4 Flash 底层的 MoE 模型仍然约为 284B 总参数、13B 激活参数,而 0731 版本在发布的检查点中增加了 DSpark 投机解码组件。
DSpark 投机解码
投机解码使用一个快速的草稿模型来提出若干个未来 token。
主模型随后验证这些提议。
当预测被接受时,系统可以用更少的顺序计算生成多个 token。
DeepSeek 的 0731 模型卡声称
为vLLM和SGLang提供了明确的DSpark支持。
对于vLLM,相关配置如下:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
对于SGLang,模型卡片使用:
--speculative-algorithm DSPARK
DSpark本身并不会提升模型的推理能力。
它是一种推理优化手段,旨在降低解码延迟或提高吞吐量,同时保持目标模型在支持的配置下的输出分布。
基准测试跃升
DeepSeek发布了以下V4 Flash 0731的对比数据:
| 基准测试 | V4 Flash 0731 | V4 Flash预览版 | V4 Pro预览版 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |
增幅最大的是DeepSWE:
7.3 → 54.4
CyberGym几乎翻倍:
38.7 → 76.7
Terminal Bench 2.1提升了二十多个百分点:
61.8 → 82.7
新的Flash模型在DeepSeek发布的数据表中所有基准测试上也均超越了V4 Pro预览版。
对于一个最初主要定位为更便宜、更快的选择的模型来说,这是一个重大变化。
基准测试方法论很重要
该表格不应被理解为原始检查点的纯粹对比。
DeepSeek的模型卡片包含了几项重要说明。
对于公开的代码智能体任务,该公司使用了:
DeepSeek Harness最小模式
推理强度:最大
温度:1.0
Top-p:0.95
在验证时,DeepSeek Harness尚未公开发布。
这意味着外部研究人员可能还无法复现已发布的代码智能体结果所使用的确切软件环境。
其中两项测试也是内部的:
- DSBench-FullStack。
- DSBench-Hard。
内部基准测试对产品开发可能有帮助,但独立团队无法检查其隐藏任务或污染控制措施。
正确的解读是:
DeepSeek报告了在其选定的智能体堆栈和评估设置下的大幅改进。当Harness、提示词、日志和完整的评估配置可用时,公开可复现性将得到改善。
Harness质量可能影响得分
编码基准测试通常衡量的是一个完整系统:
模型
+
系统提示词
+
仓库工具
+
终端
执行
+
上下文管理
+
重试策略
+
测试反馈
+
补丁提交逻辑
当任何一个组件发生变化时,同一模型可能会得到不同的分数。
更好的Harness可能能够:
- 选择更相关的文件。
- 保留有用的终端输出。
- 防止上下文溢出。
- 智能地重试失败的命令。
- 停止无效循环。
- 更可靠地应用补丁。
- 为模型提供更清晰的测试结果。
这并不会使模型变得无关紧要。
这意味着基准测试结果属于模型与Harness的组合。
0731版本的强劲数据表明DeepSeek在两方面都有所提升
模型的主体行为及其周围的评估过程。
Artificial Analysis 评分为 50
Artificial Analysis 报告称,DeepSeek V4 Flash 0731 的智能指数得分约为 50,比之前的 Flash 版本高出约十分。
这家独立的模型分析公司还指出,与其他知名前沿系统相比,V4 Flash 的价格异常低廉。
路透社在总结 Artificial Analysis 的调查结果时称,按照其方法测算,平均基准测试成本约为 3 美分。
这一比较支持了其性价比论点。
但这并不意味着每项生产任务都只需 3 美分。
Artificial Analysis 还报告了若干知识可靠性指标上的较弱表现。
其关于 V4 Flash 0731 的文章指出:
- “全知准确率”仍维持在 37% 左右。
- 幻觉率有所下降,但在该评估体系下仍高达约 84%。
这些数据是一个有用的提醒。
一个模型可以:
- 在编程智能体方面表现极强。
- 极为廉价。
- 在综合指数上具有竞争力。
- 但在某些开放式事实问题上仍然不可靠。
“最佳性价比”并不等于“最适合所有任务”。
官方 API 定价
DeepSeek 直接 API 的价格为:
| 计费类别 | 每 1M tokens 价格 |
|---|---|
| 缓存命中输入 | $0.0028 |
| 缓存未命中输入 | $0.14 |
| 输出 | $0.28 |
缓存命中与缓存未命中之间的价格差距巨大:
$0.14 ÷ $0.0028 = 50
缓存输入比未缓存输入便宜五十倍。
对于长时间运行的智能体而言,提示结构即成本结构。
成本计算示例
假设一次请求使用:
100,000 个未缓存输入 tokens
20,000 个输出 tokens
直接模型成本为:
输入:
100,000 / 1,000,000 × $0.14
= $0.014
输出:
20,000 / 1,000,000 × $0.28
= $0.0056
总计:
$0.0196
这不到两美分。
现在假设同样的 100,000 token 前缀已被缓存:
缓存命中输入:
100,000 / 1,000,000 × $0.0028
= $0.00028
输出:
20,000 / 1,000,000 × $0.28
= $0.0056
总计:
$0.00588
此时输出费用成为账单的主要部分。
这些示例解释了为什么低成本的编码原型是可行的。
它们并不包含:
- 服务商加价。
- 工具 API 费用。
- 浏览器或搜索成本。
- 沙箱计算资源。
- 存储。
- 反复失败的尝试。
- 人工开发时间。
为什么智能体账单仍可能增长
智能体编码很少只涉及一次请求。
一个典型的工作流程可能包括:
- 读取代码仓库。
- 搜索相关代码。
- 规划变更方案。
- 编辑多个文件。
- 运行测试。
- 检查失败原因。
- 再次编辑。
- 再次运行测试。
- 审查差异。
- 生成最终答案。
每一步都可能产生一次新的模型调用。
在以下情况下,看似很小的任务也可能变得昂贵:
- 仓库上下文反复未命中缓存。
- 模型生成很长的推理过程。
- 测试多次失败。
- 智能体不必要地读取大文件。
- 多个并行智能体重复工作。
- 上下文压缩导致重要信息被重新发送。
- 模型在已达良好解决方案后仍不停止。
V4 Flash 降低了这些失误的成本。
但并未消除它们。
上下文缓存是主要的成本杠杆
DeepSeek 使用基于磁盘的上下文缓存。
当相同的前缀被复用时,匹配的输入令牌可以获得更低的缓存命中价格。
适合作为稳定前缀的候选内容包括:
- 系统指令。
- 仓库策略。
- 工具定义。
- 长参考文档。
- 未变更的项目快照。
- 重复的企业上下文。
一个简化的提示词设计是:
稳定的可复用前缀
+
新的用户请求
+
最新的工具结果
一个不太利于缓存的设计是:
重排的指令
+
重写的仓库摘要
+
变化的时间戳
+
随机请求元数据
+
新的用户请求
细微的前缀变化可能会降低缓存复用率。
开发者应检查令牌使用字段,而不是假设长提示词已被缓存。
DeepSeek 还提供 user_id 隔离功能,用于隐私保护和调度。缓存复用和用户隔离应一起设计,以避免一个客户的上下文被意外混入另一个客户的上下文中。
API 快速入门
官方基础 URL 为:
https://api.deepseek.com
模型 ID 为:
deepseek-v4-flash
DeepSeek 表示,稳定的 API ID 会自动提供最新的官方 Flash 版本。
这很方便,但生产团队应记录返回的模型指纹并测试变更,因为稳定 ID 背后的行为可能会被升级。
Python 示例
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Review this function and propose a safe refactor.",
}
],
)
print(response.choices[0].message.content)
cURL 示例
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "user",
"content": "Write a small Python CLI that validates JSON files."
}
]
}'
开发者应查看实时 API 参考文档,以确认其端点和 SDK 版本支持的确切推理强度(reasoning-effort)和思考模式(thinking-mode)字段。
幾分鐘搭建展示站並增長獲客
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
必须保留思维历史
DeepSeek 的思考模式文档指出,当一个轮次包含工具调用时,助手消息中的 reasoning_content 必须在后续请求中传回。
多轮代理应保留:
contentreasoning_contenttool_calls
丢弃推理状态可能会降低连续性或导致请求验证问题。
这在通过通常忽略提供商特定推理字段的 OpenAI 兼容客户端进行集成时尤为重要。
OpenAI、Anthropic 和 Responses 兼容性
DeepSeek 提供多种接口。
OpenAI Chat Completions
使用标准的 DeepSeek 基础 URL 和模型 ID:
deepseek-v4-flash
Anthropic 兼容 API
DeepSeek 还记录了 Anthropic 格式的接口。
这有助于构建在
围绕Claude风格的消息连接到DeepSeek,可以减少应用程序改动。
兼容性并不保证行为完全一致。
提供商特定字段、推理历史、工具架构、安全行为和错误处理仍需要测试。
Responses API
DeepSeek表示,0731版本原生支持Responses API格式,并已适配为Codex风格的使用方式。
这对编码代理产品很重要,因为这些产品越来越依赖有状态的响应对象、工具调用和结构化的代理循环。
采用MIT许可证的开放权重
DeepSeek已在Hugging Face上以MIT许可证发布了V4 Flash 0731权重。
这允许开发者在遵守许可证条款的前提下检查、修改、部署和重新分发该模型。
相比仅提供API的模型,开放权重发布提供了更多控制权。
团队可以:
- 在私有基础设施上运行模型。
- 研究其架构。
- 构建量化变体。
- 适配推理内核。
- 微调或定制化模型。
- 将其集成到内部系统中。
- 避免将敏感代码发送到第三方API。
实际障碍在于硬件。
“开放权重”并不意味着“可以在普通笔记本电脑上运行”。
vLLM部署
官方0731模型卡提供了单个4×GB300节点的vLLM示例:
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code \
--kv-cache-dtype fp8 \
--block-size 256 \
--data-parallel-size 4 \
--enable-expert-parallel \
--moe-backend deep_gemm_mega_moe \
--attention-config '{"use_fp4_indexer_cache": true}' \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
该示例展示了全质量服务所预期的基础设施级别。
不应将其解读为唯一受支持的配置。
vLLM配方未来可能会增加对其他GPU拓扑的支持。
SGLang部署
官方SGLang示例为:
sglang serve \
--trust-remote-code \
--model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
--tp 4 \
--moe-runner-backend flashinfer_mxfp4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.90 \
--chunked-prefill-size 4096 \
--swa-full-tokens-ratio 0.1
目标权重和草稿权重来自同一检查点,因此文档说明无需单独设置推测性草稿模型路径。
推理引擎发展迅速。
请使用当前的模型卡和服务引擎配方,而不要从Preview版本复制旧的启动命令。
本地部署仍然是一个基础设施项目
尽管仅约
对于任意给定token,13B参数为激活状态,这意味着完整模型权重在整个服务系统中必须始终保持可用。
部署规划必须考虑:
- 模型总存储量。
- GPU内存。
- 专家并行。
- 互连带宽。
- 长上下文KV缓存。
- 量化支持。
- DSpark内核。
- 批处理大小。
- 并发性。
- 预填充延迟。
- 解码吞吐量。
较小的量化可能支持在不同硬件上进行实验,但可能会改变质量、速度或受支持的上下文长度。
对于大多数个人开发者来说,使用直接API或
托管服务提供商会比自托管更简便、更具成本效益。
官方 API 与第三方提供商的比较
使用 V4 Flash 有三种常见方式。
| 路线 | 主要优势 | 主要权衡 |
|---|---|---|
| DeepSeek API | 官方定价和当前官方模型 | 数据离开你的环境;稳定 ID 可能会更新 |
| 第三方平台 | 免费额度、集成智能体、更简便的计费 | 促销活动和路由可能会发生变化 |
| 自托管权重 | 最大程度地控制和保护隐私 | 需要大量硬件和工程资源 |
最具成本效益的路线取决于你的工作负载。
免费的 Cline 或 OpenCode 额度可能非常适合实验。
直接 API 可能最适合可预测的小规模使用。
只有当使用量足够大且持续稳定,或隐私要求优先时,自托管才可能具有吸引力。
原型开发的最佳时代
源文章将廉价 AI 比作汽车的大规模生产。
这个类比并不完美,但很有用。
当一项技术的成本大幅下降时,市场不会简单地用更少的钱购买相同数量的产品。
新的用例会变得可能。
低成本的智能体模型可以支持那些以前在测试前就会被否决的实验。
例如:
- 学生构建第一个软件原型。
- 独立创始人生成并测试多个落地页创意。
- 小团队对每次拉取请求进行代码审查。
- 开源项目提供免费的问题分类服务。
- 研究人员处理大型代码或文档集。
- 公司为重复性工作创建内部智能体。
- 游戏开发者测试生成的机制和关卡。
其价值不在于模型取代了所有软件工程。
而在于它降低了提出以下问题的成本:
这个想法值得进一步构建吗?
原型不是产品
廉价的生成可以产出令人信服的首次演示。
但生产级产品仍然需要:
- 产品设计。
- 安全性。
- 测试。
- 可访问性。
- 性能。
- 监控。
- 部署。
- 数据保护。
- 法律审查。
- 维护。
- 客户支持。
七美分的模型账单并不意味着七美分的业务。
它意味着第一次计算实验的代价可能足够低,值得尝试。
这改变了谁可以参与,以及可以测试多少想法。
一个社区构建的工作区示例
源文章包含一个轻量级文档工作区,作为开发者使用廉价编码智能体所构建内容的一个示例展示。

DeepSeek 自己在 7 月 31 日的更新日志中也提到,用于基准评估的 DeepSeek Harness 极简模式“即将发布”。
截至核验时,我未能找到:
- 公开的官方 DeepSeek Harness 仓库。
- “DeepSeek Code”的稳定产品页面。
- 公开的安装说明。
- 定价信息。
- 发布日期。
- 完整的功能规格说明。
现有证据支持以下更窄范围的结论:
DeepSeek 正在测试一个智能体框架,并打算至少发布该框架的一部分,但最终产品名称、公开范围和发布时间仍未确认。
模型、API 和开放权重现已可用。
该框架仍是未来的生态组件。
为什么 DeepSeek Harness 可能很重要
第一方框架可能有助于 DeepSeek 控制完整的编码智能体技术栈。
它可能提供:
- 原生推理历史处理。
- 特定模型的提示词格式。
- 工具调用解析。
上下文管理。
- 仓库搜索。
- 终端执行。
- 基准测试可复现性。
- Responses API 集成。
- 兼容 Codex 的工作流。
- 成本控制。
- Flash 与 Pro 之间的自动路由。
DeepSeek 已经记录了与外部测试框架和编程代理的集成。
第一方工具可以将针对基准测试的优化转化为普通开发者可以使用的产品。
它还可以揭示 V4 Flash 0731 基准测试提升中有多少来自检查点,多少来自代理运行时。
接下来值得关注的内容
几项进展将决定 V4 Flash 时刻是否会成为持久的生态系统转变。
官方 V4 Pro 发布
DeepSeek 表示,官方 V4 Pro 版本将紧随 Flash 更新之后发布。
Pro 与 Flash 之间的性能和定价差距将影响路由决策。
DeepSeek Harness 的可用性
公开发布将提高基准测试的可复现性,并为开发者提供模型原生的代理框架。
价格稳定性
直接价格已经很低,但第三方促销可能不会持续。
服务商容量
廉价推理会吸引极高的流量。
随着使用规模扩大,延迟、速率限制和可靠性将变得至关重要。
开源推理支持
vLLM、SGLang、硬件供应商和量化项目将决定自托管变得多容易实现。
独立评估
更多公开评估应测试:
- 编码能力。
- 安全性。
- 事实可靠性。
- 长上下文。
- 工具使用。
- 每项成功任务的成本。
- 在不同测试框架下的表现。
常见问题
什么是 DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 是 V4 Flash 的官方 7 月 31 日版本,目前通过 deepseek-v4-flash API 以公开测试版形式提供服务。DeepSeek 表示,它保留了 Preview 模型的基础架构和规模,同时通过新的后训练显著提升了代理能力。
DeepSeek V4 Flash 的价格是多少?
DeepSeek 官方 API 的定价为:每百万缓存未命中输入 token 0.14 美元,每百万缓存命中输入 token 0.0028 美元,每百万输出 token 0.28 美元。第三方平台可能提供不同的价格、免费配额或临时折扣。
生成一个 3D 游戏真的只需要 0.07 元人民币吗?
来源文章引用了社区示例中报告的模型成本。该示例没有附带完整的提示词、token 日志、缓存数据、重试次数、工具成本或人工工作记录,因此应将其视为轶事而非保证预算。
V4 Flash 0731 的主要基准测试分数是多少?
DeepSeek 报告 Terminal Bench 2.1 得分 82.7,CyberGym 得分 76.7,DeepSWE 得分 54.4,Toolathlon-Verified 得分 70.3,NL2Repo 得分 54.2。公开的代码代理评估使用了未发布的 DeepSeek Harness 极简模式,并采用最大推理努力。
DeepSeek V4 Flash 0731 是开源的吗?
模型权重和仓库根据 MIT 许可证发布,因此“开放权重”和“广泛许可使用”是准确的描述。运行完整检查点仍然需要大量多 GPU 基础设施。
DeepSeek V4 Flash 可以在本地运行吗?
可以,DeepSeek 发布了权重和部署说明。
用于 vLLM 和 SGLang。官方完整示例使用先进的多 GPU 硬件,因此普通笔记本电脑并非完整模型的目标运行环境。
什么是上下文窗口?
官方 API 和模型卡指定的上下文窗口为 100 万 token。API 还列出了最大输出长度为 384K token,但使用最大上下文或最大输出会显著增加延迟和资源消耗。
DeepSeek Code 或 DeepSeek Harness 是否已发布?
DeepSeek 已公开提及 Harness 最小模式,并招募了开源 harness 开发者进行内部测试。验证过程中未找到完整的公共代码仓库、最终产品规格以及确认的发布日期。
相关工具
- DeepSeek API:官方平台,提供 API 密钥、计费以及直接访问 DeepSeek 模型。
- DeepSeek V4 Flash 0731(Hugging Face):官方开放权重检查点、模型卡、基准测试表、许可证和部署说明。
- vLLM:开源高吞吐量服务引擎,支持 DeepSeek V4 和 DSpark。
- SGLang:开源服务框架,已发布 V4 Flash 0731 部署路径。
- OpenCode:开源编码代理,其 Zen 服务目前提供限时免费的 V4 Flash 选项。
- Cline:开源编码代理和模型平台,通过其提供商生态提供 DeepSeek V4 Flash。
- Nous Portal:多模型推理平台,曾开展限时 DeepSeek V4 Flash 推广活动。
- Artificial Analysis:独立模型分析平台,涵盖智能水平、速度、价格和基准测试成本。
相关链接
- DeepSeek 7 月 31 日更新日志:官方发布状态、基准测试结果、方法论说明、API 范围和后训练声明。
- DeepSeek 模型与定价:当前官方价格、上下文长度、输出限制、功能特性和并发数。
- DeepSeek V4 Flash 0731 模型卡:架构说明、基准测试对比、推理努力等级、DSpark 配置和 MIT 许可证。
- DeepSeek V4 技术模型卡:原始 V4 架构、参数量、技术报告和模型系列评估。
- DeepSeek 思考模式指南:关于推理输出以及跨工具调用保留
reasoning_content的官方指南。 - DeepSeek 代理集成:将 V4 Flash 连接到终端编码 harness 的官方示例。
- OpenCode Zen 模型:当前模型目录和限时免费模型信息。
- [Artificial Analysis V4 Flash 0731
摘要
DeepSeek V4 Flash 0731 保留了预览版模型的基础
架构和规模保持不变,但新的后训练技术带来了编码智能体性能的重大飞跃。DeepSeek 报告在 Terminal Bench 2.1 上得分为 82.7,在 CyberGym 上为 76.7,在 DeepSWE 上为 54.4,不过最强劲的公开编码智能体结果依赖于尚未发布的 DeepSeek Harness 配置。
官方 API 定价异常低廉:每百万未缓存输入 token 0.14 美元,每百万缓存输入 token 0.0028 美元,每百万输出 token 0.28 美元。第三方免费额度和折扣可以使访问成本更低,但这些促销是临时性的,不应误认为是永久标价。
MIT 开放权重许可、100 万 token 上下文窗口、Responses 和 Anthropic 兼容 API,以及 vLLM 和 SGLang 的支持,使该模型在托管和自管部署路径上均易于使用。完整本地部署仍然是一项严肃的多 GPU 基础设施工程。
广为流传的七美分和五十美分原型是边际模型成本可以低至何种程度的有力例证,但它们并非完整的产品成本分析。智能体循环、输出长度、缓存未命中、工具、测试和人力成本仍然重要。
DeepSeek V4 Flash 0731 之所以重要,并非因为每项应用现在只需几美分,而是因为强大的智能体编码已变得足够实惠,让更多开发者能够以有意义的规模进行尝试。



