引言
DeepSeek创始人梁文锋最近就公司对定价、成本效率、开源模型和商业化的思考,给出了迄今为止最清晰的解释之一。
在一次据称长达四小时的投资者会议上,梁文锋表示,DeepSeek的定价并非为了追求收入最大化。相反,公司的目标是获得他所说的合理利润,同时保持模型价格足够低廉,以便广泛使用。
最明显的例子是DeepSeek-V4-Pro。该模型最初定价相对较高,因为公司预计需求将超过其可用高端计算能力。DeepSeek后来将价格降至原价的四分之一,并永久性降低了75%。
梁文锋的观点超越了传统的价格促销。他将低成本视为架构和工程效率的结果——也是在有限计算资源下进行前沿模型研究的必要条件。
网上流传的会议评论是根据有限材料整理的,并非DeepSeek发布的官方逐字记录。因此部分措辞可能与现场发言有所不同。本文中的当前模型名称、特性和API价格已与DeepSeek官方文档核对。
DeepSeek表示追求合理利润而非收入最大化
梁文锋定价评论的核心思想是克制。
大多数科技公司都被期望增加收入、扩大市场份额、建立销售组织,并从成功产品中获取尽可能多的价值。DeepSeek的既定目标则更为有限。
据报道,梁文锋表示:
"我们只赚取合理利润。"
这一表述并不意味着DeepSeek拒绝商业活动。公司对API使用收费,运营消费产品,服务开发者,并持续扩大模型访问权限。
区别在于商业运营与商业最大化之间。
DeepSeek似乎愿意获得足以运营服务和支持开发的收入,但目前不希望定价决策被从每个用户身上榨取最高利润的目标所主导。
这一理念反映了公司对通用人工智能的更高关注。梁文锋将产品和服务描述为通往更强大系统的路径上的步骤,而非公司的最终目标。
DeepSeek-V4-Pro价格降至原价的四分之一
DeepSeek-V4-Pro提供了这一方法的具体例证。
该模型上线时,其API定价明显高于较轻量级的V4-Flash模型。DeepSeek将原因归结于高端计算能力受限,并预期随着更多基础设施可用,价格将会下降。
2026年5月,公司永久降价75%。
据报道,以人民币计价的价格从大约每百万token 0.1至24元降至每百万token 0.025至6元,具体取决于是缓存输入、未缓存输入还是输出。
据称梁文锋解释,V4-Pro最初定价较高是因为深度求索担心需求过大。一旦具备降价条件,公司便直接将价格降至四分之一。
根据会议记录,员工们对这一降价表示庆祝,因为构建模型的初衷就是让更多人充分使用它。
这种表述不同寻常。通常降价被描述为获取客户、竞争定位或市场份额增长的手段。而梁文锋却将其呈现为模型宗旨与其可及性之间更完美的契合。
当前深度求索API定价
深度求索官方API文档目前列出两个主要V4端点:
| 模型 | 缓存输入(每百万Token) | 非缓存输入(每百万Token) | 输出(每百万Token) | 上下文长度 |
|---|---|---|---|---|
| DeepSeek-V4-Flash | 0.0028美元 | 0.14美元 | 0.28美元 | 100万Token |
| DeepSeek-V4-Pro | 0.003625美元 | 0.435美元 | 0.87美元 | 100万Token |
根据当前文档,两种模型均支持思考与非思考模式、JSON输出、工具调用、对话前缀补全,以及最大100万Token的上下文长度。
列出的并发限制中,V4-Flash高于V4-Pro:
- V4-Flash:2,500
- V4-Pro:500
深度求索同时声明价格可能变动,并建议在估算生产成本前查阅官方定价页面。
旧版deepseek-chat和deepseek-reasoner模型名称计划于2026年7月24日停用。目前它们为兼容性而映射到deepseek-v4-flash的非思考与思考模式。
深度求索为何初始定价更高
高首发价并不总意味着公司认为产品价值永久提升。
它也可能是一种容量管理机制。
当需求超过推理计算可用供应时,服务商有几种选择:
- 创建等待名单。
- 实施严格速率限制。
- 保留仅限特定客户的访问权限。
- 减少模型可用功能。
- 通过提高定价抑制需求。
- 扩展基础设施并后续降价。
深度求索似乎综合运用了定价与容量限制策略。
V4-Pro需要更稀缺的高端计算资源,因此较高初始价格降低了需求压垮服务的可能性。当获得更多容量与效率提升后,公司便可更广泛地提供该模型。
这与因客户愿意支付而设定高价截然不同。
前者将价格视为临时资源分配工具,后者则将价格作为获取最大感知价值的手段。
梁文锋的言论表明,深度求索倾向于在容量限制解除后降低价格。
低成本是架构成果,而非单纯商业策略
据称梁文锋强调,深度求索的低成本并非单纯的商业策略。
它是模型架构、系统工程和硬件感知优化的共同成果。
深度求索始终专注于通过有限计算预算提升有效模型能力的技术手段。
其研究中的示例包括:
- 混合专家架构(仅对每个词元激活模型的部分参数)
- 多头潜注意力(减少键值缓存需求)
- 低精度训练
- 高效通信训练系统
- 硬件感知协同设计
- 上下文缓存
- 稀疏计算
- 优化推理与服务
例如,DeepSeek-V2 总参数量达2360亿,每个词元仅激活210亿参数。其研究论文指出,与早期 DeepSeek 67B 系统相比,该模型训练成本更低、KV缓存显著缩小,且生成吞吐量更高。
DeepSeek-V3 将总参数量扩展至6710亿,每个词元激活370亿参数。该公司报告称,在保持 API 价格低于多数前沿模型服务的前提下,使用14.8万亿词元完成了训练。
DeepSeek-V4 延续该策略,支持百万词元上下文窗口,并推出独立的 Flash 和 Pro 模型。
这些系统并未让计算实现零成本。大型模型仍需昂贵的芯片、网络、电力、工程、存储和数据中心运营投入。
关键在于架构能够改变每单位计算量所产生的模型能力。
成本效率助力 DeepSeek 训练更大模型
梁更深层的论点涉及研究能力。
拥有无限计算资源的公司可通过增加芯片、扩展集群和增加训练轮次来优化模型。
DeepSeek 的运营条件与美国最大科技公司不同。出口限制、芯片供应、资本需求及基础设施约束均影响其训练能力。
在这种环境下,降低每单位计算成本产生双重效应。
降低用户服务成本
更高效率的推理使 DeepSeek 能在相同基础设施下处理更多请求,从而降低 API 价格并扩大服务范围。
扩展可训练的模型规模
若训练系统更高效利用计算资源,公司可在固定硬件预算内训练更大或更先进的模型。
据称梁将此差异总结为:大公司通过增加资源解决问题,而 DeepSeek 优先优化成本效率。
这正是 DeepSeek 战略中低价与前沿研究紧密关联的原因。降低推理成本的工程优化,也能帮助其在有限训练资源下取得更大进展。
成本优先于时间与用户体验
在更完整的会议记录中,梁据称提出了前沿模型竞争的三个关键要素:
- 成本
- 时间
- 用户体验
成本被列为首位。
当两家公司提供质量相近的模型时,能以更低成本提供服务的一方具有结构性优势。其可以定价更低、支撑更多用户、开展更多内部实验,或将节省成本投入下一轮训练。
时间位列次席,因为数月的领先优势在快速变化的市场中至关重要。模型、硬件、智能体框架及客户预期均瞬息万变。
用户体验可以建立忠诚度,但据报道梁文锋并未将其描述为最根本的技术护城河。
这种优先级排序有助于解释为何深度求索在架构和基础设施上大力投入,同时保持销售和产品团队的相对精简。
深度求索以小型团队运营API业务
据报道,梁文锋表示他认为API业务本身并不特别有吸引力。
这一评论可能听起来令人惊讶,因为API收入是前沿模型提供商的主要商业模式之一。
从运营模式来看,深度求索的立场更容易理解。
根据会议纪要:
- 一个小型团队即可维护服务。
- 公司的客户支持非常有限。
- 不需要庞大的销售团队。
- 用户自行发现并集成模型。
- 产品需求由模型能力和价格驱动。
这是一种产品主导的分销模式。
深度求索没有雇佣大型企业销售团队去谈判合同,而是发布模型、提供兼容API、公开文档,让开发者直接开始使用服务。
这种方法可以保持较低的运营成本,但也有代价。
大型组织通常需要:
- 采购支持
- 安全文档
- 服务等级协议
- 账户管理
- 迁移协助
- 合规审查
- 专用容量
- 事件响应支持
- 集成咨询
精简的商业组织可能适合自助服务的开发者和技术能力强的团队,但对于期望全面支持和合同保障的企业来说,可能不太适用。
"我们正在商业化,但商业化不是目标"
据报道,梁文锋表示深度求索一直在商业化,但并不把商业化视为最终目的。
这并不等同于说公司没有商业模式。
深度求索目前拥有多个可支撑收入或战略价值的机制:
- 付费API接入
- 消费者应用
- 开发者采纳
- 企业使用
- 模型生态系统增长
- 开源权重分发
- 技术许可或合作伙伴关系
- 基础设施合作
- 人才吸引
- 潜在未来产品
幾分鐘搭建展示站並增長獲客
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
这一表述更应理解为优先级排序。
深度求索的首要目标是提升模型能力并追求通用人工智能(AGI)。商业活动服务于这一努力,但公司不希望短期收入目标将研究方向转向每一种热门产品类别。
据报道,梁文锋表示深度求索全面转向商业化的时机仍然遥远。
在拥有充足资金、耐心投资者或其他财务支持来源时,这一立场可能更容易维持。然而,随着算力需求增长,即便是以研究为中心的实验室也必须应对基础设施成本、员工留存和长期运营等问题。
即使未实现利润最大化,低价也可成为竞争武器
深度求索可能不会将其定价描述为市场份额争夺,但低价仍然会影响竞争对手。
一家提供商以低于成本
具备竞争质量的模型,其价格仅为市场主流API成本的一小部分,这迫使市场做出应对。
竞争对手可能需要:
- 降低价格
- 推出更小规模的模型
- 优化缓存机制
- 提供批量折扣
- 优化推理效率
- 创建更便宜的层级路由
- 将模型与云服务捆绑销售
- 通过工具、可靠性或支持服务来证明高溢价的合理性
最终结果是AI部署成本的全面降低。
这一变化惠及了以往无力承担大规模模型使用的开发者、初创公司、研究机构和企业。
同时,这也给那些依赖高毛利率维持盈利的模型供应商带来了压力。
因此,即便DeepSeek宣称其目标并非利润最大化,其定价策略仍具有商业影响。
开源模型是同一策略的组成部分
梁文锋关于定价的言论与DeepSeek对开源模型发布的支持密切相关。
据报道,他将开源描述为放弃公司部分潜在利益的行为。
公开模型权重允许:
- 研究人员研究模型架构
- 开发者私密运行模型
- 企业进行微调或适配
- 基础设施提供商优化部署
- 竞争对手从成果中学习
- 更广泛的生态系统在不使用DeepSeek托管API的情况下进行构建
从狭隘的商业视角看,这可能会削弱API的锁定效应。
但从DeepSeek的角度看,开源模型还能带来:
- 技术影响力
- 开发者采纳度
- 研究反馈
- 招聘价值
- 组织自豪感
- 更快的生态创新
- 在全球AI对话中更强的地位
据报道,梁文锋表示DeepSeek不会发布一个刻意弱化的模型,同时保留一个实质上更强的版本。
这一说法需要根据每次发布具体评估,但它反映了公司的公开定位:开放获取不仅是营销样本,而是研究策略中具有实质意义的一部分。
"合理利润"并非意味着什么
"合理利润"这一表述颇具吸引力,但它并非精确的财务指标。
DeepSeek尚未公开定义:
- 目标毛利率
- 目标营业利润率
- 基础设施的必要回报率
- 研究成本如何分摊到API定价中
- 消费产品是否得到补贴
- 定价如何随芯片供应变化
- 内部预留了多少算力
- 未来的企业服务是否采用不同的利润率
因此,这一表述应被理解为意向声明,而非公开的定价公式。
它也不保证价格永远不会上涨。
DeepSeek的官方文件指出产品价格可能变动。算力限制、硬件成本、需求、模型规模和服务要求都可能影响未来定价。
一家公司可以在拒绝利润最大化的同时,在服务成本上升时提高价格。
廉价Token与低总成本之间的区别
每百万Token的API价格易于比较,但这并不能反映使用模型的总成本。
一个生产级应用还应该考虑以下方面:
指标:
- 模型完成任务所需的令牌数量。
- 是否需要重试。
- 工具调用的质量。
- 延迟。
- 缓存命中率。
- 上下文长度。
- 输出长度。
- 错误率。
- 人工审核时间。
- 负载下的可靠性。
- 切换模型的成本。
- 支持与服务保障的价值。
一个令牌单价较低的模型,如果其回答冗长、频繁失败或需要大量修正,整体成本反而可能更高。
一个较昂贵的模型若能一次解决问题,反而可能更经济。
因此,DeepSeek的成本优势应在完整工作流程的层面进行测试,而非仅依据其公布的令牌费率。
开发者在选择DeepSeek API前应检查的事项
模型匹配度
根据实际任务比较V4-Flash和V4-Pro。对于高吞吐量工作流,Flash可能足够;而对于复杂的编码、推理或智能体任务,Pro可能更合适。
缓存行为
缓存的输入比未缓存的输入便宜得多。对于具有重复系统提示、共享文档或稳定上下文的应用,缓存可以带来显著的成本优势。
输出长度
两种模型的输出费用均高于输入。不必要的冗长推理轨迹或啰嗦的回复会主导账单。
并发能力
文档中记载的并发限制在Flash和Pro之间有所不同。高吞吐量产品应尽早测试容量需求。
模型名称
仍在使用deepseek-chat或deepseek-reasoner的开发者应迁移到V4模型标识符,因为旧名称已计划弃用。
供应商风险
DeepSeek保留更改价格的权利。生产系统应避免硬编码依赖于某一固定价格的经济假设。
支持需求
对于个人开发者来说,自助式API访问可能就足够了。企业在将某个供应商标准化之前,应确认其安全性、合规性、服务和支持预期。
DeepSeek策略的战略优势
DeepSeek的定价模式创造了几个潜在优势。
更广泛的采用
低价格降低了实验成本,使较小规模的团队也能使用这些模型。
更多使用数据和反馈
更大的用户基础能产生更多关于失败案例、流行工作流、基础设施瓶颈和开发者需求的信息。
向高效工程的压力
当公司无法依赖高额利润时,就会产生强大的动力去改进架构和服务效率。
更强的开放生态系统
价格实惠的托管API和可下载的权重相辅相成。开发者可以从API开始,之后再过渡到私有部署。
人才与研究声誉
致力于前沿研究、开放发布和长期技术目标的实验室更能吸引工程师。
风险与权衡
同样的策略也带来了挑战。
基础设施需求
极低的价格吸引的需求可能超过容量增长的速度。
有限的企业支持
较小的销售和支持团队可能会减缓在高监管或采购流程繁重的组织中的采用速度。
可持续发展
前沿模型的训练成本持续攀升。合理的利润仍需覆盖服务运营,并为未来的研究提供支持。
价格预期
一旦开发者习惯了极低的价格,未来的提价可能面临困难。
竞争应对
大型云服务商和模型提供商能够补贴低成本层级、将模型与基础设施捆绑,或利用规模效应压降价格。
商业重心
规避非核心产品有助于保持研究专注,但也可能将有价值市场拱手让给竞争对手。
常见问题
梁文锋对DeepSeek的定价策略有何看法?
据报道,梁文锋表示DeepSeek的目标是赚取合理利润而非收入最大化。他将低价策略与公司让强大模型广泛可用、提升成本效率的目标联系起来。
DeepSeek是否将某个模型价格降低了75%?
是的。DeepSeek将V4-Pro永久降价75%,价格降至原价的四分之一。具体费用取决于缓存输入、非缓存输入和输出用量。
为什么DeepSeek-V4-Pro发布时价格昂贵?
DeepSeek表示当时高端算力资源受限。较高的初始价格有助于控制需求,直到获得更多算力和更高效率。
当前DeepSeek-V4的API价格是多少?
DeepSeek官方文档显示,V4-Flash每百万缓存输入令牌收费0.0028美元,非缓存输入令牌0.14美元,输出令牌0.28美元。V4-Pro对应价格分别为0.003625美元、0.435美元和0.87美元。
DeepSeek反对商业化吗?
不反对。据报道,梁文锋称公司始终追求商业部署,但商业化并非最终目标。其优先事项仍是模型研究与长期通用人工智能(AGI)追求。
DeepSeek如何提供低廉的API价格?
DeepSeek将其成本优势归因于模型架构、稀疏计算、缓存技术、低精度训练、基础设施优化以及轻量级运营模式。硬件可用性和算力容量也影响定价。
DeepSeek是否提供企业销售和支持服务?
DeepSeek提供文档、API、使用限制和扩容请求,但梁文锋表示公司运营团队规模较小,传统销售和客户支持基础设施有限。企业应核实现有支持能否满足自身需求。
DeepSeek API价格会保持不变吗?
不一定。DeepSeek官方定价页面声明价格可能变动,公司保留调整权利。开发者在估算成本时应查阅最新文档。
相关工具
- DeepSeek Chat:DeepSeek官方网页界面,用于与当前模型交互。
- DeepSeek API平台:获取API密钥、管理用量、计费及模型访问的官方平台。
- DeepSeek API文档:官方集成指南、模型信息、定价、限制与变更日志。
- DeepSeek GitHub
模型研究、推理组件、训练系统及开源项目的官方仓库。
- Hugging Face上的DeepSeek:官方开源权重模型发布、模型卡片及可下载检查点。
- DeepSeek-V4合集:包含Flash、Pro、基础及部署变体的官方V4模型合集。
相关链接
- DeepSeek模型与定价:当前官方API价格、上下文限制、功能及模型名称。
- DeepSeek V4预览版发布:关于V4-Pro、V4-Flash、上下文长度及API访问的官方信息。
- DeepSeek API更新日志:模型、兼容名称、功能及可用性的官方更新。
- DeepSeek-V4 Hugging Face合集:官方模型权重及相关发布版本。
- DeepSeek-V3发布:V3的官方架构及历史API定价信息。
- DeepSeek-V2研究论文:关于DeepSeekMoE、多头潜在注意力、训练效率及推理改进的技术细节。
- 梁文锋投资者会议发言公开汇编:第三方汇编资料,部分措辞可能与原始发言存在差异。
总结
梁文锋公开的定价言论表明,DeepSeek将成本效率视为技术及战略目标,而非单纯吸引客户的手段。
该公司最初对V4-Pro设定高价,旨在高端计算资源有限的情况下调控需求,随后在具备更广泛服务能力时降价75%。目前V4-Flash和V4-Pro的官方API价格均维持在低位。
DeepSeek正将其技术商业化,但梁文锋并未将收入最大化描述为公司的终极目标。其模式融合了自助分发、小型运营团队、开源权重发布、架构效率优化以及对AGI研究的长期专注。
DeepSeek的核心定价逻辑在于:能够以最高效路径构建强大模型的公司,无需对每次调用收取最高费用,即可拓展访问规模、参与全球竞争,并为未来发展提供资金。



