DeepSeek API 定价将于8月16日调整——实际费用如下
根据8月16日高峰与低谷定价方案,计算DeepSeek V4 Pro和Flash的成本,并提供实际预算示例。

DeepSeek 即将让 API 预算管理变得更加复杂——同时也可能更具可控性。2026年8月16日 UTC 时间16:00,该公司计划将其当前的 V4 统一费率替换为高峰和低谷价格。低谷时段的使用费用将是高峰时段的一半,这直接激励用户将灵活的工作负载从繁忙时段转移出去。
该变更同时影响DeepSeek-V4-Flash和新发布的正式版DeepSeek-V4-Pro。这一变化也足以改变经济性,使得旧的成本对比将变得具有误导性。本文将官方每百万token定价表转化为实际工作负载场景,并解释如何避免最常见的预算编制错误。
首先,时机
截至本文验证日期——8月14日——新时间表已公布但尚未生效。DeepSeek表示,该时间表将于8月16日16:00 UTC开始。指定的高峰时段为01:00–04:00 UTC和06:00–10:00 UTC。所有其他时段均为非高峰时段。
由于定价是实时运营信息,请在充值账户或发布计算器前确认官方定价页面。以下费率反映的是该页面截至2026年8月14日的情况。
预定价格表
价格按每百万个令牌计算。
| 模型与时段 | 缓存输入 | 非缓存输入 | 输出 | |---|---:|---:|---:| | V4 非高峰闪存 | $0.007 | $0.22 | $0.66 | | V4 闪存峰值 | $0.014 | $0.44 | $1.32 | | V4 Pro 非高峰时段 | $0.022 | $0.66 | $1.98 | | V4 Pro 峰值 | $0.044 | $1.32 | $3.96 |
三种模式显而易见:输出是昂贵的类别。缓存未命中的代价远高于缓存命中。专业版大约是相应闪存价格的三倍。这些比率比单一标价更有用,因为实际应用的数据输入/输出比例各不相同。
典型请求的费用
假设一个支持助手读取了8,000个未缓存的输入令牌并生成了1,000个输出令牌。在非高峰Flash定价下,模型成本大约为:
(8,000 / 1,000,000 × $0.22) + (1,000 / 1,000,000 × $0.66) = $0.00242
在Flash定价高峰期,价格翻倍至约0.00484美元。使用Pro方案,相同的代币组合在非高峰期成本约为0.00726美元,高峰期则为0.01452美元。
这些数字看起来很小,但数量级会改变情况。如果每月有一百万次这样的请求,仅模型成本在非高峰时段使用Flash与高峰时段使用Pro之间的差异就约为12,100美元。工具调用、搜索API、存储、可观测性、重试以及人工审核还会增加更多成本。
现在考虑一个编码代理,它每项任务消耗12万个未缓存的输入标记并生成2万个输出标记。Flash在非高峰期成本约为0.0396美元,高峰期约为0.0792美元。Pro在非高峰期成本约为0.1188美元,高峰期约为0.2376美元。如果Pro模型能显著减少失败尝试的次数,它仍然可能是经济的。你需要成功率来做决定。
## 缓存命中可能改变结果
缓存输入与非缓存输入之间的差距巨大。对于V4 Pro非高峰时段,一百万非缓存输入令牌的成本为0.66美元,而缓存输入的成本仅为0.022美元。这使得提示架构成为一个经济问题。
将稳定、可复用的材料放置在提供商的缓存机制能够识别的位置。避免更改大型静态前缀中的空白、顺序、时间戳或不相关的元数据。将持久的指令和参考文档与每个请求的用户内容分开。然后测量实际的缓存命中使用情况,而不是假设设计有效。
缓存不应被用来为发送所有内容找理由。一个更小、更相关的提示往往比缓存的大量噪音更可靠。优先优化相关性,其次才考虑可缓存性。
## 如何使用非高峰定价
许多AI任务并非真正的实时任务。隔夜报告生成、仓库索引、嵌入刷新、文档分类、合成数据创建、评估运行以及低优先级的内容草稿都可以等待。
构建一个包含三个服务类别的队列:
1. **即时运行:**立即执行并接受当前汇率。
2. **灵活:** 安排下一个非高峰时段。
3. **批处理:** 在非高峰时段按受控批次进行处理。
仔细处理UTC时间窗口。夏令时变化可能会改变本地时钟映射。将调度时间以UTC格式存储,并向操作员显示转换后的时间。添加随机抖动,使每个排队任务不会在精确边界启动,并限制并发量以避免重试风暴。
## 导致成本预测失误的常见错误
第一个错误是只统计可见文本。分词器对单词、代码、标点符号、JSON 和多语言内容的分割方式不同。请使用 API 报告的用量。
第二点是忽略代理循环。一个“用户请求”可能触发数十次模型调用、搜索操作、测试运行和修复。预算按每个完成的任务计算,而不是按每条聊天消息计算。
第三点是认为最大思考量是免费的质量。更强的推理投入会增加延迟和消耗。将简单工作分配给低投入,日常智能体任务分配给高投入,仅在评估显示有收益时使用最大投入。
第四点是忘记失败。超时、无效的工具参数、上下文溢出和被拒绝的输出都会耗费资金。追踪重试原因并修复系统性错误,而不是为重复买单。
第五是将未来定价公布为当前定价。在指定的生效时间之前,旧费率仍然适用。生效后,官方页面为最终依据。
## 更优的模型预算
创建包含以下列的工作表:
- 工作负载名称;
- 每月请求次数;
- 平均缓存输入;
- 平均未缓存输入;
- 平均输出;
- 预期的峰/谷拆分;
- 重试乘数;
- Flash 或 Pro;
- 工具和搜索成本;
- 人工审核会议纪要;
- 成功完成率。
计算低、预期和高三种场景。高场景应包括缓存未命中峰值和额外的代理循环。设置基于每成功任务美元数的警报,而不仅仅是每请求令牌数。
如果您的组织仍在确定AI在其内容或创意流程中的位置,通过[Elser AI](https://www.elser.ai/)进行实验可以帮助您在投入API规模架构之前定义有用的工作流程。清晰的流程可以防止团队为用户不需要的任务优化token价格。
## 常见问题解答
### DeepSeek的新定价何时开始?
DeepSeek 表示时间为2026年8月16日16:00 UTC。请查看实时页面,以防日程有变。
### 高峰时段是什么时候?
公布的峰值时段为UTC时间01:00–04:00和06:00–10:00。其他时段被指定为非峰值时段。
### V4 Pro 的价格是 Flash 的三倍吗?
计划费率大约是每个代币类别中Flash费率的3倍。每个成功任务的总成本可能有所不同,因为质量、重试和人工修复也很重要。
### 什么是存钱最简单的方法?
使用Flash处理已验证的简单工作,在非高峰时段安排灵活任务,减少不必要的输出,提高缓存命中率,并停止重复失败的代理循环。
## 来源与验证
本文以DeepSeek官方API变更日志、模型与定价文档以及V4发布材料为主要来源。产品标签被有意保留:V4 Pro 0813为正式发布(GA),而V4 Flash 0731在验证日期被描述为公开测试版。基准测试数据被标识为供应商报告结果,而非作为独立的Elser AI测试结果呈现。计划中的定价在公告的激活时间之前被标记为未来生效。做出生产或采购决策的读者应重新核对实时文档,因为模型别名、价格、速率限制、测试版状态及功能行为可能在发布后发生变化。对代表性任务进行独立评估仍然是必要的。
## 结论
DeepSeek的峰谷计费系统将时间转化为首要成本变量。最大节省将来自调度、缓存、模型路由、输出控制和故障减少的组合。仅仅复制价格表是不够的。请根据实际token组合建模,并衡量成功业务成果的成本。









































































