DeepSeek API 价格全解:峰谷时段、缓存车道与真实账单

两个开发者查 DeepSeek API 价格,只差一天。8 月 15 日查的那位,看到 Flash 输入每百万 token $0.14;8 月 17 日查的那位,看到同一条车道标着 $0.22 到 $0.44。两个来源都没错——中间隔着一次峰谷计费改制,而你今天搜到的多数价格页,展示的仍是改制之前的世界。

本文以现行价目为准(2026 年 8 月 16 日 16:00 UTC 起生效,直采官方价格页):三条计费车道、峰谷时段在你所在时区的分布、一份 20 亿 token 的真实月账单、怎么估算自己的账单,以及七个把账单压下去的杠杆。

现行价目表(2026 年 8 月 16 日起)

单位统一为美元/百万 token,覆盖三个可调用模型:

计费车道deepseek-v4-flashdeepseek-v4-prodeepseek-v4-flash-vision-exp
输入·缓存命中·谷$0.007$0.022$0.007
输入·缓存命中·峰$0.014$0.044$0.014
输入·缓存未命中·谷$0.22$0.66$0.22
输入·缓存未命中·峰$0.44$1.32$0.44
输出·谷$0.66$1.98$0.66
输出·峰$1.32$3.96$1.32

官方页的三条脚注和数字本身一样重要。谷价恰好是峰价的一半——记住这一条,整张表就能折叠成一个规则。视觉模型的图片按尺寸折算成 token 计入输入。扣费时赠送余额先于充值余额消耗,且平台保留调价权——所以这张表是带时间戳的快照,不是永久宪法。

一百万 token 到底是多大一堆字?大约 330 万英文字符——好几本长篇小说的量——因为一个英文字符约 0.3 token,一个中文字符约 0.6(官方 token 用量文档有换算细节)。一次带长文档的对话请求,输入可能 5 万 token、输出 2 千。乘上每天几千次请求,就进入每天百万级——价目表从这一刻起变成真正的预算文件。

给这张表一个记忆装置:把它想成你家外墙上的三只表。每个请求同时过三只表——缓存未命中表(贵的那只)、缓存命中表(几乎不动)、输出表(峰时 Pro 单价最贵)。后文会回到这三只表。

峰谷时段:电费账单模型

峰谷定价是公用事业行业最老的把戏。同样的电、同样的洗衣机——凌晨两点开动,电表半价转。DeepSeek API 的版本:峰时为 UTC 周一至周五 01:00-04:00 与 06:00-10:00,其余全部时段都是谷时,包括整个周末

换算到各时区:

时区峰时(周一至五)其余
UTC01:00-04:00 + 06:00-10:00夜间、间隙、全周末
北京09:00-12:00 + 14:00-18:00晚间 + 周末
美东21:00-00:00 + 02:00-06:00白天 + 周末

看中间那行:峰时就是中国的工作时间。再看最后一行:美洲的整个工作日——美国的上午到下午——几乎全落在 DeepSeek 的谷时段里。在纽约或圣保罗做开发,你的朝九晚五天然享受夜间电价。在北京,谷时窗口就是你的晚上和周六。

改制于 UTC 8 月 16 日 16:00——北京时间 8 月 17 日 0 点——生效。那周觉得账单警报异常的人没有出现幻觉(我的响了,而我先怀疑警报坏了、才怀疑价格变了):相对旧平价,谷时输入约贵五成,谷时输出约翻倍,峰时各车道约在旧价的 3 到 4.5 倍之间。至于为什么搜出来的价格互相打架,后文单讲。

三只表:缓存命中、缓存未命中、输出

回到墙上的表。每张账单 = 三次读数 × 三个单价:

缓存未命中表:模型读到最近没见过的 token 时转动——新系统提示、新文档、一次性的问题。单价 $0.22-$1.32/百万(随模型和时段),预算就是死在这只表上的。

缓存命中表:请求复用了基础设施近期已持有的前缀——同一份系统提示、同一份文档、对话历史。这些 token 按未命中价约 1/30 计费。缓存在 API 侧默认开启、零配置:前缀重复,折扣自动到账。

输出表:模型写的每个字都在转——包括思考模式下你从未展示的推理过程。峰时 Pro 输出 $3.96/百万,是全表最贵的单价。

怎么知道哪只表在转?API 在每个响应的 usage 字段里直接告诉你:

resp = client.chat.completions.create(...)
u = resp.usage
print(u.prompt_cache_hit_tokens,   # 命中表读数
      u.prompt_cache_miss_tokens,  # 未命中表读数
      u.completion_tokens)         # 输出表读数

把这些字段记录一周,你就能在相信任何估算(包括本文的)之前知道自己的真实命中率。文档里的两条诚实提示:缓存是尽力而为(best-effort),没有命中率承诺;未用的缓存条目数小时到数天后清理。一次性预热不等于永久折扣。

一份真实账单长什么样

理论很便宜。峰谷切换后我每个月都把自己的账单拆成这三条车道看,下面这份真实账单把同样的教训放大到更大规模:一位中文开发者发布的 2026 年 5 月用量报告,带平台数据截图——整个月通过终端编程助手重度使用,旧平价时代。

头条数字:20.4 亿 token,¥227.27,约合 $31。拆分:deepseek-v4-pro 烧掉 ¥192.35(84.6%),15.5 亿 token、13,809 次请求;deepseek-v4-flash 花了 ¥34.93(15.4%),2.83 亿 token。

成本构成是值得纹在手背上的部分:

成本构成Pro 占比Flash 占比
缓存未命中输入74.4%57.1%
输出22.6%40.3%
缓存命中输入3.0%2.6%

反转在这里:这份 Pro 负载的缓存命中率是 93.5%。93% 的输入 token 都走了便宜车道——而缓存未命中仍然占账单的四分之三。这不矛盾,这就是机制。命中 token 按未命中价 1/120 计费(当时的比率),于是那 6.5% 没命中的 token 比其余全部加起来还重。命中率不等于省钱率。决定账单的是未命中 token 的绝对量,那个百分比相比之下是虚荣指标。

现行的 1/30 比率下算术会移动一点,但结论不变:找到是什么在把新鲜前缀塞进你的请求——冷启动的会话、每次请求都变的提示词、频繁更换的文档集——你就找到了你的账单。

估算你的月账单

价目表回答"一个 token 多少钱",预算要的是"我一个月多少钱"。下面三档画像用现行谷时价、假设零缓存命中(保守口径——真实账单通常低于这些数):

轻度——个人脚本与实验。 每天 20 万输入 + 2 万输出 token,Flash:每月约 ¥11-15($1.5-2)。翻一倍也在一杯咖啡预算内。

中度——有真实用户的小应用。 每天 200 万输入 + 20 万输出,Flash:每月约 ¥115-130($16-18)。加上 60% 命中率,输入车道降到零头——$8 以内。

重度——全天候 Agent 编程。 终端代理是输入熔炉:每天 3000 万输入 + 300 万输出,Flash:Pro 按 3:1 混跑,过首遍后大部分命中:月账单 $60-120,取决于峰时暴露。上面那份真实案例旧价 $31;同样的量在新价目下,缓存做得好、主要跑谷时,落点在同一量级——夜间折扣和命中折扣把差价吸掉了。

自己动手的版本:把一周的 usage 读数加总,各车道乘以你实际运行时段的单价,再乘 4.3。十分钟表格胜过任何网页计算器——我那张九行的表已经送走了三轮调价——因为它从你的流量形状出发,这一点任何计算器都不知道。

七个降本杠杆

按杠杆大小排序,不按实施难度:

1. 给缓存喂稳定前缀。 系统提示在各请求间保持字节级一致;把易变内容(用户问题、时间戳)放到提示词末尾。命中车道便宜 30 倍——没有别的杠杆有这个乘数。

2. 默认 Flash,Pro 当贵的一样省着用。 Pro 每条车道单价是 Flash 的 3 倍,而很多任务上看不出差距。分类、抽取、摘要、日常对话全走 Flash;Pro 只留给质量真能变现的重推理。哪个任务值得哪档,模型指南有对照。

3. 批处理挪到谷时。 夜间摘要、批量分类、数据回填——凡是没人盯着等的任务。同样的 token 半价,电费模型字面成立。

4. 给 max_tokens 封顶。 输出是单价最贵的车道,不封顶的生成偶尔会漫游。多数任务 1 万输出 token 内收尾;把上限设了,上限就会替你执行预算。

5. 自己抄表。 记录那三个 usage 字段——不是为了好看,是为了做除法:未命中 token ÷ 总输入。这一个比值就能告诉你杠杆 1 和 3 有没有生效。

6. 赠送余额先烧。 新账号有一笔赠送余额,在充值金额之前优先消耗。数额不大、由平台政策决定——去余额页自己看——但这是你能拿到的最接近"免费 token"的东西。(Key 申请三分钟搞定。)

7. 别在风暴里重试。 429 意味着你撞到了账号并发上限——Pro 500、Flash 2500。在峰时疯狂重试,烧的是最贵的 token,还占着你要腾出来的槽位。带抖动的退避;更好的做法是干脆绕开峰时。

注意缺了什么:没有批量 API 折扣层可以申请,没有预留实例,没有议价空间。这张价格面小到可以装进脑子里——这也正是杠杆又少又钝的原因。

为什么你搜到的价格互相打架

今天搜"deepseek api 价格",你会集齐至少三张互相矛盾的价目表,且都以同等的自信展示。时间线能解释一切:

日期变了什么
2026-04-24V4 上线:Flash $0.14/$0.28,Pro 促销价 $0.435/$0.87
2026-05-22Pro 促销价转正
2026-07-24deepseek-chat / deepseek-reasoner 别名退役
2026-08-16峰谷计费上线,即现行价

再看追踪器们。最严谨的那页英文价格页——带日期、带来源、明写"不发明未公布的倍数来填坑"——数字最后核实在 8 月 12 日,改制前四天,当时新价确实还没公布。另一家热门计算器停在 8 月 15 日,差一天。一家每日更新的追踪器把 Flash 标成 $0.00——免费,看起来是——那是 bug,不是福利。这些页面不是懒,是地面移动了。

价格调研的元规则:先看页面自己的日期,再看它的数字。没有"最后核实"标记的价格页,是一张带表格样式的传言。唯一既更新、又承认自己不知道的来源是官方页——而它也保留明天就改的权利。用今天的价目表做预算,感觉不对时回去核对官方页,并预期这张表继续移动:今年四个月里它动了两次。

常见问题

DeepSeek API 免费吗?注册和建 key 免费,新账号有一笔赠送试用余额(数额由平台政策定,余额页自查)。除此之外每个 token 都计费:输入输出分开、按模型按时段。没有订阅意义上的免费层。

最便宜的组合是什么?Flash + 谷时 + 缓存命中:$0.007/百万 token。这是全表地板价——一美元在这个价上能买约 1.43 亿命中 token。

2026 年 8 月为什么涨价?8 月 16 日的改制引入峰谷计费:谷时输入比旧平价约贵五成(输出约翻倍),峰时约 3-4.5 倍。官方口径是需求分时定价;平台没有承诺价格稳定——4 月到 8 月间动过两次。

有批量 API 折扣吗?没有。官方没有批量处理折扣层。等价折扣自己动手:批量任务挪谷时 + 提示词结构化吃缓存。

缓存折扣有保证吗?没有——缓存是尽力而为,无命中率承诺,未用条目数小时到数天清理。稳定前缀能提高命中率,但不承诺。

用美元计价吗?官方价目表是美元/百万 token。第三方转售和区域平台可能用其他货币、按自家(通常更差的)汇率计费——官方 API 不论你从哪里调用都按美元结算。

本周就做的三件事:收藏官方价格页(唯一跟得上现实的价目表)、把 usage 字段记七天(抄表)、把一个批处理任务推进谷时窗口(半价时段是真的)。价格还会再变——它已经证明过了。三车道思维不会变:未命中贵、命中近乎免费、输出最贵,外加时钟决定每个 token 按哪个价付。预算该指向哪个模型,V4 指南里有现行价目表。