DeepSeek V4 全解:Pro/Flash 规格、跑分与价格

从 4 月 preview 到现在,DeepSeek V4 的两个型号我一直在用,写代码、读长文档都算重度。先把结论放前面,多数人要的就是这个:日常一律 Flash,Pro 留给能明确测出 Flash 不够用的活;北京时间晚上 6 点以后到第二天早上 9 点全是谷价,同样的用量成本直接减半。这篇文章就是把这三句话拆开讲清楚,每个数字都带时点和口径。V4 今年已经变过两次了,网上不少说法其实早就过期。

DeepSeek V4 是什么?

一个开放权重的 MoE 模型家族,MIT 协议,权重随便下、随便商用,没有附加条件。两个成员:V4-Pro,1.6 万亿参数的旗舰;V4-Flash,更小也更便宜的那个。两个型号都默认给 1M token 上下文(是默认,不是加价选项),单次最多输出 384K token,支持 Thinking 和非 Thinking 双模式,外加 low/high/max 三档推理力度,用延迟换深度。

如果你是从早期 DeepSeek 模型迁过来的,有个坑值得知道:旧的 deepseek-chatdeepseek-reasoner 端点 7 月 24 日已经完全退役。那周如果你的老代码突然报错,而你压根没改过它,原因就是这个。

时间线能解释你在网上见到的大部分互相矛盾的说法:

日期(2026)事件
4 月 24 日Preview 发布:Pro 和 Flash 同日开源,API 同步可用
7 月 24 日旧端点 deepseek-chat / deepseek-reasoner 退役
7 月 31 日Flash 正式 GA(checkpoint V4-Flash-0731
8 月 13 日Pro 正式 GA:Agent 升级、effort 三档、原生 Responses API
8 月 16 日新定价生效,引入峰谷价
8 月 21 日deepseek-v4-flash-vision-exp 多模态模型上线,Files API 免费

4 月的文章和 8 月的文章描述的其实是两个产品:checkpoint 不同、价格不同、跑分口径也不同。所以下面每个关键数字我都会标注日期,写这个模型只有这一种诚实的写法。

Pro 和 Flash,到底用哪个?

先上规格表,再说我怎么选。

规格ProFlash
总参 / 激活1.6T / 49B284B / 13B
上下文1M(默认)1M(默认)
最大输出384K384K
模式 / 力度Thinking + 非 Thinking;low/high/max相同
当前 checkpointPro-0813(8 月 13 日)Flash-0731(7 月 31 日)
下载体积865 GB160 GB
协议MITMIT

Pro 每个 token 激活的参数量是 Flash 的 3.8 倍,推理优势就在这里。Flash 每一项价格都只有 Pro 的三分之一左右。而在 Artificial Analysis 的独立智能指数上,两个 GA 版本只差 1 分:Pro 53,Flash 52。

1 分。这个差距比它们俩跟同价位其他模型的差距小多了。

所以用了几个月之后,我的规则是:Flash 当默认,写代码的循环、批量处理、抽取、摘要、Agent 任务全用它。什么时候切 Pro?当你能测出 Flash 真的不够的时候,而不是凭感觉。官方定位其实也是这个意思,只是用了营销话术:Flash 的推理能力"接近 Pro",简单 Agent 任务上跟 Pro 打平。日常任务你损失不了什么;反过来的话,每个不典型的任务你都在白花 3 倍的钱。

1M 上下文为什么便宜

一百万 token 以前是奢侈品档位,厂商要单独加价的那种。把它变成默认配置,靠的是结构上的改造。官方的一句话版本是:token 级压缩加上 DeepSeek 稀疏注意力。技术报告里有细节,值得用人话讲一遍,因为这就是 V4 长会话成本没有直觉中那么贵的原因。

想象一个不肯扩建的档案馆。CSA(压缩稀疏注意力)把较早的文档装订成压缩卷册,沿着序列大约压缩 4 倍;最近的 token 单独放一个书架,一字不压缩。HCA(重度压缩注意力)走得更远,类似微缩胶片,压缩约 128 倍,不做选择性检索。再配一个闪电级的索引器,像个管理员,任何问题来了都能瞬间挑出最相关的 1024 册压缩卷,模型每步实际读的就是这些。Pro 把两套策略在各层间交错使用,压缩档案大部分用 FP8 存储。

另外还有两个搭车的升级:流形约束超连接(让残差路径的信号更干净)和 Muon 优化器(训练收敛更快更稳)。预训练用了超过 32 万亿 token。

落到数字上,对比 V3.2 在满 1M 上下文时的表现:单 token 推理 FLOPs 只有 27%,KV cache 大约 10%。这不是挤牙膏式的改进,是"1M 上下文当 demo 演示"和"1M 上下文真能跑一整天"的区别。

一个诚实提醒:4 倍、128 倍这些比例和索引器的内部细节来自第三方对模型的分析(官方报告讲了机制但没给具体倍数),细节数字当高质量推测看,别当官方口径。

对比上一代:

维度V3V4-Pro
总参 / 激活671B / 37B1.6T / 49B
上下文128K1M
最大输出8K384K
注意力MLAtoken 级压缩 + DSA
API 模型名deepseek-chat / deepseek-reasonerdeepseek-v4-pro / deepseek-v4-flash

跑分怎么看才不被忽悠

你看到的每个 V4 跑分都来自三个地方之一,三个地方讲的是三个不同的故事,你都得知道。

官方自报(4 月,preview 时期)。 开源模型里 Agent 编程 SOTA;世界知识在开源里第二,仅次于 Gemini 3.1 Pro。Pro-Max 的分数:MMLU-Pro 87.5、GPQA Diamond 90.1、Terminal-Bench 2.0 67.9。数字好看,但这是自报,跑的基准也是官方自己挑的。

独立追踪(6 月,llm-stats)。 SWE-bench Verified 上,V4-Pro-Max 拿到 80.6%,开源最高分,跟 Gemini 3.1 Pro 打平:

模型SWE-bench Verified输出价 $/1M
Claude Fable 595.0%$50
Claude Opus 4.888.6%$25
Claude Opus 4.680.8%$25
DeepSeek V4-Pro-Max80.6%$1.98(谷时)
Gemini 3.1 Pro80.6%$12
MiniMax M380.5%$1.20

防污染测试。 DeepSWE 要求从零写项目,91 个全新仓库,训练数据不可能泄露。4 月它给出的结果很冷:preview 版 V4-Pro 只有 8% 的 pass@1,同期 GPT-5.5 是 70%,Opus 4.7 是 54%。然后 8 月 13 日 GA 版自报 DeepSWE 从 12.8 跳到 62.7,Terminal-Bench 和 NL2Repo 也有大涨幅。这些 GA 数字目前没有独立复现,Scale 的 SEAL 榜单上干脆没有 V4 的条目。

我的读法:80.6% 是真的,但它坐在一个偏松的验证器上。GA 的涨幅方向可信,checkpoint 确实换了,但幅度我建议等独立数字出来再引用。还有一个更实际的问题:如果你的任务恰好落在 80.6% 和 95% 之间的那道缝里,便宜模型烧掉的是你的时间而不是钱。这笔账没有任何跑分表能替你算。

价格:什么时候用便宜一半

定价 8 月 16 日 16:00 UTC 换过一轮,下面是现行结构。你看到的跟这不一样的数字,要么比这个旧,要么是错的。

每百万 tokenPro 谷/峰Flash 谷/峰
输入(缓存未命中)$0.66 / $1.32$0.22 / $0.44
输入(缓存命中)$0.022 / $0.044$0.007 / $0.014
输出$1.98 / $3.96$0.66 / $1.32

峰时段是 UTC 01:00–04:00 和 06:00–10:00,工作日每天 7 小时。换算成北京时间就是 9:00–12:00 和 14:00–18:00,正好是标准上班时间。其余 17 个小时全是谷价,直接半价。所以你在中国的话,晚上的工作时段自动享受谷价,午休也是。欧洲用户同样划算;美国用户基本睡过了便宜窗口。

网上还在传的"比 Claude 便宜 17 倍"是 4 月的算法。按现行谷时输出价算:比 Opus 4.8($25)便宜约 12.6 倍,比 GPT-5.4/Sonnet 4.6($15)便宜 7.6 倍。依然很夸张,但已经不是那个标题数字了。

多数人漏掉的倍数器是缓存。命中的输入只要未命中价格的 1/30,而 Agent 类负载每轮都重发同样的系统提示和文件,大部分输入其实都落在缓存里。实际效果:你的账单会明显低于挂牌的 miss 价。粗算一个日常负载,每天 100 万输入 + 20 万输出 token,谷时、完全零缓存命中:Flash 约 $0.35/天(约 $11/月),Pro 约 $1.06/天(约 $32/月)。同样的量在 Opus 4.8 上约 $300/月。有缓存命中再往下压。

两个脚注:4 月的发布价(Pro $1.74/$3.48)已经作废,2026 年年中的博文还在引用那个数或当时人民币价的,描述的是一个已经不存在的产品。另外 OpenRouter 这类第三方转售商两个型号都有,一口价没有峰谷,如果你不想算时段,图省事可以走那边。

怎么用:网页、API、Agent、自托管

网页和 App,免费的方式。chat.deepseek.com 双模式:Expert Mode 走 Pro,Instant Mode 走 Flash。不用 API key 不用充值,想先感受模型能力,从这儿开始。

API,base URL 还是 https://api.deepseek.com,改个模型名就迁移完了:

from openai import OpenAI

client = OpenAI(api_key="你的key", base_url="https://api.deepseek.com")

resp = client.chat.completions.create(
    model="deepseek-v4-flash",            # 或 "deepseek-v4-pro"
    messages=[{"role": "user", "content": "审查这个补丁..."}],
    extra_body={"thinking": {"type": "enabled"}},   # 可选:开启 Thinking 模式
)

8 月 13 日 GA 起,API 也原生支持 OpenAI Responses 格式,Codex 系工具不用适配器直连。现行费率看官方价格页

Agent 接入,这是 V4 被推得最猛的场景:GA 公告点名了 Claude Code、OpenClaw 和 OpenCode 的集成。走 Claude Code 路线的话,DeepSeek 提供了 Anthropic 兼容端点:

export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_API_KEY=你的-deepseek-key

两个环境变量,Claude Code 就跑在 V4 上了。完整步骤见Claude Code × DeepSeek 指南

自托管权重是 MIT 的。Flash 160GB,一台认真配置的工作站或者租的机器就能跑;Pro 865GB 意味着多节点,需要它的人自然知道自己需要。采样建议来自模型卡:temperature 1.0,Agent 场景 top_p 0.95,high/max 力度的请求把最大输出放宽到 384K。

图像,8 月 21 日起有了 deepseek-v4-flash-vision-exp:文本能力对齐 Flash,多模态 Agent 任务接近 Opus-4.8 水平,每张图按 Flash 价格计 ≤384 token,Files API 免费。实验性质,但产品线上不再缺这一块了。

它现在还差在哪

跟旗舰的差距是真实存在的。SWE-bench Verified 上 80.6% 对 Opus 4.8 的 88.6% 对 Fable 5 的 95%,平时这个差距你看不见,然后某个硬任务正好落在缝里,你一晚上都耗在重试上。先想清楚自己多数时间在哪种状态。

GA 的跑分跳变是自报的。DeepSWE 从 12.8 到 62.7 是个很大的声明,还没有独立复现,SEAL 榜上也没有 V4。

定价四个月动过两次(4 月发布价,8 月 16 日峰谷制)。做预算的时候,把任何超过一个季度的成本预估当小说看。

社区反馈的糙边,个体差异可能很大:超过 50 万 token 的长会话有漂移的报告;Pro 有时不理会 CLAUDE.md 里的指令,长 Agent 任务得盯着。我的做法是重要任务开着执行轨迹,随时瞄一眼。另外等 V4 消息的时候记住官方自己的提醒:只认官方账号,DeepSeek 周边的山寨站问题真的很严重。

DeepSeek V4 常见问题

DeepSeek V4 什么时候发布的? Preview 是 2026 年 4 月 24 日,两个型号同日开源。Flash 7 月 31 日 GA,Pro 8 月 13 日 GA。看到只写一个"发布日期"的,先确认它说的是这三个里的哪一个。

DeepSeek V4 开源吗?免费吗? 权重开放,MIT 协议,自己部署随便用。网页版和 App 免费。API 按量付费;新账号有时送体验额度,具体多少以平台页面为准,别信任何文章里写死的数字,包括我这篇。

上下文多大? 默认 1M token,最大输出 384K。大概是一百万英文单词进,一本小书出。

API 多少钱? 谷时:Flash 每百万 token 输入/输出 $0.22/$0.66,Pro $0.66/$1.98(8 月 16 日价)。峰时段(北京时间工作日 9–12、14–18)翻倍。缓存命中是未命中价格的 1/30。

日常用 Pro 还是 Flash? Flash,除非你能测出差别。上面比过了,独立指数俩者差 1 分。

打得过 GPT-5.5 或 Claude Opus 吗? 编程基准上 Pro-Max 跟 Gemini 3.1 Pro 并列 80.6%,落后 Opus 4.8(88.6%)和 Fable 5(95%),价格是它们的三分之一到二十五分之一。这笔账划不划算,取决于你的任务落不落在那道缝里。

支持图像吗? 8 月 21 日起有了 deepseek-v4-flash-vision-exp,实验性质,每张图 ≤384 token。想把这些模式的提示词写好是另一个话题,见提示词指南


以上就是 DeepSeek V4 到 2026 年 8 月下旬的全貌。刚开始的话:先在网页上免费用 Expert Mode 找感觉,需要进自己工具链就去申请 API key,想走得更远就把 Agent 指到 Anthropic 兼容端点。生态里的其他内容(定价深挖、Harness、工具集成)都在 DeepSeek 主页,持续更新。