DeepSeek 是什么?模型、架构与使用全解
从 2025 年初 R1 那会儿用到现在,DeepSeek 仍是被问得最多的 AI 工具。DeepSeek 是什么?先给短答案——两个东西共用这个名字:一家杭州的 AI 研究公司,以及这家公司出的免费聊天助手和 API。模型能力在第一梯队,价格只有同行的零头,大部分模型还能直接下载,自己机器上跑,没有任何附加条件。剩下的长答案——2023 年以来的全部机型、让它变便宜的架构、跑分到底怎么说、现在怎么用——就是这篇文章要讲的。
DeepSeek 是什么?
公司是什么:杭州深度求索,2023 年 7 月 17 日注册。创始人梁文锋,浙大电子信息工程加计算机学位,由他共创的量化基金幻方出资。团队约 160 人——按它交付的东西衡量,这个规模小得反常。公司层面值得知道的就是这些,有意思的部分在产品。
产品线,官网页脚自己列的:
- DeepSeek 网页版和 App——聊天助手,免费,chat.deepseek.com 和 iOS/Android
- API 平台——按量付费调同一批模型,OpenAI 和 Anthropic 双格式兼容
- DeepSeek Harness——官方 agent 工具,开发者预览
- API 文档——以上全部的文档
所以别人说"DeepSeek"时,可能指实验室、聊天助手、API,或者 Hugging Face 上的模型权重。四个说法指向同一家。
2023 年以来的全部机型,按顺序
这个产品线不是一次性成型的,前后十几代,每一代都加了点实在的东西:
| 时间 | 模型 | 加了什么 |
|---|---|---|
| 2023-11 | DeepSeek Coder | 第一个模型,代码专精(训练语料 87% 是代码) |
| 2024-05 | DeepSeek-V2 | 首次 MoE 架构 + MLA 注意力 |
| 2024-07 | Coder-V2 | 128K 上下文,338 种编程语言 |
| 2024-12 | DeepSeek-V3 | 671B 参数,FP8 训练,560 万美元的底座 |
| 2025-01 | DeepSeek-R1 | 纯强化学习练出推理;App Store 登顶时刻 |
| 2025-08 | V3.1 | 混合思考——一个模型两种模式 |
| 2025-09 起 | V3.2 系 | DSA 稀疏注意力;Speciale 达 IMO/IOI 金牌级 |
| 2026-04 | V4 Flash 和 Pro | 默认 1M 上下文,CSA+HCA 注意力,MIT 协议 |
| 2026-08 | V4-Pro 转正 | Agent 升级、原生 Responses API、视觉实验版 |
表里有三条主线。它是从代码起的家,不是聊天。它在 V2 就押注稀疏激活,此后没回头。2025 年它猛转推理——R1——就是那次发布让全世界注意到了它。
为什么这么便宜:架构
DeepSeek 怎么工作的,核心答案就一个词:MoE。MoE 是什么?混合专家。想象一家 6710 亿参数规模的医院,每个病人(token)来了只点亮相关的几个科室——V3 的 671B 每次只激活 37B,不到 6%。模型的深度是巨型的,算力账单是小型的。整条产品线的价格就是这么来的。
核心之外还有三个配套动作:
- MLA(多头潜在注意力)把长对话的记忆压成低维表示——长会话的维持成本不再离谱。
- FP8 混合精度在安全的地方用 8 位浮点训练,省显存省算力。
- CSA+HCA 注意力(V4)是现在的最前沿:新 token 细粒度压缩、旧 token 激进压缩、快速索引器挑该读什么。满 1M token 上下文时,V4-Pro 的推理 FLOPs 只有 V3.2 的 27%,KV cache 约十分之一。
没有魔法,就是工程上的省,连续省了三年。
R1:做成了的纯强化学习实验
2025 年 1 月,DeepSeek 做了一个我至今认为是它最有趣的实验。拿一个基础模型,只用强化学习加可验证奖励训练——数学答案可以对错、代码能不能跑都是机器判分——不给任何人类写的推理示例去模仿。推理链自己长了出来。论文后来通过同行评审登上了 Nature,主要 LLM 里第一个。
那个 RL 阶段的成本:约 29.4 万美元。底下是 560 万美元的 V3 底座(278.8 万 H800 GPU 时)。对比 GPT-4 时代 5000 万到 1 亿美元以上的训练估算,你就明白市场为什么是那个反应——R1 落地那天 Nvidia 单日跌 17%,我当时盯着新闻看,那是当时记录在案的最大单日市值蒸发。
R1 还留下一个社区接着跑的发现:它的推理能力可以蒸馏给小模型。用 80 万条 R1 推理样本微调 Llama 和 Qwen(1.5B 到 70B 六款),小模型学会了推理——而且比直接在小模型上做大 RL 效果好。
跑分:带着日期读
DeepSeek 的每个跑分都要挂着日期读,这条线跑得太快。最出名的那张快照,2025 年 1 月 R1 发布时:
| 基准 | DeepSeek-R1 | OpenAI o1-1217 |
|---|---|---|
| AIME 2024(数学) | 79.8 | 79.2 |
| MATH-500 | 97.3 | 96.4 |
| Codeforces 百分位 | 96.3 | 96.6 |
| SWE-bench Verified | 49.2 | 48.9 |
| GPQA Diamond | 71.5 | 75.7 |
| MMLU | 90.8 | 91.8 |
和 o1 基本打平,服务成本只有零头——这是 2025 年初的故事。当前世代:V3.2 对标 GPT-5-High 档,V3.2-Speciale 到 2025 年 IMO/IOI 金牌级,V4-Pro-Max 在 SWE-bench Verified 拿 80.6%,开源最高分(与 Gemini 3.1 Pro 并列)。一句我反复要提醒的诚实话:V4 最亮的几个数字是自报的,还没等来独立复现。方向可信,小数点当暂定值看。V4 详解里拆得更细。
模型多少钱
训练成本是历史,API 价格才是你要付的。2026 年 8 月 16 日起,定价按峰谷时段走。峰谷是什么?工作日高峰时段全价、其余时段半价的分时计价(下表为谷价,峰时翻倍):
| 模型 | 输入 $/百万(未命中 / 命中) | 输出 $/百万 |
|---|---|---|
| deepseek-v4-flash | $0.22 / $0.007 | $0.66 |
| deepseek-v4-pro | $0.66 / $0.022 | $1.98 |
峰时段是北京时间工作日 9:00–12:00 和 14:00–18:00,其余 17 个小时半价。在国内的话,晚上干活自动享受谷价。现行数字以官方定价页为准——这条线四个月改过两次价,任何文章里的价格(包括我这篇)都自带过期属性。
一个我踩过的迁移坑:旧的 deepseek-chat 和 deepseek-reasoner 端点 2026 年 7 月 24 日退役了。那周我的老脚本开始报错,而我根本没动过代码。如果你也碰到了,不是你的问题——模型名改成 deepseek-v4-flash 或 deepseek-v4-pro 就迁移完了,API 指南有完整步骤。
开放权重:你实际拿到什么
这条线大部分模型是 MIT 协议——下载、运行、微调、商用,都不需要许可。Hugging Face 上模型下载量超过 500 万次,社区衍生模型 500 多个(2025-05 口径,现在只会更多)。
自托管实际要什么:
- V3/V4 全量:8 卡 H200 级别。Pro 的 865GB 是多节点的事。
- V4-Flash 160GB:一台认真配的工作站或租的机器。
- 蒸馏系列(1.5B–70B):消费级显卡,部分笔记本能跑。
- 工具:个人聊天用 Ollama,生产用 vLLM 或 BentoML。
开放权重是什么?就是把模型文件下载下来、在自己机器上跑的权利。开放也换来了社区真敢做事——DeepScaleR 拿 1.5B 蒸馏版继续做 RL,把 AIME 通过率从 28.8% 推到 43.1%;伯克利一个团队不到 30 美元复现了 R1-Zero 式训练。
怎么用 DeepSeek
四条路,按我会推荐朋友尝试的顺序:
- 网页版——免费,不用 key,chat.deepseek.com。Expert Mode 跑 V4-Pro,Instant Mode 跑 V4-Flash。从这里开始。
- API——base URL 不变(
https://api.deepseek.com),OpenAI 格式或 Anthropic 格式都行。Claude Code 接入就两个环境变量。 - Agent 工具——Claude Code、GitHub Copilot、OpenCode 都能拿 DeepSeek 当后端;Harness 是官方自己的 agent 产品,开发者预览中。
- 自托管——同上,需要的人自然知道自己需要。
我自己用了两年之后的规则:默认一律 Flash,只有能测出 Flash 不够时才切 Pro。两个型号在独立指数上差 1 分,价格差 3 倍。
专门模型家族
主线之外还有三个专门家族(都开放):
| 家族 | 干什么用 |
|---|---|
| DeepSeek-Prover-V2 | Lean 4 形式化定理证明 |
| Janus / Janus-Pro | 图像理解 + 生成统一 |
| DeepSeek-OCR / OCR-2 | 光学字符识别 |
所以"DeepSeek 能画图吗"——主力 LLM 是纯文本,画图是 Janus 家的事。Janus 是什么?图像理解和生成做在一起的特殊模型,和主力线分开发布。
DeepSeek 常见问题
DeepSeek 免费吗? 网页聊天和手机 App 免费。API 按上表价格按量付费。模型权重 MIT 协议,自己跑也免费。
DeepSeek 是什么公司?和 OpenAI 什么关系? 不是谁的子公司——独立研究公司,梁文锋创办,幻方出资。模型全部自己从零训练,不是别人模型的微调。
只能中文吗? 不是。杭州出品、中文最强,但英文跑分同样在第一梯队——见上面 R1 对 o1 那张表。
V4-Pro 和 V4-Flash 差在哪? 规模(1.6T 对 284B 参数)、价格(3 倍)、实测质量差约 1 分。默认选择比参数表重要:多数人该用 Flash。细节看 V4 指南。
能接进编辑器或终端吗? 能——API 同时说 OpenAI 和 Anthropic 两种格式,Claude Code、Copilot、OpenCode 直接插。给 agent 写好提示词是另一门手艺,提示词指南专门讲这个。
名字怎么来的? "Deep seek"——深度学习,探索。V 是什么?架构代数。R 是什么?从 R1 开始的推理线标记。
这就是 2026 年 8 月下旬的全貌:一家杭州小实验室,靠架构而不是预算打进第一梯队,大部分成果 MIT 协议开放,剩下的服务按成本价定价。先用免费网页版找感觉,想进自己工具链再上 API,DeepSeek 主页里有生态其余部分。