DeepSeek 是什么?模型、架构与使用全解

从 2025 年初 R1 那会儿用到现在,DeepSeek 仍是被问得最多的 AI 工具。DeepSeek 是什么?先给短答案——两个东西共用这个名字:一家杭州的 AI 研究公司,以及这家公司出的免费聊天助手和 API。模型能力在第一梯队,价格只有同行的零头,大部分模型还能直接下载,自己机器上跑,没有任何附加条件。剩下的长答案——2023 年以来的全部机型、让它变便宜的架构、跑分到底怎么说、现在怎么用——就是这篇文章要讲的。

DeepSeek 是什么?

公司是什么:杭州深度求索,2023 年 7 月 17 日注册。创始人梁文锋,浙大电子信息工程加计算机学位,由他共创的量化基金幻方出资。团队约 160 人——按它交付的东西衡量,这个规模小得反常。公司层面值得知道的就是这些,有意思的部分在产品。

产品线,官网页脚自己列的:

  • DeepSeek 网页版和 App——聊天助手,免费,chat.deepseek.com 和 iOS/Android
  • API 平台——按量付费调同一批模型,OpenAI 和 Anthropic 双格式兼容
  • DeepSeek Harness——官方 agent 工具,开发者预览
  • API 文档——以上全部的文档

所以别人说"DeepSeek"时,可能指实验室、聊天助手、API,或者 Hugging Face 上的模型权重。四个说法指向同一家。

2023 年以来的全部机型,按顺序

这个产品线不是一次性成型的,前后十几代,每一代都加了点实在的东西:

时间模型加了什么
2023-11DeepSeek Coder第一个模型,代码专精(训练语料 87% 是代码)
2024-05DeepSeek-V2首次 MoE 架构 + MLA 注意力
2024-07Coder-V2128K 上下文,338 种编程语言
2024-12DeepSeek-V3671B 参数,FP8 训练,560 万美元的底座
2025-01DeepSeek-R1纯强化学习练出推理;App Store 登顶时刻
2025-08V3.1混合思考——一个模型两种模式
2025-09 起V3.2 系DSA 稀疏注意力;Speciale 达 IMO/IOI 金牌级
2026-04V4 Flash 和 Pro默认 1M 上下文,CSA+HCA 注意力,MIT 协议
2026-08V4-Pro 转正Agent 升级、原生 Responses API、视觉实验版

表里有三条主线。它是从代码起的家,不是聊天。它在 V2 就押注稀疏激活,此后没回头。2025 年它猛转推理——R1——就是那次发布让全世界注意到了它。

为什么这么便宜:架构

DeepSeek 怎么工作的,核心答案就一个词:MoE。MoE 是什么?混合专家。想象一家 6710 亿参数规模的医院,每个病人(token)来了只点亮相关的几个科室——V3 的 671B 每次只激活 37B,不到 6%。模型的深度是巨型的,算力账单是小型的。整条产品线的价格就是这么来的。

核心之外还有三个配套动作:

  • MLA(多头潜在注意力)把长对话的记忆压成低维表示——长会话的维持成本不再离谱。
  • FP8 混合精度在安全的地方用 8 位浮点训练,省显存省算力。
  • CSA+HCA 注意力(V4)是现在的最前沿:新 token 细粒度压缩、旧 token 激进压缩、快速索引器挑该读什么。满 1M token 上下文时,V4-Pro 的推理 FLOPs 只有 V3.2 的 27%,KV cache 约十分之一。

没有魔法,就是工程上的省,连续省了三年。

R1:做成了的纯强化学习实验

2025 年 1 月,DeepSeek 做了一个我至今认为是它最有趣的实验。拿一个基础模型,只用强化学习加可验证奖励训练——数学答案可以对错、代码能不能跑都是机器判分——不给任何人类写的推理示例去模仿。推理链自己长了出来。论文后来通过同行评审登上了 Nature,主要 LLM 里第一个。

那个 RL 阶段的成本:约 29.4 万美元。底下是 560 万美元的 V3 底座(278.8 万 H800 GPU 时)。对比 GPT-4 时代 5000 万到 1 亿美元以上的训练估算,你就明白市场为什么是那个反应——R1 落地那天 Nvidia 单日跌 17%,我当时盯着新闻看,那是当时记录在案的最大单日市值蒸发。

R1 还留下一个社区接着跑的发现:它的推理能力可以蒸馏给小模型。用 80 万条 R1 推理样本微调 Llama 和 Qwen(1.5B 到 70B 六款),小模型学会了推理——而且比直接在小模型上做大 RL 效果好。

跑分:带着日期读

DeepSeek 的每个跑分都要挂着日期读,这条线跑得太快。最出名的那张快照,2025 年 1 月 R1 发布时:

基准DeepSeek-R1OpenAI o1-1217
AIME 2024(数学)79.879.2
MATH-50097.396.4
Codeforces 百分位96.396.6
SWE-bench Verified49.248.9
GPQA Diamond71.575.7
MMLU90.891.8

和 o1 基本打平,服务成本只有零头——这是 2025 年初的故事。当前世代:V3.2 对标 GPT-5-High 档,V3.2-Speciale 到 2025 年 IMO/IOI 金牌级,V4-Pro-Max 在 SWE-bench Verified 拿 80.6%,开源最高分(与 Gemini 3.1 Pro 并列)。一句我反复要提醒的诚实话:V4 最亮的几个数字是自报的,还没等来独立复现。方向可信,小数点当暂定值看。V4 详解里拆得更细。

模型多少钱

训练成本是历史,API 价格才是你要付的。2026 年 8 月 16 日起,定价按峰谷时段走。峰谷是什么?工作日高峰时段全价、其余时段半价的分时计价(下表为谷价,峰时翻倍):

模型输入 $/百万(未命中 / 命中)输出 $/百万
deepseek-v4-flash$0.22 / $0.007$0.66
deepseek-v4-pro$0.66 / $0.022$1.98

峰时段是北京时间工作日 9:00–12:00 和 14:00–18:00,其余 17 个小时半价。在国内的话,晚上干活自动享受谷价。现行数字以官方定价页为准——这条线四个月改过两次价,任何文章里的价格(包括我这篇)都自带过期属性。

一个我踩过的迁移坑:旧的 deepseek-chatdeepseek-reasoner 端点 2026 年 7 月 24 日退役了。那周我的老脚本开始报错,而我根本没动过代码。如果你也碰到了,不是你的问题——模型名改成 deepseek-v4-flashdeepseek-v4-pro 就迁移完了,API 指南有完整步骤。

开放权重:你实际拿到什么

这条线大部分模型是 MIT 协议——下载、运行、微调、商用,都不需要许可。Hugging Face 上模型下载量超过 500 万次,社区衍生模型 500 多个(2025-05 口径,现在只会更多)。

自托管实际要什么:

  • V3/V4 全量:8 卡 H200 级别。Pro 的 865GB 是多节点的事。
  • V4-Flash 160GB:一台认真配的工作站或租的机器。
  • 蒸馏系列(1.5B–70B):消费级显卡,部分笔记本能跑。
  • 工具:个人聊天用 Ollama,生产用 vLLM 或 BentoML。

开放权重是什么?就是把模型文件下载下来、在自己机器上跑的权利。开放也换来了社区真敢做事——DeepScaleR 拿 1.5B 蒸馏版继续做 RL,把 AIME 通过率从 28.8% 推到 43.1%;伯克利一个团队不到 30 美元复现了 R1-Zero 式训练。

怎么用 DeepSeek

四条路,按我会推荐朋友尝试的顺序:

  1. 网页版——免费,不用 key,chat.deepseek.com。Expert Mode 跑 V4-Pro,Instant Mode 跑 V4-Flash。从这里开始。
  2. API——base URL 不变(https://api.deepseek.com),OpenAI 格式或 Anthropic 格式都行。Claude Code 接入就两个环境变量。
  3. Agent 工具——Claude Code、GitHub Copilot、OpenCode 都能拿 DeepSeek 当后端;Harness 是官方自己的 agent 产品,开发者预览中。
  4. 自托管——同上,需要的人自然知道自己需要。

我自己用了两年之后的规则:默认一律 Flash,只有能测出 Flash 不够时才切 Pro。两个型号在独立指数上差 1 分,价格差 3 倍。

专门模型家族

主线之外还有三个专门家族(都开放):

家族干什么用
DeepSeek-Prover-V2Lean 4 形式化定理证明
Janus / Janus-Pro图像理解 + 生成统一
DeepSeek-OCR / OCR-2光学字符识别

所以"DeepSeek 能画图吗"——主力 LLM 是纯文本,画图是 Janus 家的事。Janus 是什么?图像理解和生成做在一起的特殊模型,和主力线分开发布。

DeepSeek 常见问题

DeepSeek 免费吗? 网页聊天和手机 App 免费。API 按上表价格按量付费。模型权重 MIT 协议,自己跑也免费。

DeepSeek 是什么公司?和 OpenAI 什么关系? 不是谁的子公司——独立研究公司,梁文锋创办,幻方出资。模型全部自己从零训练,不是别人模型的微调。

只能中文吗? 不是。杭州出品、中文最强,但英文跑分同样在第一梯队——见上面 R1 对 o1 那张表。

V4-Pro 和 V4-Flash 差在哪? 规模(1.6T 对 284B 参数)、价格(3 倍)、实测质量差约 1 分。默认选择比参数表重要:多数人该用 Flash。细节看 V4 指南

能接进编辑器或终端吗? 能——API 同时说 OpenAI 和 Anthropic 两种格式,Claude Code、Copilot、OpenCode 直接插。给 agent 写好提示词是另一门手艺,提示词指南专门讲这个。

名字怎么来的? "Deep seek"——深度学习,探索。V 是什么?架构代数。R 是什么?从 R1 开始的推理线标记。


这就是 2026 年 8 月下旬的全貌:一家杭州小实验室,靠架构而不是预算打进第一梯队,大部分成果 MIT 协议开放,剩下的服务按成本价定价。先用免费网页版找感觉,想进自己工具链再上 API,DeepSeek 主页里有生态其余部分。