DeepSeek 是什麼?模型、架構與使用全解
從 2025 年初 R1 那時用到現在,DeepSeek 仍是被問得最多的 AI 工具。DeepSeek 是什麼?先給短答案——兩個東西共用這個名字:一家杭州的 AI 研究公司,以及這家公司出的免費聊天助理和 API。模型能力在第一梯隊,價格只有同行的零頭,大部分模型還能直接下載,自己機器上跑,沒有任何附加條件。剩下的長答案——2023 年以來的全部機型、讓它變便宜的架構、跑分到底怎麼說、現在怎麼用——就是這篇文章要講的。
DeepSeek 是什麼?
公司是什麼:杭州深度求索,2023 年 7 月 17 日註冊。創辦人梁文鋒,浙大電子資訊工程加電腦學位,由他共創的量化基金幻方出資。團隊約 160 人——按它交付的東西衡量,這個規模小得反常。公司層面值得知道的就是這些,有意思的部分在產品。
產品線,官網頁尾自己列的:
- DeepSeek 網頁版和 App——聊天助理,免費,chat.deepseek.com 和 iOS/Android
- API 平台——按量付費調同一批模型,OpenAI 和 Anthropic 雙格式相容
- DeepSeek Harness——官方 agent 工具,開發者預覽
- API 文件——以上全部的文件
所以別人說「DeepSeek」時,可能指實驗室、聊天助理、API,或者 Hugging Face 上的模型權重。四個說法指向同一家。
2023 年以來的全部機型,按順序
這條產品線不是一次成型的,前後十幾代,每一代都加了點實在的東西:
| 時間 | 模型 | 加了什麼 |
|---|---|---|
| 2023-11 | DeepSeek Coder | 第一個模型,程式碼專精(訓練語料 87% 是程式碼) |
| 2024-05 | DeepSeek-V2 | 首次 MoE 架構 + MLA 注意力 |
| 2024-07 | Coder-V2 | 128K 上下文,338 種程式語言 |
| 2024-12 | DeepSeek-V3 | 671B 參數,FP8 訓練,560 萬美元的底座 |
| 2025-01 | DeepSeek-R1 | 純強化學習練出推理;App Store 登頂時刻 |
| 2025-08 | V3.1 | 混合思考——一個模型兩種模式 |
| 2025-09 起 | V3.2 系 | DSA 稀疏注意力;Speciale 達 IMO/IOI 金牌級 |
| 2026-04 | V4 Flash 和 Pro | 預設 1M 上下文,CSA+HCA 注意力,MIT 授權 |
| 2026-08 | V4-Pro 轉正 | Agent 升級、原生 Responses API、視覺實驗版 |
表裡有三條主線。它是從程式碼起的家,不是聊天。它在 V2 就押注稀疏啟用,此後沒回頭。2025 年它猛轉推理——R1——就是那次發布讓全世界注意到了它。
為什麼這麼便宜:架構
DeepSeek 怎麼運作的,核心答案就一個詞:MoE。MoE 是什麼?混合專家。想像一家 6710 億參數規模的醫院,每個病人(token)來了只點亮相關的幾個科室——V3 的 671B 每次只啟用 37B,不到 6%。模型的深度是巨型的,算力帳單是小型的。整條產品線的價格就是這麼來的。
核心之外還有三個配套動作:
- MLA(多頭潛在注意力)把長對話的記憶壓成低維表示——長會話的維持成本不再離譜。
- FP8 混合精度在安全的地方用 8 位元浮點訓練,省顯存省算力。
- CSA+HCA 注意力(V4)是現在的最前沿:新 token 細粒度壓縮、舊 token 激進壓縮、快速索引器挑該讀什麼。滿 1M token 上下文時,V4-Pro 的推理 FLOPs 只有 V3.2 的 27%,KV cache 約十分之一。
沒有魔法,就是工程上的省,連續省了三年。
R1:做成了的純強化學習實驗
2025 年 1 月,DeepSeek 做了一個我至今認為是它最有趣的實驗。拿一個基礎模型,只用強化學習加可驗證獎勵訓練——數學答案可以對錯、程式能不能跑都是機器判分——不給任何人類寫的推理示例去模仿。推理鏈自己長了出來。論文後來通過同儕審評登上了 Nature,主要 LLM 裡第一個。
那個 RL 階段的成本:約 29.4 萬美元。底下是 560 萬美元的 V3 底座(278.8 萬 H800 GPU 時)。對比 GPT-4 時代 5000 萬到 1 億美元以上的訓練估算,你就明白市場為什麼是那個反應——R1 落地那天 Nvidia 單日跌 17%,我當時盯著新聞看,那是當時記錄在案的最大單日市值蒸發。
R1 還留下一個社群接著跑的發現:它的推理能力可以蒸餾給小模型。用 80 萬條 R1 推理樣本微調 Llama 和 Qwen(1.5B 到 70B 六款),小模型學會了推理——而且比直接在小模型上做大 RL 效果好。
跑分:帶著日期讀
DeepSeek 的每個跑分都要掛著日期讀,這條線跑得太快。最出名的那張快照,2025 年 1 月 R1 發布時:
| 基準 | DeepSeek-R1 | OpenAI o1-1217 |
|---|---|---|
| AIME 2024(數學) | 79.8 | 79.2 |
| MATH-500 | 97.3 | 96.4 |
| Codeforces 百分位 | 96.3 | 96.6 |
| SWE-bench Verified | 49.2 | 48.9 |
| GPQA Diamond | 71.5 | 75.7 |
| MMLU | 90.8 | 91.8 |
和 o1 基本打平,服務成本只有零頭——這是 2025 年初的故事。當前世代:V3.2 對標 GPT-5-High 檔,V3.2-Speciale 到 2025 年 IMO/IOI 金牌級,V4-Pro-Max 在 SWE-bench Verified 拿 80.6%,開源最高分(與 Gemini 3.1 Pro 並列)。一句我反覆要提醒的誠實話:V4 最亮的幾個數字是自報的,還沒等來獨立重現。方向可信,小數點當暫定值看。V4 詳解裡拆得更細。
模型多少錢
訓練成本是歷史,API 價格才是你要付的。2026 年 8 月 16 日起,定價按峰谷時段走。峰谷是什麼?工作日尖峰時段全價、其餘時段半價的分時計價(下表為離峰價,尖峰時段翻倍):
| 模型 | 輸入 $/百萬(未命中 / 命中) | 輸出 $/百萬 |
|---|---|---|
| deepseek-v4-flash | $0.22 / $0.007 | $0.66 |
| deepseek-v4-pro | $0.66 / $0.022 | $1.98 |
尖峰時段是台北時間工作日 9:00–12:00 和 14:00–18:00,其餘 17 個小時半價。在台灣的話,晚上做事自動享受離峰價。現行數字以官方定價頁為準——這條線四個月改過兩次價,任何文章裡的價格(包括我這篇)都自帶過期屬性。
一個我踩過的遷移坑:舊的 deepseek-chat 和 deepseek-reasoner 端點 2026 年 7 月 24 日退役了。那週我的老腳本開始報錯,而我根本沒動過程式。如果你也碰到了,不是你的問題——模型名改成 deepseek-v4-flash 或 deepseek-v4-pro 就遷移完了,API 指南有完整步驟。
開放權重:你實際拿到什麼
這條線大部分模型是 MIT 授權——下載、執行、微調、商用,都不需要許可。Hugging Face 上模型下載量超過 500 萬次,社群衍生模型 500 多個(2025-05 口徑,現在只會更多)。
自架實際要什麼:
- V3/V4 全量:8 卡 H200 級別。Pro 的 865GB 是多節點的事。
- V4-Flash 160GB:一台認真配的工作站或租的機器。
- 蒸餾系列(1.5B–70B):消費級顯卡,部分筆電能跑。
- 工具:個人聊天用 Ollama,生產用 vLLM 或 BentoML。
開放權重是什麼?就是把模型檔案下載下來、在自己機器上跑的權利。開放也換來了社群真敢做事——DeepScaleR 拿 1.5B 蒸餾版繼續做 RL,把 AIME 通過率從 28.8% 推到 43.1%;柏克萊一個團隊不到 30 美元重現了 R1-Zero 式訓練。
怎麼用 DeepSeek
四條路,按我會推薦朋友嘗試的順序:
- 網頁版——免費,不用 key,chat.deepseek.com。Expert Mode 跑 V4-Pro,Instant Mode 跑 V4-Flash。從這裡開始。
- API——base URL 不變(
https://api.deepseek.com),OpenAI 格式或 Anthropic 格式都行。Claude Code 接入就兩個環境變數。 - Agent 工具——Claude Code、GitHub Copilot、OpenCode 都能拿 DeepSeek 當後端;Harness 是官方自己的 agent 產品,開發者預覽中。
- 自架——同上,需要的人自然知道自己需要。
我自己用了兩年之後的規則:預設一律 Flash,只有能測出 Flash 不夠時才切 Pro。兩個型號在獨立指數上差 1 分,價格差 3 倍。
專門模型家族
主線之外還有三個專門家族(都開放):
| 家族 | 幹什麼用 |
|---|---|
| DeepSeek-Prover-V2 | Lean 4 形式化定理證明 |
| Janus / Janus-Pro | 影像理解 + 生成統一 |
| DeepSeek-OCR / OCR-2 | 光學字元辨識 |
所以「DeepSeek 能畫圖嗎」——主力 LLM 是純文字,畫圖是 Janus 家的事。Janus 是什麼?影像理解和生成做在一起的特殊模型,和主力線分開發布。
DeepSeek 常見問題
DeepSeek 免費嗎? 網頁聊天和手機 App 免費。API 按上表價格按量付費。模型權重 MIT 授權,自己跑也免費。
DeepSeek 是什麼公司?和 OpenAI 什麼關係? 不是誰的子公司——獨立研究公司,梁文鋒創辦,幻方出資。模型全部自己從零訓練,不是別人模型的微調。
只能中文嗎? 不是。杭州出品、中文最強,但英文跑分同樣在第一梯隊——見上面 R1 對 o1 那張表。
V4-Pro 和 V4-Flash 差在哪? 規模(1.6T 對 284B 參數)、價格(3 倍)、實測品質差約 1 分。預設選擇比規格表重要:多數人該用 Flash。細節看 V4 指南。
能接進編輯器或終端機嗎? 能——API 同時說 OpenAI 和 Anthropic 兩種格式,Claude Code、Copilot、OpenCode 直接插。給 agent 寫好提示詞是另一門手藝,提示詞指南專門講這個。
名字怎麼來的? 「Deep seek」——深度學習,探索。V 是什麼?架構代數。R 是什麼?從 R1 開始的推理線標記。
這就是 2026 年 8 月下旬的全貌:一家杭州小實驗室,靠架構而不是預算打進第一梯隊,大部分成果 MIT 授權開放,剩下的服務按成本價定價。先用免費網頁版找感覺,想進自己工具鏈再上 API,DeepSeek 首頁裡有生態其餘部分。