DeepSeek 是什麼?模型、架構與使用全解

從 2025 年初 R1 那時用到現在,DeepSeek 仍是被問得最多的 AI 工具。DeepSeek 是什麼?先給短答案——兩個東西共用這個名字:一家杭州的 AI 研究公司,以及這家公司出的免費聊天助理和 API。模型能力在第一梯隊,價格只有同行的零頭,大部分模型還能直接下載,自己機器上跑,沒有任何附加條件。剩下的長答案——2023 年以來的全部機型、讓它變便宜的架構、跑分到底怎麼說、現在怎麼用——就是這篇文章要講的。

DeepSeek 是什麼?

公司是什麼:杭州深度求索,2023 年 7 月 17 日註冊。創辦人梁文鋒,浙大電子資訊工程加電腦學位,由他共創的量化基金幻方出資。團隊約 160 人——按它交付的東西衡量,這個規模小得反常。公司層面值得知道的就是這些,有意思的部分在產品。

產品線,官網頁尾自己列的:

  • DeepSeek 網頁版和 App——聊天助理,免費,chat.deepseek.com 和 iOS/Android
  • API 平台——按量付費調同一批模型,OpenAI 和 Anthropic 雙格式相容
  • DeepSeek Harness——官方 agent 工具,開發者預覽
  • API 文件——以上全部的文件

所以別人說「DeepSeek」時,可能指實驗室、聊天助理、API,或者 Hugging Face 上的模型權重。四個說法指向同一家。

2023 年以來的全部機型,按順序

這條產品線不是一次成型的,前後十幾代,每一代都加了點實在的東西:

時間模型加了什麼
2023-11DeepSeek Coder第一個模型,程式碼專精(訓練語料 87% 是程式碼)
2024-05DeepSeek-V2首次 MoE 架構 + MLA 注意力
2024-07Coder-V2128K 上下文,338 種程式語言
2024-12DeepSeek-V3671B 參數,FP8 訓練,560 萬美元的底座
2025-01DeepSeek-R1純強化學習練出推理;App Store 登頂時刻
2025-08V3.1混合思考——一個模型兩種模式
2025-09 起V3.2 系DSA 稀疏注意力;Speciale 達 IMO/IOI 金牌級
2026-04V4 Flash 和 Pro預設 1M 上下文,CSA+HCA 注意力,MIT 授權
2026-08V4-Pro 轉正Agent 升級、原生 Responses API、視覺實驗版

表裡有三條主線。它是從程式碼起的家,不是聊天。它在 V2 就押注稀疏啟用,此後沒回頭。2025 年它猛轉推理——R1——就是那次發布讓全世界注意到了它。

為什麼這麼便宜:架構

DeepSeek 怎麼運作的,核心答案就一個詞:MoE。MoE 是什麼?混合專家。想像一家 6710 億參數規模的醫院,每個病人(token)來了只點亮相關的幾個科室——V3 的 671B 每次只啟用 37B,不到 6%。模型的深度是巨型的,算力帳單是小型的。整條產品線的價格就是這麼來的。

核心之外還有三個配套動作:

  • MLA(多頭潛在注意力)把長對話的記憶壓成低維表示——長會話的維持成本不再離譜。
  • FP8 混合精度在安全的地方用 8 位元浮點訓練,省顯存省算力。
  • CSA+HCA 注意力(V4)是現在的最前沿:新 token 細粒度壓縮、舊 token 激進壓縮、快速索引器挑該讀什麼。滿 1M token 上下文時,V4-Pro 的推理 FLOPs 只有 V3.2 的 27%,KV cache 約十分之一。

沒有魔法,就是工程上的省,連續省了三年。

R1:做成了的純強化學習實驗

2025 年 1 月,DeepSeek 做了一個我至今認為是它最有趣的實驗。拿一個基礎模型,只用強化學習加可驗證獎勵訓練——數學答案可以對錯、程式能不能跑都是機器判分——不給任何人類寫的推理示例去模仿。推理鏈自己長了出來。論文後來通過同儕審評登上了 Nature,主要 LLM 裡第一個。

那個 RL 階段的成本:約 29.4 萬美元。底下是 560 萬美元的 V3 底座(278.8 萬 H800 GPU 時)。對比 GPT-4 時代 5000 萬到 1 億美元以上的訓練估算,你就明白市場為什麼是那個反應——R1 落地那天 Nvidia 單日跌 17%,我當時盯著新聞看,那是當時記錄在案的最大單日市值蒸發。

R1 還留下一個社群接著跑的發現:它的推理能力可以蒸餾給小模型。用 80 萬條 R1 推理樣本微調 Llama 和 Qwen(1.5B 到 70B 六款),小模型學會了推理——而且比直接在小模型上做大 RL 效果好。

跑分:帶著日期讀

DeepSeek 的每個跑分都要掛著日期讀,這條線跑得太快。最出名的那張快照,2025 年 1 月 R1 發布時:

基準DeepSeek-R1OpenAI o1-1217
AIME 2024(數學)79.879.2
MATH-50097.396.4
Codeforces 百分位96.396.6
SWE-bench Verified49.248.9
GPQA Diamond71.575.7
MMLU90.891.8

和 o1 基本打平,服務成本只有零頭——這是 2025 年初的故事。當前世代:V3.2 對標 GPT-5-High 檔,V3.2-Speciale 到 2025 年 IMO/IOI 金牌級,V4-Pro-Max 在 SWE-bench Verified 拿 80.6%,開源最高分(與 Gemini 3.1 Pro 並列)。一句我反覆要提醒的誠實話:V4 最亮的幾個數字是自報的,還沒等來獨立重現。方向可信,小數點當暫定值看。V4 詳解裡拆得更細。

模型多少錢

訓練成本是歷史,API 價格才是你要付的。2026 年 8 月 16 日起,定價按峰谷時段走。峰谷是什麼?工作日尖峰時段全價、其餘時段半價的分時計價(下表為離峰價,尖峰時段翻倍):

模型輸入 $/百萬(未命中 / 命中)輸出 $/百萬
deepseek-v4-flash$0.22 / $0.007$0.66
deepseek-v4-pro$0.66 / $0.022$1.98

尖峰時段是台北時間工作日 9:00–12:00 和 14:00–18:00,其餘 17 個小時半價。在台灣的話,晚上做事自動享受離峰價。現行數字以官方定價頁為準——這條線四個月改過兩次價,任何文章裡的價格(包括我這篇)都自帶過期屬性。

一個我踩過的遷移坑:舊的 deepseek-chatdeepseek-reasoner 端點 2026 年 7 月 24 日退役了。那週我的老腳本開始報錯,而我根本沒動過程式。如果你也碰到了,不是你的問題——模型名改成 deepseek-v4-flashdeepseek-v4-pro 就遷移完了,API 指南有完整步驟。

開放權重:你實際拿到什麼

這條線大部分模型是 MIT 授權——下載、執行、微調、商用,都不需要許可。Hugging Face 上模型下載量超過 500 萬次,社群衍生模型 500 多個(2025-05 口徑,現在只會更多)。

自架實際要什麼:

  • V3/V4 全量:8 卡 H200 級別。Pro 的 865GB 是多節點的事。
  • V4-Flash 160GB:一台認真配的工作站或租的機器。
  • 蒸餾系列(1.5B–70B):消費級顯卡,部分筆電能跑。
  • 工具:個人聊天用 Ollama,生產用 vLLM 或 BentoML。

開放權重是什麼?就是把模型檔案下載下來、在自己機器上跑的權利。開放也換來了社群真敢做事——DeepScaleR 拿 1.5B 蒸餾版繼續做 RL,把 AIME 通過率從 28.8% 推到 43.1%;柏克萊一個團隊不到 30 美元重現了 R1-Zero 式訓練。

怎麼用 DeepSeek

四條路,按我會推薦朋友嘗試的順序:

  1. 網頁版——免費,不用 key,chat.deepseek.com。Expert Mode 跑 V4-Pro,Instant Mode 跑 V4-Flash。從這裡開始。
  2. API——base URL 不變(https://api.deepseek.com),OpenAI 格式或 Anthropic 格式都行。Claude Code 接入就兩個環境變數。
  3. Agent 工具——Claude Code、GitHub Copilot、OpenCode 都能拿 DeepSeek 當後端;Harness 是官方自己的 agent 產品,開發者預覽中。
  4. 自架——同上,需要的人自然知道自己需要。

我自己用了兩年之後的規則:預設一律 Flash,只有能測出 Flash 不夠時才切 Pro。兩個型號在獨立指數上差 1 分,價格差 3 倍。

專門模型家族

主線之外還有三個專門家族(都開放):

家族幹什麼用
DeepSeek-Prover-V2Lean 4 形式化定理證明
Janus / Janus-Pro影像理解 + 生成統一
DeepSeek-OCR / OCR-2光學字元辨識

所以「DeepSeek 能畫圖嗎」——主力 LLM 是純文字,畫圖是 Janus 家的事。Janus 是什麼?影像理解和生成做在一起的特殊模型,和主力線分開發布。

DeepSeek 常見問題

DeepSeek 免費嗎? 網頁聊天和手機 App 免費。API 按上表價格按量付費。模型權重 MIT 授權,自己跑也免費。

DeepSeek 是什麼公司?和 OpenAI 什麼關係? 不是誰的子公司——獨立研究公司,梁文鋒創辦,幻方出資。模型全部自己從零訓練,不是別人模型的微調。

只能中文嗎? 不是。杭州出品、中文最強,但英文跑分同樣在第一梯隊——見上面 R1 對 o1 那張表。

V4-Pro 和 V4-Flash 差在哪? 規模(1.6T 對 284B 參數)、價格(3 倍)、實測品質差約 1 分。預設選擇比規格表重要:多數人該用 Flash。細節看 V4 指南

能接進編輯器或終端機嗎? 能——API 同時說 OpenAI 和 Anthropic 兩種格式,Claude Code、Copilot、OpenCode 直接插。給 agent 寫好提示詞是另一門手藝,提示詞指南專門講這個。

名字怎麼來的? 「Deep seek」——深度學習,探索。V 是什麼?架構代數。R 是什麼?從 R1 開始的推理線標記。


這就是 2026 年 8 月下旬的全貌:一家杭州小實驗室,靠架構而不是預算打進第一梯隊,大部分成果 MIT 授權開放,剩下的服務按成本價定價。先用免費網頁版找感覺,想進自己工具鏈再上 API,DeepSeek 首頁裡有生態其餘部分。