DeepSeek V4 全解:Pro/Flash 規格、跑分與價格
從 4 月 preview 到現在,DeepSeek V4 的兩個型號我一直在用,寫程式、讀長文件都算重度。先把結論放前面,多數人要的就是這個:日常一律 Flash,Pro 留給能明確測出 Flash 不夠用的活;台北時間晚上 6 點以後到隔天早上 9 點全是離峰價,同樣的用量成本直接減半。這篇文章就是把這三句話拆開講清楚,每個數字都帶時點和口徑。V4 今年已經變過兩次了,網路上不少說法其實早就過期。
DeepSeek V4 是什麼?
一個開放權重的 MoE 模型家族,MIT 授權,權重隨便下載、隨便商用,沒有附加條件。兩個成員:V4-Pro,1.6 兆參數的旗艦;V4-Flash,更小也更便宜的那個。兩個型號都預設給 1M token 上下文(是預設,不是加價選項),單次最多輸出 384K token,支援 Thinking 與非 Thinking 雙模式,外加 low/high/max 三檔推理力度,用延遲換深度。
如果你是從早期的 DeepSeek 模型遷過來的,有個坑值得知道:舊的 deepseek-chat 和 deepseek-reasoner 端點 7 月 24 日已經完全退役。那週如果你的舊程式突然報錯,而你根本沒改過它,原因就是這個。
時間線能解釋你在網路上見到的大部分互相矛盾的說法:
| 日期(2026) | 事件 |
|---|---|
| 4 月 24 日 | Preview 發布:Pro 和 Flash 同日開源,API 同步可用 |
| 7 月 24 日 | 舊端點 deepseek-chat / deepseek-reasoner 退役 |
| 7 月 31 日 | Flash 正式 GA(checkpoint V4-Flash-0731) |
| 8 月 13 日 | Pro 正式 GA:Agent 升級、effort 三檔、原生 Responses API |
| 8 月 16 日 | 新定價生效,導入峰谷價 |
| 8 月 21 日 | deepseek-v4-flash-vision-exp 多模態模型上線,Files API 免費 |
4 月的文章和 8 月的文章描述的其實是兩個產品:checkpoint 不同、價格不同、跑分口徑也不同。所以下面每個關鍵數字我都會標註日期,寫這個模型只有這一種誠實的寫法。
Pro 和 Flash,到底用哪個?
先上規格表,再說我怎麼選。
| 規格 | Pro | Flash |
|---|---|---|
| 總參 / 啟用 | 1.6T / 49B | 284B / 13B |
| 上下文 | 1M(預設) | 1M(預設) |
| 最大輸出 | 384K | 384K |
| 模式 / 力度 | Thinking + 非 Thinking;low/high/max | 相同 |
| 當前 checkpoint | Pro-0813(8 月 13 日) | Flash-0731(7 月 31 日) |
| 下載體積 | 865 GB | 160 GB |
| 授權 | MIT | MIT |
Pro 每個 token 啟用的參數量是 Flash 的 3.8 倍,推理優勢就在這裡。Flash 每一項價格都只有 Pro 的三分之一左右。而在 Artificial Analysis 的獨立智慧指數上,兩個 GA 版本只差 1 分:Pro 53,Flash 52。
1 分。這個差距比它們倆跟同價位其他模型的差距小多了。
所以用了幾個月之後,我的規則是:Flash 當預設,寫程式的迴圈、批次處理、抽取、摘要、Agent 任務全用它。什麼時候切 Pro?當你能測出 Flash 真的不夠的時候,而不是憑感覺。官方定位其實也是這個意思,只是用了行銷話術:Flash 的推理能力「接近 Pro」,簡單 Agent 任務上跟 Pro 打平。日常任務你損失不了什麼;反過來的話,每個不典型的任務你都在白花 3 倍的錢。
1M 上下文為什麼便宜
一百萬 token 以前是奢侈品檔位,廠商要單獨加價的那種。把它變成預設配置,靠的是結構上的改造。官方的一句話版本是:token 級壓縮加上 DeepSeek 稀疏注意力。技術報告裡有細節,值得用人話講一遍,因為這就是 V4 長對話成本沒有直覺中那麼貴的原因。
想像一個不肯擴建的檔案館。CSA(壓縮稀疏注意力)把較早的文件裝訂成壓縮卷冊,沿著序列大約壓縮 4 倍;最近的 token 單獨放一個書架,一字不壓縮。HCA(重度壓縮注意力)走得更遠,類微縮膠片,壓縮約 128 倍,不做選擇性檢索。再配一個閃電級的索引器,像個管理員,任何問題來了都能瞬間挑出最相關的 1024 冊壓縮卷,模型每步實際讀的就是這些。Pro 把兩套策略在各層間交錯使用,壓縮檔案大部分用 FP8 儲存。
另外還有兩個搭車的升級:流形約束超連接(讓殘差路徑的訊號更乾淨)和 Muon 優化器(訓練收斂更快更穩)。預訓練用了超過 32 兆 token。
落到數字上,對比 V3.2 在滿 1M 上下文時的表現:單 token 推理 FLOPs 只有 27%,KV cache 大約 10%。這不是擠牙膏式的改進,是「1M 上下文當 demo 演示」和「1M 上下文真能跑一整天」的區別。
一個誠實提醒:4 倍、128 倍這些比例和索引器的內部細節來自第三方對模型的分析(官方報告講了機制但沒給具體倍數),細節數字當高品質推測看,別當官方口徑。
對比上一代:
| 維度 | V3 | V4-Pro |
|---|---|---|
| 總參 / 啟用 | 671B / 37B | 1.6T / 49B |
| 上下文 | 128K | 1M |
| 最大輸出 | 8K | 384K |
| 注意力 | MLA | token 級壓縮 + DSA |
| API 模型名 | deepseek-chat / deepseek-reasoner | deepseek-v4-pro / deepseek-v4-flash |
跑分怎麼看才不被唬
你看到的每個 V4 跑分都來自三個地方之一,三個地方講的是三個不同的故事,你都得知道。
官方自報(4 月,preview 時期)。 開源模型裡 Agent 編程 SOTA;世界知識在開源裡第二,僅次於 Gemini 3.1 Pro。Pro-Max 的分數:MMLU-Pro 87.5、GPQA Diamond 90.1、Terminal-Bench 2.0 67.9。數字好看,但這是自報,跑的基準也是官方自己挑的。
獨立追蹤(6 月,llm-stats)。 SWE-bench Verified 上,V4-Pro-Max 拿到 80.6%,開源最高分,跟 Gemini 3.1 Pro 打平:
| 模型 | SWE-bench Verified | 輸出價 $/1M |
|---|---|---|
| Claude Fable 5 | 95.0% | $50 |
| Claude Opus 4.8 | 88.6% | $25 |
| Claude Opus 4.6 | 80.8% | $25 |
| DeepSeek V4-Pro-Max | 80.6% | $1.98(離峰) |
| Gemini 3.1 Pro | 80.6% | $12 |
| MiniMax M3 | 80.5% | $1.20 |
防污染測試。 DeepSWE 要求從零寫專案,91 個全新儲存庫,訓練資料不可能洩漏。4 月它給出的結果很冷:preview 版 V4-Pro 只有 8% 的 pass@1,同期 GPT-5.5 是 70%,Opus 4.7 是 54%。然後 8 月 13 日 GA 版自報 DeepSWE 從 12.8 跳到 62.7,Terminal-Bench 和 NL2Repo 也有大漲幅。這些 GA 數字目前沒有獨立重現,Scale 的 SEAL 榜單上干脆沒有 V4 的條目。
我的讀法:80.6% 是真的,但它坐在一個偏鬆的驗證器上。GA 的漲幅方向可信,checkpoint 確實換了,但幅度我建議等獨立數字出來再引用。還有一個更實際的問題:如果你的任務恰好落在 80.6% 和 95% 之間的那道縫裡,便宜模型燒掉的是你的時間而不是錢。這筆帳沒有任何跑分表能替你算。
價格:什麼時候用便宜一半
定價 8 月 16 日 16:00 UTC 換過一輪,下面是現行結構。你看到的跟這不一樣的數字,要麼比這個舊,要麼是錯的。
| 每百萬 token | Pro 離峰/尖峰 | Flash 離峰/尖峰 |
|---|---|---|
| 輸入(快取未命中) | $0.66 / $1.32 | $0.22 / $0.44 |
| 輸入(快取命中) | $0.022 / $0.044 | $0.007 / $0.014 |
| 輸出 | $1.98 / $3.96 | $0.66 / $1.32 |
尖峰時段是 UTC 01:00–04:00 和 06:00–10:00,工作日每天 7 小時。換算成台北時間就是 9:00–12:00 和 14:00–18:00,正好是標準上班時間。其餘 17 個小時全是離峰價,直接半價。所以你在台灣的話,晚上的工作時段自動享受離峰價,午休也是。歐洲用戶同樣划算;美國用戶基本睡過了便宜時段。
網路上還在傳的「比 Claude 便宜 17 倍」是 4 月的算法。按現行離峰輸出價算:比 Opus 4.8($25)便宜約 12.6 倍,比 GPT-5.4/Sonnet 4.6($15)便宜 7.6 倍。依然很誇張,但已經不是那個標題數字了。
多數人漏掉的倍數器是快取。命中的輸入只要未命中價格的 1/30,而 Agent 類負載每輪都重送同樣的系統提示和檔案,大部分輸入其實都落在快取裡。實際效果:你的帳單會明顯低於掛牌的 miss 價。粗算一個日常負載,每天 100 萬輸入 + 20 萬輸出 token,離峰、完全零快取命中:Flash 約 $0.35/天(約 $11/月),Pro 約 $1.06/天(約 $32/月)。同樣的量在 Opus 4.8 上約 $300/月。有快取命中再往下壓。
兩個腳註:4 月的發布價(Pro $1.74/$3.48)已經作廢,2026 年年中的文章還在引用那個數的,描述的是一個已經不存在的產品。另外 OpenRouter 這類第三方轉售商兩個型號都有,一口價沒有峰谷,如果你不想算時段,圖省事可以走那邊。
怎麼用:網頁、API、Agent、自架
網頁和 App,免費的方式。chat.deepseek.com 雙模式:Expert Mode 走 Pro,Instant Mode 走 Flash。不用 API key 不用儲值,想先感受模型能力,從這兒開始。
API,base URL 還是 https://api.deepseek.com,改個模型名稱就遷移完了:
from openai import OpenAI
client = OpenAI(api_key="你的key", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
model="deepseek-v4-flash", # 或 "deepseek-v4-pro"
messages=[{"role": "user", "content": "審查這個補丁..."}],
extra_body={"thinking": {"type": "enabled"}}, # 選配:開啟 Thinking 模式
)8 月 13 日 GA 起,API 也原生支援 OpenAI Responses 格式,Codex 系工具不用轉接器直連。現行費率看官方價格頁。
Agent 接入,這是 V4 被推得最猛的場景:GA 公告點名了 Claude Code、OpenClaw 和 OpenCode 的整合。走 Claude Code 路線的話,DeepSeek 提供了 Anthropic 相容端點:
export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_API_KEY=你的-deepseek-key兩個環境變數,Claude Code 就跑在 V4 上了。完整步驟見Claude Code × DeepSeek 指南。
自架,權重是 MIT 的。Flash 160GB,一台認真配置的工作站或者租的機器就能跑;Pro 865GB 意味著多節點,需要它的人自然知道自己需要。取樣建議來自模型卡:temperature 1.0,Agent 場景 top_p 0.95,high/max 力度的請求把最大輸出放寬到 384K。
影像,8 月 21 日起有了 deepseek-v4-flash-vision-exp:文字能力對齊 Flash,多模態 Agent 任務接近 Opus-4.8 水準,每張圖按 Flash 價格計 ≤384 token,Files API 免費。實驗性質,但產品線上不再缺這一塊了。
它現在還差在哪
跟旗艦的差距是真實存在的。SWE-bench Verified 上 80.6% 對 Opus 4.8 的 88.6% 對 Fable 5 的 95%,平時這個差距你看不見,然後某個硬任務正好落在縫裡,你一整晚都耗在重試上。先想清楚自己多數時間在哪種狀態。
GA 的跑分跳變是自報的。DeepSWE 從 12.8 到 62.7 是個很大的聲明,還沒有獨立重現,SEAL 榜上也沒有 V4。
定價四個月動過兩次(4 月發布價,8 月 16 日峰谷制)。做預算的時候,把任何超過一季的成本預估當小說看。
社群回報的糙邊,個體差異可能很大:超過 50 萬 token 的長對話有漂移的報告;Pro 有時不理會 CLAUDE.md 裡的指令,長 Agent 任務得盯著。我的做法是重要任務開著執行軌跡,隨時瞄一眼。另外等 V4 消息的時候記住官方自己的提醒:只認官方帳號,DeepSeek 周邊的山寨站問題真的很嚴重。
DeepSeek V4 常見問題
DeepSeek V4 什麼時候發布的? Preview 是 2026 年 4 月 24 日,兩個型號同日開源。Flash 7 月 31 日 GA,Pro 8 月 13 日 GA。看到只寫一個「發布日期」的,先確認它說的是這三個裡的哪一個。
DeepSeek V4 開源嗎?免費嗎? 權重開放,MIT 授權,自己部署隨便用。網頁版和 App 免費。API 按量付費;新帳號有時送體驗額度,具體多少以平台頁面為準,別信任何文章裡寫死的數字,包括我這篇。
上下文多大? 預設 1M token,最大輸出 384K。大概是一百萬英文單字進,一本小書出。
API 多少錢? 離峰:Flash 每百萬 token 輸入/輸出 $0.22/$0.66,Pro $0.66/$1.98(8 月 16 日價)。尖峰時段(台北時間工作日 9–12、14–18)翻倍。快取命中是未命中價格的 1/30。
日常用 Pro 還是 Flash? Flash,除非你能測出差別。上面比過了,獨立指數兩者差 1 分。
打得過 GPT-5.5 或 Claude Opus 嗎? 編程基準上 Pro-Max 跟 Gemini 3.1 Pro 並列 80.6%,落後 Opus 4.8(88.6%)和 Fable 5(95%),價格是它們的三分之一到二十五分之一。這筆帳划不划算,取決於你的任務落不落在那道縫裡。
支援影像嗎? 8 月 21 日起有了 deepseek-v4-flash-vision-exp,實驗性質,每張圖 ≤384 token。想把這些模式的提示詞寫好是另一個話題,見提示詞指南。
以上就是 DeepSeek V4 到 2026 年 8 月下旬的全貌。剛開始的話:先在網頁上免費用 Expert Mode 找感覺,需要進自己工具鏈就去申請 API key,想走得更遠就把 Agent 指到 Anthropic 相容端點。生態裡的其他內容(定價深挖、Harness、工具整合)都在 DeepSeek 首頁,持續更新。