DeepSeek V4 全解:Pro/Flash 規格、跑分與價格

從 4 月 preview 到現在,DeepSeek V4 的兩個型號我一直在用,寫程式、讀長文件都算重度。先把結論放前面,多數人要的就是這個:日常一律 Flash,Pro 留給能明確測出 Flash 不夠用的活;台北時間晚上 6 點以後到隔天早上 9 點全是離峰價,同樣的用量成本直接減半。這篇文章就是把這三句話拆開講清楚,每個數字都帶時點和口徑。V4 今年已經變過兩次了,網路上不少說法其實早就過期。

DeepSeek V4 是什麼?

一個開放權重的 MoE 模型家族,MIT 授權,權重隨便下載、隨便商用,沒有附加條件。兩個成員:V4-Pro,1.6 兆參數的旗艦;V4-Flash,更小也更便宜的那個。兩個型號都預設給 1M token 上下文(是預設,不是加價選項),單次最多輸出 384K token,支援 Thinking 與非 Thinking 雙模式,外加 low/high/max 三檔推理力度,用延遲換深度。

如果你是從早期的 DeepSeek 模型遷過來的,有個坑值得知道:舊的 deepseek-chatdeepseek-reasoner 端點 7 月 24 日已經完全退役。那週如果你的舊程式突然報錯,而你根本沒改過它,原因就是這個。

時間線能解釋你在網路上見到的大部分互相矛盾的說法:

日期(2026)事件
4 月 24 日Preview 發布:Pro 和 Flash 同日開源,API 同步可用
7 月 24 日舊端點 deepseek-chat / deepseek-reasoner 退役
7 月 31 日Flash 正式 GA(checkpoint V4-Flash-0731
8 月 13 日Pro 正式 GA:Agent 升級、effort 三檔、原生 Responses API
8 月 16 日新定價生效,導入峰谷價
8 月 21 日deepseek-v4-flash-vision-exp 多模態模型上線,Files API 免費

4 月的文章和 8 月的文章描述的其實是兩個產品:checkpoint 不同、價格不同、跑分口徑也不同。所以下面每個關鍵數字我都會標註日期,寫這個模型只有這一種誠實的寫法。

Pro 和 Flash,到底用哪個?

先上規格表,再說我怎麼選。

規格ProFlash
總參 / 啟用1.6T / 49B284B / 13B
上下文1M(預設)1M(預設)
最大輸出384K384K
模式 / 力度Thinking + 非 Thinking;low/high/max相同
當前 checkpointPro-0813(8 月 13 日)Flash-0731(7 月 31 日)
下載體積865 GB160 GB
授權MITMIT

Pro 每個 token 啟用的參數量是 Flash 的 3.8 倍,推理優勢就在這裡。Flash 每一項價格都只有 Pro 的三分之一左右。而在 Artificial Analysis 的獨立智慧指數上,兩個 GA 版本只差 1 分:Pro 53,Flash 52。

1 分。這個差距比它們倆跟同價位其他模型的差距小多了。

所以用了幾個月之後,我的規則是:Flash 當預設,寫程式的迴圈、批次處理、抽取、摘要、Agent 任務全用它。什麼時候切 Pro?當你能測出 Flash 真的不夠的時候,而不是憑感覺。官方定位其實也是這個意思,只是用了行銷話術:Flash 的推理能力「接近 Pro」,簡單 Agent 任務上跟 Pro 打平。日常任務你損失不了什麼;反過來的話,每個不典型的任務你都在白花 3 倍的錢。

1M 上下文為什麼便宜

一百萬 token 以前是奢侈品檔位,廠商要單獨加價的那種。把它變成預設配置,靠的是結構上的改造。官方的一句話版本是:token 級壓縮加上 DeepSeek 稀疏注意力。技術報告裡有細節,值得用人話講一遍,因為這就是 V4 長對話成本沒有直覺中那麼貴的原因。

想像一個不肯擴建的檔案館。CSA(壓縮稀疏注意力)把較早的文件裝訂成壓縮卷冊,沿著序列大約壓縮 4 倍;最近的 token 單獨放一個書架,一字不壓縮。HCA(重度壓縮注意力)走得更遠,類微縮膠片,壓縮約 128 倍,不做選擇性檢索。再配一個閃電級的索引器,像個管理員,任何問題來了都能瞬間挑出最相關的 1024 冊壓縮卷,模型每步實際讀的就是這些。Pro 把兩套策略在各層間交錯使用,壓縮檔案大部分用 FP8 儲存。

另外還有兩個搭車的升級:流形約束超連接(讓殘差路徑的訊號更乾淨)和 Muon 優化器(訓練收斂更快更穩)。預訓練用了超過 32 兆 token。

落到數字上,對比 V3.2 在滿 1M 上下文時的表現:單 token 推理 FLOPs 只有 27%,KV cache 大約 10%。這不是擠牙膏式的改進,是「1M 上下文當 demo 演示」和「1M 上下文真能跑一整天」的區別。

一個誠實提醒:4 倍、128 倍這些比例和索引器的內部細節來自第三方對模型的分析(官方報告講了機制但沒給具體倍數),細節數字當高品質推測看,別當官方口徑。

對比上一代:

維度V3V4-Pro
總參 / 啟用671B / 37B1.6T / 49B
上下文128K1M
最大輸出8K384K
注意力MLAtoken 級壓縮 + DSA
API 模型名deepseek-chat / deepseek-reasonerdeepseek-v4-pro / deepseek-v4-flash

跑分怎麼看才不被唬

你看到的每個 V4 跑分都來自三個地方之一,三個地方講的是三個不同的故事,你都得知道。

官方自報(4 月,preview 時期)。 開源模型裡 Agent 編程 SOTA;世界知識在開源裡第二,僅次於 Gemini 3.1 Pro。Pro-Max 的分數:MMLU-Pro 87.5、GPQA Diamond 90.1、Terminal-Bench 2.0 67.9。數字好看,但這是自報,跑的基準也是官方自己挑的。

獨立追蹤(6 月,llm-stats)。 SWE-bench Verified 上,V4-Pro-Max 拿到 80.6%,開源最高分,跟 Gemini 3.1 Pro 打平:

模型SWE-bench Verified輸出價 $/1M
Claude Fable 595.0%$50
Claude Opus 4.888.6%$25
Claude Opus 4.680.8%$25
DeepSeek V4-Pro-Max80.6%$1.98(離峰)
Gemini 3.1 Pro80.6%$12
MiniMax M380.5%$1.20

防污染測試。 DeepSWE 要求從零寫專案,91 個全新儲存庫,訓練資料不可能洩漏。4 月它給出的結果很冷:preview 版 V4-Pro 只有 8% 的 pass@1,同期 GPT-5.5 是 70%,Opus 4.7 是 54%。然後 8 月 13 日 GA 版自報 DeepSWE 從 12.8 跳到 62.7,Terminal-Bench 和 NL2Repo 也有大漲幅。這些 GA 數字目前沒有獨立重現,Scale 的 SEAL 榜單上干脆沒有 V4 的條目。

我的讀法:80.6% 是真的,但它坐在一個偏鬆的驗證器上。GA 的漲幅方向可信,checkpoint 確實換了,但幅度我建議等獨立數字出來再引用。還有一個更實際的問題:如果你的任務恰好落在 80.6% 和 95% 之間的那道縫裡,便宜模型燒掉的是你的時間而不是錢。這筆帳沒有任何跑分表能替你算。

價格:什麼時候用便宜一半

定價 8 月 16 日 16:00 UTC 換過一輪,下面是現行結構。你看到的跟這不一樣的數字,要麼比這個舊,要麼是錯的。

每百萬 tokenPro 離峰/尖峰Flash 離峰/尖峰
輸入(快取未命中)$0.66 / $1.32$0.22 / $0.44
輸入(快取命中)$0.022 / $0.044$0.007 / $0.014
輸出$1.98 / $3.96$0.66 / $1.32

尖峰時段是 UTC 01:00–04:00 和 06:00–10:00,工作日每天 7 小時。換算成台北時間就是 9:00–12:00 和 14:00–18:00,正好是標準上班時間。其餘 17 個小時全是離峰價,直接半價。所以你在台灣的話,晚上的工作時段自動享受離峰價,午休也是。歐洲用戶同樣划算;美國用戶基本睡過了便宜時段。

網路上還在傳的「比 Claude 便宜 17 倍」是 4 月的算法。按現行離峰輸出價算:比 Opus 4.8($25)便宜約 12.6 倍,比 GPT-5.4/Sonnet 4.6($15)便宜 7.6 倍。依然很誇張,但已經不是那個標題數字了。

多數人漏掉的倍數器是快取。命中的輸入只要未命中價格的 1/30,而 Agent 類負載每輪都重送同樣的系統提示和檔案,大部分輸入其實都落在快取裡。實際效果:你的帳單會明顯低於掛牌的 miss 價。粗算一個日常負載,每天 100 萬輸入 + 20 萬輸出 token,離峰、完全零快取命中:Flash 約 $0.35/天(約 $11/月),Pro 約 $1.06/天(約 $32/月)。同樣的量在 Opus 4.8 上約 $300/月。有快取命中再往下壓。

兩個腳註:4 月的發布價(Pro $1.74/$3.48)已經作廢,2026 年年中的文章還在引用那個數的,描述的是一個已經不存在的產品。另外 OpenRouter 這類第三方轉售商兩個型號都有,一口價沒有峰谷,如果你不想算時段,圖省事可以走那邊。

怎麼用:網頁、API、Agent、自架

網頁和 App,免費的方式。chat.deepseek.com 雙模式:Expert Mode 走 Pro,Instant Mode 走 Flash。不用 API key 不用儲值,想先感受模型能力,從這兒開始。

API,base URL 還是 https://api.deepseek.com,改個模型名稱就遷移完了:

from openai import OpenAI

client = OpenAI(api_key="你的key", base_url="https://api.deepseek.com")

resp = client.chat.completions.create(
    model="deepseek-v4-flash",            # 或 "deepseek-v4-pro"
    messages=[{"role": "user", "content": "審查這個補丁..."}],
    extra_body={"thinking": {"type": "enabled"}},   # 選配:開啟 Thinking 模式
)

8 月 13 日 GA 起,API 也原生支援 OpenAI Responses 格式,Codex 系工具不用轉接器直連。現行費率看官方價格頁

Agent 接入,這是 V4 被推得最猛的場景:GA 公告點名了 Claude Code、OpenClaw 和 OpenCode 的整合。走 Claude Code 路線的話,DeepSeek 提供了 Anthropic 相容端點:

export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_API_KEY=你的-deepseek-key

兩個環境變數,Claude Code 就跑在 V4 上了。完整步驟見Claude Code × DeepSeek 指南

自架權重是 MIT 的。Flash 160GB,一台認真配置的工作站或者租的機器就能跑;Pro 865GB 意味著多節點,需要它的人自然知道自己需要。取樣建議來自模型卡:temperature 1.0,Agent 場景 top_p 0.95,high/max 力度的請求把最大輸出放寬到 384K。

影像,8 月 21 日起有了 deepseek-v4-flash-vision-exp:文字能力對齊 Flash,多模態 Agent 任務接近 Opus-4.8 水準,每張圖按 Flash 價格計 ≤384 token,Files API 免費。實驗性質,但產品線上不再缺這一塊了。

它現在還差在哪

跟旗艦的差距是真實存在的。SWE-bench Verified 上 80.6% 對 Opus 4.8 的 88.6% 對 Fable 5 的 95%,平時這個差距你看不見,然後某個硬任務正好落在縫裡,你一整晚都耗在重試上。先想清楚自己多數時間在哪種狀態。

GA 的跑分跳變是自報的。DeepSWE 從 12.8 到 62.7 是個很大的聲明,還沒有獨立重現,SEAL 榜上也沒有 V4。

定價四個月動過兩次(4 月發布價,8 月 16 日峰谷制)。做預算的時候,把任何超過一季的成本預估當小說看。

社群回報的糙邊,個體差異可能很大:超過 50 萬 token 的長對話有漂移的報告;Pro 有時不理會 CLAUDE.md 裡的指令,長 Agent 任務得盯著。我的做法是重要任務開著執行軌跡,隨時瞄一眼。另外等 V4 消息的時候記住官方自己的提醒:只認官方帳號,DeepSeek 周邊的山寨站問題真的很嚴重。

DeepSeek V4 常見問題

DeepSeek V4 什麼時候發布的? Preview 是 2026 年 4 月 24 日,兩個型號同日開源。Flash 7 月 31 日 GA,Pro 8 月 13 日 GA。看到只寫一個「發布日期」的,先確認它說的是這三個裡的哪一個。

DeepSeek V4 開源嗎?免費嗎? 權重開放,MIT 授權,自己部署隨便用。網頁版和 App 免費。API 按量付費;新帳號有時送體驗額度,具體多少以平台頁面為準,別信任何文章裡寫死的數字,包括我這篇。

上下文多大? 預設 1M token,最大輸出 384K。大概是一百萬英文單字進,一本小書出。

API 多少錢? 離峰:Flash 每百萬 token 輸入/輸出 $0.22/$0.66,Pro $0.66/$1.98(8 月 16 日價)。尖峰時段(台北時間工作日 9–12、14–18)翻倍。快取命中是未命中價格的 1/30。

日常用 Pro 還是 Flash? Flash,除非你能測出差別。上面比過了,獨立指數兩者差 1 分。

打得過 GPT-5.5 或 Claude Opus 嗎? 編程基準上 Pro-Max 跟 Gemini 3.1 Pro 並列 80.6%,落後 Opus 4.8(88.6%)和 Fable 5(95%),價格是它們的三分之一到二十五分之一。這筆帳划不划算,取決於你的任務落不落在那道縫裡。

支援影像嗎? 8 月 21 日起有了 deepseek-v4-flash-vision-exp,實驗性質,每張圖 ≤384 token。想把這些模式的提示詞寫好是另一個話題,見提示詞指南


以上就是 DeepSeek V4 到 2026 年 8 月下旬的全貌。剛開始的話:先在網頁上免費用 Expert Mode 找感覺,需要進自己工具鏈就去申請 API key,想走得更遠就把 Agent 指到 Anthropic 相容端點。生態裡的其他內容(定價深挖、Harness、工具整合)都在 DeepSeek 首頁,持續更新。