大模型本地部署是什麼?你的電腦能跑什麼、怎麼選工具

想做本地部署大模型的人,理由通常就三個:有些東西不該貼進雲端聊天框;要在飛機上、無網環境裡用;或者 API 帳單已經漲到每月一支手機的錢。這三個理由都成立。然後你下載了第一個模型,問了它一個問題,就撞上那面牆:速度不如雲端,回答也明顯不如付費版。

這道牆,才是本文真正要講的東西。關於大模型本地部署這件事,誠實的答案是:它能用、進步很快,而且幾乎每個新手都在不知情的情況下,跑著一個「降級版」的模型。這個坑我後面會拆開講。先說清楚大模型本地部署到底在部署什麼,再算硬體這筆帳,然後講工具怎麼選,最後講那些沒人告訴你的部分。

大模型本地部署,到底在部署什麼

一套大模型本地部署方案有三層,「部署」指的是三層全齊:

權重檔案:模型本體,就是一個大檔案。70 億參數的模型用 4-bit 精度存,硬碟上大約 4 GB,下載一次,跟存部電影差不多。

執行時:把權重載進記憶體、算出回答的軟體。Ollama、llama.cpp、LM Studio、vLLM 都是執行時(或者套在執行時外面的殼)。它決定你跑多快、記憶體吃多少。

介面:命令列視窗也算介面,但大多數人最後會想要一個聊天頁面,或者一個 API 端點,讓其他程式呼叫這台本地部署模型。

大模型本地部署的成本帳,多數教學會跳過:下載權重省掉的只有廠商的 token 費,就這一項。機器、電費、硬碟、維護、你自己的時間,全都在。用硬體圈一句到位的話說:下載的權重不等於免費的推理。本地部署本質上是把「按月繳費」換成「一次性投入加折騰」。這筆買賣划不划算,完全看你的使用量,所以「什麼時候該部署」我放到後面單獨講,帶判斷標準。

大模型本地部署的顯存帳:你的電腦能跑什麼

顯存(VRAM)是硬門檻,這道算術我們做一遍就好。粗算公式:參數量 × 每參數位元數 ÷ 8 ≈ 權重 GB 數。270 億參數的模型用 4-bit 存,權重約 13.5 GB。

「只是權重」這個限定詞很關鍵,新手挫敗感大多來自這裡。權重之外還要裝:量化元資料、不參與量化的層、執行時緩衝區、KV cache(模型對話用的工作記憶,上下文越長它越大,機制可以看我們講上下文視窗的那篇),再加上作業系統自己佔的部分。一個權重「剛好塞進」16 GB 的 27B 模型,實際想要一張 24 GB 級的顯示卡才喘得過氣。

實用的梯度表:

你的顯存能舒服跑什麼
8 GB3B 到 7B 模型跑 4-bit。聊天、摘要夠用,幹正活勉強
16 GB7B 到 13B 的 Q4/Q8;20B 級 MoE 模型(下面有個但書)
24 GB27B 跑 4-bit,「真的好用」從這裡開始
48 GB 以上 / 多卡70B 級,或者給 27B 開大上下文

兩個例外要記住。Apple Silicon:統一記憶體讓 GPU 和系統共享 RAM,48 GB 的 Mac 能裝下任何單張消費級顯示卡都裝不下的模型,而且跑得不錯,llama.cpp 對 Metal 和 CPU-GPU 混合推理都有支援。但要給 macOS 自己留餘量,CPU 分擔的部分是你實測配置的一部分,不是隱形的外掛容量。MoE 混合專家模型:OpenAI 說 GPT-OSS 20B「16 GB 記憶體內能跑」,那個 20B 是總參數量;每個 token 只激活 36 億參數,這解釋了它算力需求不高,但所有專家都必須駐留在記憶體裡。激活參數解釋的是速度,不是佔用。而且「16 GB」這個數是廠商對某一種量化格式的聲明,不等於對任何執行時、任何上下文長度都成立。

還有一個算術層面的現實提醒:模型檔案的大小不等於它的記憶體需求。一個看著「塞得下」的權重檔案,在你調大上下文長度後可能直接爆顯存,因為 KV cache 跟著漲。Ollama 的 ollama ps 指令能看到實際的 CPU/GPU 切分,信那個輸出,別信任何圖表,包括我這張。

工具怎麼選:三條路線對號入座

入門教學喜歡羅列六七個工具。實際選型會收斂成三條路線:

路線一:LM Studio,想要圖形介面。 裝個應用程式,搜模型,點下載,開聊。它還能起一個相容 OpenAI 格式的本地 API 服務,你的程式碼以後可以直接指過來。如果命令列讓你發怵,從它開始,不用覺得丟人。

路線二:Ollama,想要整個生態。 一條指令裝好,ollama run llama3 下載模型直接進對話。它在 11434 埠提供本地 API,相容 OpenAI 格式,已經成了本地大模型工具的預設後端,每月安裝量 900 萬以上。配上 Open WebUI(一條 Docker 指令),你就有了架在自己模型上的 ChatGPT 式介面。大多數做大模型本地部署的人,我會推薦這條路。

路線三:vLLM,要給別人提供服務。 這是為吞吐量而生的生產級推理引擎:有一組基準顯示,Llama 70B 在併發負載下 vLLM 跑出每秒 793 個 token,Ollama 是 41。但這個數字對獨自聊天的單使用者毫無意義,差距只在多個請求同時打到模型上時才顯現。如果你說的「本地部署」是給團隊起服務,vLLM(或 SGLang)就是你後面會長出來的那一層。

這三條路底下都坐著 llama.cpp,一個 C/C++ 寫的推理引擎,整個生態大半建在它上面。你不需要直接碰它,知道它存在,看其他工具會順眼很多。

量化:讓模型跑起來的技術,也是讓模型變笨的技術

幾乎所有教學都用一段話帶過這件事,然後翻篇:你下載的模型,幾乎從來不是跑分用的那個模型。

廠商公布的分數,是全精度(BF16)參考實現在資料中心硬體上跑出來的。落到你硬碟上的,是量化版,權重從 16-bit 壓到 4-bit 或 8-bit,為的是塞進你的顯存。量化用精度換體積,這裡的「精度」不是抽象概念:模型每生成一個 token,都是對整個詞表做一次機率分布,壓縮會讓這個分布發生偏移。偏移夠大,機率最高的候選詞就會換人,模型開始選不一樣的字。長回答裡早期換掉一個 token,後面全部跟著偏,因為後面的每個字都以它為條件。

有個硬體論壇做了我一直希望每篇指南都做的實驗:同一個模型、同一份權重,每次只改一個變數。只換 attention 後端、別的什麼都不動,長上下文部分各次執行就開始互相「不同意」。只量化 KV cache、權重完全不動:8-bit 降質後能自己恢復,4-bit 直接產生一個失敗的函式呼叫,再也回不來。五種權重量化的對比測試裡,一個廠商發布的 FP4 包在 88k 上下文時 next-token 翻轉率約 50%,五者墊底;兩個 4-bit 參賽者都把全精度模型做對的命令列任務做錯了。反而是社群一個 INT8 版本悄悄跑贏了官方 FP8,因為量化品質取決於標定和哪些層不量化,不取決於廠商的牌子。

給你兩個可以帶走的結論。第一,這個影響是隨距離放大的:短對話和一次性問答,各量化版本表現幾乎一樣;傷害顯形的地方是長上下文、多步函式呼叫、agent 工作流。第二,模型卡上的 KLD、「幾乎無損」之類聲明,沒有方法論揭露就不要信,測量方式變了數字天差地別。

日常使用上,社群沉澱的預設選擇是 Q4_K_M,被海量使用驗證過的平衡點。顯存夠就用 Q8,和全精度幾乎分不出。再送一個免費除錯技巧,同樣來自那個論壇帖:如果你的模型在「思考」輸出裡死循環,大概率是溫度參數調太低了。我見過這個坑吃掉別人一下午。

什麼時候真的該做大模型本地部署,什麼時候別

大模型本地部署不是立場問題,是條件問題。以下條件成立一條,就值得部署:

資料確實不能出去。 合約、病歷、內部文件、有保密要求的程式碼。約束是真的,雲端功能再強也不值得為它違約。順帶說一句,這裡還有中間檔:不少公司的落點是大模型私有化部署,伺服器放在自己機房或專有雲裡,不必一步走到桌底下塞顯示卡。

必須在離線環境用。 飛機、野外、實體隔離的機器、時好時壞的旅館 Wi-Fi。模型不在乎,它已經在硬碟裡了。

用量大到計價器狂轉。 每天幾百萬 token 跑批次處理或內部工具,硬體投入是能攤銷的。拿電費對一下 token 帳單,損益兩平點存在,而且找得到。

以及同樣誠實的反向清單,這些情況就別折騰了:

  • 要頂級輸出品質。 天天跑本地模型的人自己劃的線:27B 級以下「還很有限」。品質就是产品的話,你要麼上雲端旗艦,要麼上大硬體。
  • 要跑長上下文 agent。 恰好是量化損傷顯形的工作負載。一個量化模型快速問答很穩,60k token 的函式呼叫鏈就是會掛。
  • 不想多一個愛好。 驅動、顯存設定、量化格式、上下文調參,大模型本地部署是持續的維護,不管你喜不喜歡。
  • 用量很輕。 一天二十個問題,API 費用按分計。本地部署在這種對比裡「贏」,前提是你的時間不要錢。

還有一個場景值得單獨說,因為它是所有場景裡最實用的:讓你自己的文件餵給一台不連網的模型。那就是 RAG 的配置,檢索在你自己的檔案上做,生成本地模型完成。到了這一步,本地部署就從「挺好完」變成「我每週真在用」。

真實使用者都在拿本地大模型幹什麼

下面是社群數字,不是行銷話術。一位用 3090 的老師,整套測評流水線全部本地跑:給 500 人的模擬考試出卷、判卷工具、行政自動化,全在一台機器上的 27B 級模型完成,他對分界線的表述很直白:低於這個量級「還很有限」。另一位使用者把 Qwen 系 27B 用 4-bit 量化、96k 上下文塞進 24 GB 顯示卡,每秒 43 個 token,在 VS Code 裡驅動程式設計 agent。另一頭,那個發了著名帖子《聊聊本地大模型的實話》的人,筆電 8 GB 顯卡,結論是對他來說更像是個愛好。愛好也沒問題,愛好是被允許的。

想知道大模型本地部署以後你的硬體實際能跑什麼,跳過各種計算機,直接看實測報告:vram.wiki 這個社群站在收集真實配置,顯示卡、模型、量化、上下文、每秒 token 數、誠實的侷限說明,規矩是「未知就是未知,絕不推算」。上次看是 150 多條。看見五個人用你這張卡跑你想跑的那個模型,比任何參數表都管用。如果你在意多模態輸入,要把圖片、音訊直接丟給同一個模型,那選型清單和純文字的是兩份,比如 Google 的 Gemma 小尺寸型號就帶多模態輸入,選硬體前先確認這一點。

快答

大模型本地部署免費嗎? 模型權重本身免費(主流型號大多是 Apache 2.0 授權),推理不免費:電費、硬體損耗、硬碟、搭建時間都是真金白銀。你只是把 token 帳單換成了硬體帳單。

本地大模型能替代 ChatGPT 嗎? 在特定任務上可以,隱私要求高的、離線的、大批量簡單任務,有時還是更好的選擇。作為通用能力和雲端旗艦掰手腕,還不行,27B 級以下尤其不行。

8 GB 顯存夠嗎? 跑 3B 到 7B 的量化模型,輕量任務夠。想得到演示裡那種體驗,不夠。這個檔位「愛好」是更誠實的詞。

Mac 能跑本地大模型嗎? 能,而且相當好。Apple Silicon 的統一記憶體加 Metal 支援,讓 Mac 成了消費級硬體裡最適合跑本地AI模型的機器,前提是給 macOS 自己留夠記憶體。

Ollama 是什麼? ollama本地部署的入門第一條:它是把本地模型變成一條指令的工具。下載、執行、對外提供 OpenAI 相容 API,全包了,現在也是多數本地 AI 工具預設對接的後端。

關於大模型本地部署,只帶走一句話的話,帶走這句:跑分說的是一個你沒有的模型、在一台你沒有的機器上的成績。用你自己的任務、你自己的量化、你自己的上下文長度去測,那才是描述你眼前這台機器的唯一分數。