大模型本地部署是什么?你的电脑能跑什么、怎么选工具

想做本地部署大模型的人,理由通常就三个:有些东西不该贴进云端聊天框;要在飞机上、无网环境里用;或者 API 账单已经涨到了每月一部手机钱。这三个理由都成立。然后你下载了第一个模型,问了它一个问题,就撞上了那面墙:速度不如云端,回答也明显不如付费版。

这道墙,就是本文真正要讲的东西。关于大模型本地部署这件事,诚实的答案是:它能用、进步很快,而且几乎每个新手都在不知情的情况下,跑着一个"降级版"的模型。这个坑我后面会拆开讲。先说清楚大模型本地部署到底在部署什么,再算硬件这笔账,然后讲工具怎么选,最后讲那些没人告诉你的部分。

大模型本地部署,到底在部署什么

一套大模型本地部署方案有三层,"部署"指的是三层全齐:

权重文件:模型本体,就是一个大文件。70 亿参数的模型用 4-bit 精度存,磁盘上大约 4 GB,下载一次,跟存部电影差不多。

运行时:把权重加载进内存、算出回答的软件。Ollama、llama.cpp、LM Studio、vLLM 都是运行时(或者套在运行时外面的壳)。它决定你跑多快、内存吃多少。

界面:命令行窗口也算界面,但大多数人最后会想要一个聊天页面,或者一个 API 接口,让其他程序调用这台本地部署模型。

大模型本地部署的成本账,多数教程会跳过:下载权重省掉的只是厂商的 token 费,省掉的只有这一项。机器、电费、硬盘、维护、你自己的时间,全都在。用硬件圈一句到位的话说:下载的权重不等于免费的推理。本地部署本质上是把"按月交费"换成"一次性投入加折腾"。这笔买卖划不划算,完全看你的使用量,所以"什么时候该部署"我放到后面单独讲,带判断标准。

大模型本地部署的显存账:你的电脑能跑什么

显存是硬门槛,这道算术我们做一遍就好。粗算公式:参数量 × 每参数位数 ÷ 8 ≈ 权重 GB 数。270 亿参数的模型用 4-bit 存,权重约 13.5 GB。

"只是权重"这个限定词很关键,新手挫败感大多来自这里。权重之外还要装:量化元数据、不参与量化的层、运行时缓冲区、KV cache(模型对话用的工作记忆,上下文越长它越大,机制可以看我们讲上下文窗口的那篇),再加上操作系统自己占的部分。一个权重"刚好塞进"16 GB 的 27B 模型,实际想要一张 24 GB 级的卡才喘得过气。

实用的梯度表:

你的显存能舒服跑什么
8 GB3B 到 7B 模型跑 4-bit。聊天、摘要够用,干正活勉强
16 GB7B 到 13B 的 Q4/Q8;20B 级 MoE 模型(下面有个 caveat)
24 GB27B 跑 4-bit,"真的好用"从这里开始
48 GB 以上 / 多卡70B 级,或者给 27B 开大上下文

两个例外要记住。Apple Silicon:统一内存让 GPU 和系统共享内存,48 GB 的 Mac 能装下任何单张消费级显卡都装不下的模型,而且跑得不错,llama.cpp 对 Metal 和 CPU-GPU 混合推理都有支持。但要给 macOS 自己留余量,CPU 分担的部分是你实测配置的一部分,不是隐形的外挂容量。MoE 混合专家模型:OpenAI 说 GPT-OSS 20B"16 GB 内存内能跑",那个 20B 是总参数量;每个 token 只激活 36 亿参数,这解释了它算力需求不高,但所有专家都必须驻留在内存里。激活参数解释的是速度,不是占用。而且"16 GB"这个数是厂商对某一种量化格式的声明,不等于对任何运行时、任何上下文长度都成立。

还有一个算术层面的现实提醒:模型文件的大小不等于它的内存需求。一个看着"塞得下"的权重文件,在你调大上下文长度后可能直接爆显存,因为 KV cache 跟着涨。Ollama 的 ollama ps 命令能看到实际的 CPU/GPU 划分,信那个输出,别信任何图表,包括我这张。

工具怎么选:三条路线对号入座

入门教程喜欢罗列六七个工具。实际选型会收敛成三条路线:

路线一:LM Studio,想要图形界面。 装个应用,搜模型,点下载,开聊。它还能起一个兼容 OpenAI 格式的本地 API 服务,你的代码以后可以直接指过来。如果命令行让你发怵,从它开始,不用觉得丢人。

路线二:Ollama,想要整个生态。 一条命令装好,ollama run llama3 下载模型直接进对话。它在 11434 端口提供本地 API,兼容 OpenAI 格式,已经成了本地大模型工具的默认后端,月安装量 900 万以上。配上 Open WebUI(一条 Docker 命令),你就有了架在自己模型上的 ChatGPT 式界面。大多数做大模型本地部署的人,我会推荐这条路。

路线三:vLLM,要给别人提供服务。 这是为吞吐量而生的生产级推理引擎:有一组基准显示,Llama 70B 在并发负载下 vLLM 跑出每秒 793 个 token,Ollama 是 41。但这个数字对独自聊天的单用户毫无意义,差距只在多个请求同时打到模型上时才显现。如果你说的"本地部署"是给团队起服务,vLLM(或 SGLang)就是你后面会长出来的那一层。

这三条路底下都坐着 llama.cpp,一个 C/C++ 写的推理引擎,整个生态大半建在它上面。你不需要直接碰它,知道它存在,看其他工具会顺眼很多。

量化:让模型跑起来的技术,也是让模型变笨的技术

几乎所有教程都用一段话带过这件事,然后翻篇:你下载的模型,几乎从来不是跑分用的那个模型。

厂商公布的分数,是全精度(BF16)参考实现在数据中心硬件上跑出来的。落到你硬盘上的,是量化版,权重从 16-bit 压到 4-bit 或 8-bit,为的是塞进你的显存。量化用精度换体积,这里的"精度"不是抽象概念:模型每生成一个 token,都是对整个词表做一次概率分布,压缩会让这个分布发生偏移。偏移够大,概率最高的候选词就会换人,模型开始选不一样的词。长回答里早期换掉一个 token,后面全部跟着偏,因为后面的每个字都以它为条件。

有个硬件论坛做了我一直希望每篇指南都做的实验:同一个模型、同一份权重,每次只改一个变量。只换 attention 后端、别的什么都不动,长上下文部分各次运行就开始互相"不同意"。只量化 KV cache、权重完全不动:8-bit 降质后能自己恢复,4-bit 直接产生一个失败的函数调用,再也回不来。五种权重量化的对比测试里,一个厂商发布的 FP4 包在 88k 上下文时 next-token 翻转率约 50%,五者垫底;两个 4-bit 参赛者都把全精度模型做对的命令行任务做错了。反而是社区一个 INT8 版本悄悄跑赢了官方 FP8,因为量化质量取决于标定和哪些层不量化,不取决于厂商的牌子。

给你两个可带走的结论。第一,这个影响是随距离放大的:短对话和一次性问答,各量化版本表现几乎一样;伤害显形的地方是长上下文、多步函数调用、agent 工作流。第二,模型卡上的 KLD、"几乎无损"之类声明,没有方法论披露就不要信,测量方式变了数字天差地别。

日常使用上,社区沉淀的默认选择是 Q4_K_M,被海量使用验证过的平衡点。显存够就用 Q8,和全精度几乎分不出。再送一个免费调试技巧,同样来自那个论坛帖:如果你的模型在"思考"输出里死循环,大概率是温度参数调太低了。我见过这个坑吃掉别人一下午。

什么时候真的该做大模型本地部署,什么时候别

大模型本地部署不是立场问题,是条件问题。以下条件成立一条,就值得部署:

数据确实不能出去。 合同、病历、内部文档、有保密要求的代码。约束是真的,云端功能再强也不值得为它违约。顺带说一句,这里还有中间档:不少公司的落点是大模型私有化部署,服务器放在自己机房或专有云里,不必一步走到桌底下塞显卡。

必须在离线环境用。 飞机、野外、物理隔离的机器、时好时坏的酒店 Wi-Fi。模型不在乎,它已经在硬盘里了。

用量大到计价器狂转。 每天几百万 token 跑批处理或内部工具,硬件投入是能摊销的。拿电费对一下 token 账单,盈亏平衡点存在,而且找得到。

以及同样诚实的反向清单,这些情况就别折腾了:

  • 要顶级输出质量。 天天跑本地模型的人自己划的线:27B 级以下"还很有限"。质量就是产品的话,你要么上云端旗舰,要么上大硬件。
  • 要跑长上下文 agent。 恰好是量化损伤显形的工作负载。一个量化模型快速问答很稳,60k token 的函数调用链就是会挂。
  • 不想多一个爱好。 驱动、显存设置、量化格式、上下文调参,大模型本地部署是持续的维护,不管你喜不喜欢。
  • 用量很轻。 一天二十个问题,API 费用按分计。本地部署在这种对比里"赢",前提是你的时间不要钱。

还有一个场景值得单独说,因为它是所有场景里最实用的:让你自己的文档喂给一台不联网的模型。那就是 RAG 的配置,检索在你自己的文件上做,生成本地模型完成。到了这一步,本地部署就从"挺好玩"变成"我每周真在用"。

真实用户都在拿本地大模型干什么

下面是社区数字,不是营销话术。一位用 3090 的老师,整套测评流水线全部本地跑:给 500 人的模拟考试出卷、判卷工具、行政自动化,全在一台机器上的 27B 级模型完成,他对分界线的表述很直白:低于这个量级"还很有限"。另一位用户把 Qwen 系 27B 用 4-bit 量化、96k 上下文塞进 24 GB 显卡,每秒 43 个 token,在 VS Code 里驱动编程 agent。另一头,那个发了著名帖子《聊聊本地大模型的实话》的人,笔记本 8 GB 显卡,结论是对他来说更像个爱好。爱好也没问题,爱好是被允许的。

想知道大模型本地部署以后你的硬件实际能跑什么,跳过各种计算器,直接看实测报告:vram.wiki 这个社区站在收集真实配置,显卡、模型、量化、上下文、每秒 token 数、诚实的局限说明,规矩是"未知就是未知,绝不推算"。我上次看是 150 多条。看见五个人用你这张卡跑你想跑的那个模型,比任何参数表都管用。如果你在意多模态输入,要把图片、音频直接丢给同一个模型,那选型清单和纯文本的是两份,比如 Google 的 Gemma 小尺寸型号就带多模态输入,选硬件前先确认这一点。

快答

大模型本地部署免费吗? 模型权重本身免费(主流型号大多是 Apache 2.0 许可),推理不免费:电费、硬件损耗、硬盘、搭建时间都是真金白银。你只是把 token 账单换成了硬件账单。

本地大模型能替代 ChatGPT 吗? 在特定任务上可以,隐私要求高的、离线的、大批量简单任务,有时还是更好的选择。作为通用能力和云端旗舰掰手腕,还不行,27B 级以下尤其不行。

8 GB 显存够吗? 跑 3B 到 7B 的量化模型,轻量任务够。想得到演示里那种体验,不够。这个档位"爱好"是更诚实的词。

Mac 能跑本地大模型吗? 能,而且相当好。Apple Silicon 的统一内存加 Metal 支持,让 Mac 成了消费级硬件里最适合跑本地AI模型的机器,前提是给 macOS 自己留够内存。

Ollama 是什么? ollama本地部署的入门第一条:它是把本地模型变成一条命令的工具。下载、运行、对外提供 OpenAI 兼容 API,全包了,现在也是多数本地 AI 工具默认对接的后端。

关于大模型本地部署,只带走一句话的话,带走这句:跑分说的是一个你没有的模型、在一台你没有的机器上的成绩。用你自己的任务、你自己的量化、你自己的上下文长度去测,那才是描述你眼前这台机器的唯一分数。