多模态大模型是什么?和普通大模型的区别,一篇讲清楚
终端报了个看不懂的错,你直接截个图丢进 AI 对话框,问"哪里炸了"。三十秒后它指出是哪个依赖出的问题,还给了修法。全程没贴堆栈、没描述界面,它就是看懂了那张图。
这个日常动作的背后就是多模态大模型。多模态大模型是能同时接收文本、图像、音频、视频等多种信息形式,并放在一起做推理的大语言模型。斯坦福 HAI 词典给的定义是"同时处理、理解和生成多种数据模态"的 AI 系统。普通大模型活在一个纯文字的世界里,多模态大模型有了"感官"。
这篇讲清楚几件事:模态这个词到底指什么、一张图片怎么变成模型能消化的东西、实验室实际在用的两条架构路线、多模态真正擅长什么,以及几乎没人写的部分——什么时候你不用它反而更好。
先拆词:什么是模态
模态就是信息的表现形式。文本是一种模态,图像、音频、视频、传感器读数都是。每种模态结构都不一样:文本是一串词,图像是一格一格的像素,音频是一段随时间变化的波形,视频是图像加上时间轴。IBM 的科普页说得很直白:每种模态有自己的结构,需要各自的表示方式。
结构对不上,就是整个工程难题的来源。文字是离散的符号,像素是连续的数字,声音是时间上的信号。多模态大模型要干的事,是把它们全部塞进同一种表示里,让一个网络能一起处理。
图片在模型眼里,也是一串 token
一个为"预测下一个词"而生的模型,怎么吃下一张图?答案:把图变成 token。
图片先被切成小块,通常每块 16×16 像素。视觉编码器(一般是视觉 Transformer,CLIP 是最经典的开源选择)把每个小块转成一个特征向量,再经过一个很小的投影层,把向量调整到和文本 token 完全相同的维度。从这一刻起,图像块就是 token 了。模型分不清哪个 token 来自图片、哪个来自文字,它们排在同一个输入序列里。
更深的一层是这些 token 落在哪。训练让模型把嵌入空间整理成"意思近的点挨得近":"一只猫"这个词组、"cat"这个英文词、一张猫的照片,最终都落在同一个邻域。所有科普文都会提"统一语义空间",说的就是这个,它也是向量数据库那套 embedding 存储的底层逻辑。
有个实际后果很少有人讲透:图片是要吃上下文的。一张照片不是一个 token,是几百上千个,每一个都和文字一样占着模型的上下文窗口。往对话里传二十张图,模型会更快"忘掉"前面的聊天内容;调 API 计费,图片按 token 算钱。"一图胜千言"在这行是字面成立的工程事实。
两条路线:拼接派和注意力派
这是几乎没人写、但最值得懂的部分:各家实验室做多模态大模型,走的是两条不同的路线,各有代价。
第一条:拼接派。把上面说的图像 token 直接拼接在文本 token 后面喂进去。LLM 本身不动,一个标准解码器照常处理混合序列。Sebastian Raschka 管这叫统一嵌入解码器架构,LLaVA、Molmo、MiniGPT-4 都是这么做的。好处是简单:不动模型结构,图像 token 走的文字 token 的原路。
第二条:注意力派。图像不进输入序列,而是接进注意力层内部。文本 token 发出查询,图像特征提供键值,每一层里文字都能"看到"图里相关的部分。Flamingo 是这条路线的开创者,Meta 的 Llama 3.2 视觉版用的也是它。收益是省:一张高分辨率图片携带的信息不用再挤占几千个输入 token。
哪条路赢?NVIDIA 的 NVLM 项目把三条变体(两条路线加一个混合版)都做了一遍,同场对比:注意力派处理高分辨率图更省算力,拼接派在 OCR 类任务上准确率更高。没有完胜者,只有取舍。想看完整的研究者视角,Raschka 那篇是我读过讲得最好的。
训练侧再补两个细节。第一,多数团队从预训练好的纯文本 LLM 出发,冻结视觉编码器和 LLM,只训中间那个小投影器。一份覆盖 26 个前沿多模态模型的综述发现,可训练参数通常只占总量 2% 左右。这就是开源多模态模型井喷的重要原因:你训的不是一颗新大脑,是一个翻译。第二,Llama 3.2 故意反着来:冻结 LLM、只更新视觉编码器,为的是保住文本能力,让多模态版能直接替换纯文本版。架构选择,本质是产品选择。
从外挂眼睛到原生多模态
发展史压缩成三段。第一段:纯文本 LLM,文字能力极强,但对世界全盲。第二段:视觉语言模型(VLM),给文本 LLM 外挂一双眼睛,图进文出,GPT-4V、Qwen-VL 都在这里。第三段:原生多模态,从训练第一天起就把图像、音频、视频、文本放在一起学,模态参与塑造模型本身而不是事后加装。Google 对 Gemini 的说法就是"从底层原生设计"成这样。
有个区别值得揣兜里:理解多模态不等于生成多模态。VLM 能读图但只会输出文字;原生多模态模型原则上能输出任何模态,说一段话、画一张图、生成视频。看到宣传里写"多模态",先分清说的是哪头:输入侧的多模态如今是标配,任意模态输出才是当前的前沿。
顺带分清它和"生成式 AI"的关系:生成式 AI 指模型能创作内容,通常从单一模态的提示词出发;多模态说的是进出模型的数据类型。两者大量重叠,但回答的不是同一个问题。
至于"多模态大模型有哪些"这类高频问题,比起背名单,我更建议你记路线:名单每个季度都在换,路线这几年没变过。懂了拼接派和注意力派,新模型发布时你看一眼架构描述就知道它站在哪。
它真正好用的三个场景
我见过多模态大模型稳定创造价值的三个场景:
截图调试。就是开头那一幕。报错、布局错乱、看不懂的图表,直接贴图提问。这比用文字描述问题强,因为一半时候你还没有描述清楚问题的词汇。
文档和表格提取。扫描版 PDF、合同、财务报表。多模态模型能读懂第 14 页的表格,吐成干净的 Markdown 或 JSON。Raschka 说他最爱的用法是把 PDF 表格转 LaTeX,这也是我用得最多的,几乎每周都要把参考资料转成可检索的格式。
跨模态消歧。单独的文本常常有歧义。"苹果发布了……",水果还是公司?配上随文的那张 logo 图,歧义当场消失。中文社区有篇流传很广的文章正是拿这个做演示。听着像小把戏,但搜索、内容审核、助手产品里,天天都在靠它做判断。
诚实的一面:三个真实短板
每篇科普都在列能力,几乎没人列代价。把工作切给多模态接口之前,三件事你得知道:
更慢也更贵。图像 token 是实打实的 token:占上下文窗口,按 token 计费,费率往往还更高。纯文本任务走多模态接口,等于白付一笔多模态溢价。我的原则很简单:纯文本负载留在纯文本模型上,输入里真有像素或音频时才上多模态。
幻觉被放大。多模态大模型不是继承了幻觉问题,是放大了它。IBM 的概述和一线工程师的复盘都指出:这些模型会笃定地描述图里没有的东西,左转的车说成右转,不存在的表格行说得有鼻子有眼。跨模态对齐并不完美,模型会拿"看起来合理"的编造填缝。缓解手段是有的(强制先描述看到了什么再回答、把答案锚定到图像区域),但减少不等于解决,机制展开看我们这篇AI 幻觉。多模态的答案要接不可逆操作之前,务必加一道人工或程序校验。
跑分好看,上手打折。IBM 列了一串待解问题,从长图文上下文到复杂指令遵循,开源模型在这些地方还落后闭源一截。厂商 demo 里的能力,到你的图片上未必成立。留出预算在自己的数据上做评估。
它在 AI 技术栈里站在哪
多模态正在变成基础设施,和我们另外几篇指南直接接上。在 RAG 系统里,检索不必再是纯文本的:多模态编码器能把图和文嵌入同一个可检索空间,一个问题可以捞出"能回答它的那张图表",而不只是提到它的那段文字。再看智能体:看不见屏幕的 AI 智能体操作不了你的电脑,视觉是聊天机器人和"能点按钮的干活者"之间的分界线。任意模态进、任意模态出,这个方向整个行业都在明着走。
常见问题快答
什么是多模态大模型?一句话: 能接收并推理多种输入类型(文本、图像、音频、视频)的大语言模型,而不是只吃文字。
多模态大模型和普通大模型有什么区别? 输入和理解能力。普通大模型只读文字;多模态大模型读文字之外还能读其他模态,最强的那些是从训练起原生处理,不是外挂。
多模态 AI 和生成式 AI 是一回事吗? 不是。生成式 AI 指创作内容,多模态指进出模型的数据类型。前沿模型通常两者都是。
多模态大模型能在本地跑吗? 7B 级别的小型视觉语言模型(如 Qwen-VL)在 16GB 显存的消费级显卡上就能跑,更大的模型需要云端 GPU 或 API。
多模态模型的输出一定是图像和音频吗? 不一定。VLM 类多模态模型只输出文字。输入侧多模态来得早,任意模态输出是更新也更糙的前沿。
这篇只记住一句话也行:多模态大模型学的不是魔法,是翻译。你喂进去的一切都变成共享空间里的 token,你对文本模型已有的全部认知——上下文上限、幻觉、按 token 计费——照样成立,只是式子里多了图片。