多模態大模型是什麼?和一般大模型的差別,一篇講清楚
終端機噴了一個看不懂的錯,你直接截圖丟進 AI 對話框,問「哪裡炸了」。三十秒後它指出是哪個依賴套件出問題,還給了修法。全程沒貼堆疊、沒描述畫面,它就是看懂了那張圖。
這個日常動作的背後就是多模態大模型。多模態大模型是能同時接收文字、影像、語音、影片等多種資訊形式,並放在一起做推理的大型語言模型。史丹佛 HAI 詞典給的定義是「同時處理、理解和生成多種資料模態」的 AI 系統。一般大模型活在一個純文字的世界裡,多模態大模型有了「感官」。
這篇講清楚幾件事:模態這個詞到底指什麼、一張圖片怎麼變成模型能消化的東西、實驗室實際在用的兩條架構路線、多模態真正擅長什麼,以及幾乎沒人寫的部分——什麼時候你不用它反而更好。
先拆詞:什麼是模態
模態就是資訊的表現形式。文字是一種模態,影像、語音、影片、感測器讀值都是。每種模態結構都不一樣:文字是一串詞,影像是一格一格的像素,語音是一段隨時間變化的波形,影片是影像加上時間軸。IBM 的科普頁說得很直白:每種模態有自己的結構,需要各自的表示方式。
結構對不上,就是整個工程難題的來源。文字是離散的符號,像素是連續的數字,聲音是時間上的訊號。多模態大模型要做的事,是把它們全部塞進同一種表示裡,讓一個網路能一起處理。
圖片在模型眼裡,也是一串 token
一個為「預測下一個詞」而生的模型,怎麼吃下一張圖?答案:把圖變成 token。
圖片先被切成小塊,通常每塊 16×16 像素。視覺編碼器(一般是視覺 Transformer,CLIP 是最經典的開源選擇)把每個小塊轉成一個特徵向量,再經過一個很小的投影層,把向量調整到和文字 token 完全相同的維度。從這一刻起,影像塊就是 token 了。模型分不清哪個 token 來自圖片、哪個來自文字,它們排在同一個輸入序列裡。
更深的一層是這些 token 落在哪。訓練讓模型把嵌入空間整理成「意思近的點挨得近」:「一隻貓」這個詞組、"cat" 這個英文詞、一張貓的照片,最終都落在同一個鄰域。所有科普文都會提「統一語意空間」,說的就是這個,它也是向量資料庫那套 embedding 儲存的底層邏輯。
有個實際後果很少有人講透:圖片是要吃上下文的。一張照片不是一個 token,是幾百上千個,每一個都和文字一樣佔著模型的上下文視窗。往對話裡傳二十張圖,模型會更快「忘掉」前面的聊天內容;呼叫 API 計費,圖片按 token 算錢。「一圖勝千言」在這一行是字面成立的工程事實。
兩條路線:串接派和注意力派
這是幾乎沒人寫、但最值得懂的部分:各家實驗室做多模態大模型,走的是兩條不同的路線,各有代價。
第一條:串接派。把上面說的影像 token 直接串接在文字 token 後面餵進去。LLM 本身不動,一個標準解碼器照常處理混合序列。Sebastian Raschka 管這叫統一嵌入解碼器架構,LLaVA、Molmo、MiniGPT-4 都是這麼做的。好處是簡單:不動模型結構,影像 token 走的文字 token 的原路。
第二條:注意力派。影像不進輸入序列,而是接進注意力層內部。文字 token 發出查詢,影像特徵提供鍵值,每一層裡文字都能「看到」圖裡相關的部分。Flamingo 是這條路線的開創者,Meta 的 Llama 3.2 視覺版用的也是它。收益是省:一張高解析度圖片攜帶的資訊不用再擠佔幾千個輸入 token。
哪條路贏?NVIDIA 的 NVLM 專案把三種變體(兩條路線加一個混合版)都做了一遍,同場比較:注意力派處理高解析度圖更省算力,串接派在 OCR 類任務上準確率更高。沒有完勝者,只有取捨。想看完整的研究者視角,Raschka 那篇是我讀過講得最好的。
訓練側再補兩個細節。第一,多數團隊從預訓練好的純文字 LLM 出發,凍結視覺編碼器和 LLM,只訓中間那個小投影器。一份涵蓋 26 個前沿多模態模型的綜述發現,可訓練參數通常只佔總量 2% 左右。這就是開源多模態模型大量出現的重要原因:你訓的不是一顆新大腦,是一個翻譯。第二,Llama 3.2 故意反著來:凍結 LLM、只更新視覺編碼器,為的是保住文字能力,讓多模態版能直接替換純文字版。架構選擇,本質是產品選擇。
從外掛眼睛到原生多模態
發展史壓縮成三段。第一段:純文字 LLM,文字能力極強,但對世界全盲。第二段:視覺語言模型(VLM),給文字 LLM 外掛一雙眼睛,圖進文出,GPT-4V、Qwen-VL 都在這裡。第三段:原生多模態,從訓練第一天起就把影像、語音、影片、文字放在一起學,模態參與塑造模型本身而不是事後加裝。Google 對 Gemini 的說法就是「從底層原生設計」成這樣。
有個區別值得放在心裡:理解多模態不等於生成多模態。VLM 能讀圖但只會輸出文字;原生多模態模型原則上能輸出任何模態,說一段話、畫一張圖、生成影片。看到宣傳裡寫「多模態」,先分清說的是哪一頭:輸入側的多模態如今是標配,任意模態輸出才是當前的前沿。
順帶分清它和「生成式 AI」的關係:生成式 AI 指模型能創作內容,通常從單一模態的提示詞出發;多模態說的是進出模型的資料類型。兩者大量重疊,但回答的不是同一個問題。
它真正好用的三個場景
我見過多模態大模型穩定創造價值的三個場景:
截圖除錯。就是開頭那一幕。報錯、版面跑掉、看不懂的圖表,直接貼圖提問。這比用文字描述問題強,因為一半時候你還沒有描述清楚問題的詞彙。
文件和表格擷取。掃描版 PDF、合約、財務報表。多模態模型能讀懂第 14 頁的表格,吐成乾淨的 Markdown 或 JSON。Raschka 說他最愛的用法是把 PDF 表格轉 LaTeX,這也是我用得最多的,幾乎每週都要把參考資料轉成可檢索的格式。
跨模態消歧。單獨的文字常常有歧義。「蘋果發布了……」,水果還是公司?配上隨文的那張 logo 圖,歧義當場消失。中文社群有篇流傳很廣的文章正是拿這個做示範。聽著像小把戲,但搜尋、內容審核、助理產品裡,天天都在靠它做判斷。
誠實的一面:三個真實短板
每篇科普都在列能力,幾乎沒人列代價。把工作切給多模態介面之前,三件事你得知道:
更慢也更貴。影像 token 是實打實的 token:佔上下文視窗,按 token 計費,費率往往還更高。純文字任務走多模態介面,等於白付一筆多模態溢價。我的原則很簡單:純文字負載留在純文字模型上,輸入裡真有像素或語音時才上多模態。
幻覺被放大。多模態大模型不是繼承了幻覺問題,是放大了它。IBM 的概述和一線工程師的複盤都指出:這些模型會篤定地描述圖裡沒有的東西,左轉的車說成右轉,不存在的表格行說得若有其事。跨模態對齊並不完美,模型會拿「看起來合理」的編造填縫。緩解手段是有的(強制先描述看到了什麼再回答、把答案錨定到影像區域),但減少不等於解決,機制展開看我們這篇 AI 幻覺。多模態的答案要接不可逆操作之前,務必加一道人工或程式檢核。
跑分好看,上手打折。IBM 列了一串待解問題,從長圖文上下文到複雜指令遵循,開源模型在這些地方還落後閉源一截。廠商 demo 裡的能力,到你的圖片上未必成立。留出預算在自己的資料上做評估。
它在 AI 技術堆疊裡站在哪
多模態正在變成基礎建設,和我們另外幾篇指南直接接上。在 RAG 系統裡,檢索不必再是純文字的:多模態編碼器能把圖和文嵌入同一個可檢索空間,一個問題可以撈出「能回答它的那張圖表」,而不只是提到它的那段文字。再看智慧代理人:看不見螢幕的 AI 智慧代理人操作不了你的電腦,視覺是聊天機器人和「能點按鈕的幹活者」之間的分界線。任意模態進、任意模態出,這個方向整個產業都在明著走。
常見問題快答
什麼是多模態大模型?一句話: 能接收並推理多種輸入類型(文字、影像、語音、影片)的大型語言模型,而不是只吃文字。
多模態大模型和一般大模型有什麼差別? 輸入和理解能力。一般大模型只讀文字;多模態大模型讀文字之外還能讀其他模態,最強的那些是從訓練起原生處理,不是外掛。
多模態 AI 和生成式 AI 是一回事嗎? 不是。生成式 AI 指創作內容,多模態指進出模型的資料類型。前沿模型通常兩者都是。
多模態大模型能在本地跑嗎? 7B 級別的小型視覺語言模型(如 Qwen-VL)在 16GB 顯存的消費級顯示卡上就能跑,更大的模型需要雲端 GPU 或 API。
多模態模型的輸出一定是圖像和語音嗎? 不一定。VLM 類多模態模型只輸出文字。輸入側多模態來得早,任意模態輸出是更新也更糙的前沿。
這篇只記住一句話也行:多模態大模型學的不是魔法,是翻譯。你餵進去的一切都變成共享空間裡的 token,你對文字模型已有的全部認知——上下文上限、幻覺、按 token 計費——照樣成立,只是式子裡多了圖片。