AGI(通用人工智慧)是什麼?和 AI 的差別、還要多久,一篇講清楚
2025 年 12 月,OpenAI 的 CEO Sam Altman 說「我們已經造出 AGI 了」,還說 AGI「咻一下就過去了」,社會影響不如預期,建議產業改聊超級智慧。幾週之後,2026 年,OpenAI 總裁 Greg Brockman 又宣布公司的新模型象徵著「AGI 時代」的開始。同一家公司,同一個詞。一邊說已經過去,一邊說剛開始。
這不是公關事故,這就是通用人工智慧(AGI)的真實現況:一個還沒有共識定義的目標。正因為沒有共識,同一家公司才能在同一季裡,同時宣布它落在身後和橫在眼前。這篇就把這件事講透:AGI 到底指什麼、定義為什麼吵了幾十年、你拿什麼尺去量它,以及那些時間預測到底該信誰。
先排一個真實的雷:在美國稅表上,AGI 是 adjusted gross income(調整後總所得)的縮寫,IRS 的解說頁常年和你搜的 AI 文章混在結果前兩頁。如果你是來查報稅的,那是另一個 AGI。我們這篇講的是 artificial general intelligence,通用人工智慧,有些頁面也譯作人工通用智慧,一個意思。
一句話定義,和它旁邊的三個詞
剝掉所有雜訊,核心意思一句話:AGI 是一種假設中的人工智慧系統,在幾乎所有認知任務上達到或超過人類水準,而不只是它會做的那幾件事。關鍵字是通用:能把一個領域學到的知識遷移到另一個領域,能解決沒人專門教過它的新問題。下棋引擎不會報稅,翻譯模型學不會做菜,而通用人工智慧原則上碰到哪樣都能自己摸出門道。
它身邊圍著三個容易混淆的詞,一張表分清:
| 詞 | 含義 | 現況 |
|---|---|---|
| AI | 總稱:一切需要「智慧」才能完成的任務系統 | 無所不在:搜尋、推薦、語音助理 |
| AIGC / 生成式 AI | 專注生成內容的那一支:文字、影像、音訊、程式碼 | 當紅:ChatGPT、Midjourney 們 |
| AGI(通用人工智慧) | 跨全部認知任務達到人類水準 | 假設中。連判定標準都沒有 |
| ASI | 全面超越人類的超級智慧 | 更假設 |
注意「假設中」三個字。史丹佛 HAI 辭典等幾乎所有嚴謹的定義都帶著這個詞。通用人工智慧沒人造出來過,而且很多人沒意識到的一點是:連「造出來該按什麼標準驗收」,業內都還沒吵出結果。
定義為什麼吵了幾十年
我第一次認真翻這個題目時被一個事實嚇到:AGI 的定義之爭比 ChatGPT 老,比深度學習老,幾乎和這個學科一樣老。
先說個反轉。1956 年達特茅斯會議造出「人工智慧」這個詞的時候,目標本來就是通用智慧:讓機器用語言、形成抽象、解決留給人類的那類問題。這就是最初的夢想。後來幾十年做出來的全是專用系統,做著做著,「AI」反倒成了專用的代名詞。通用人工智慧這個詞冒出來,有一半動機就是把原意搶回來。縮寫 AGI 的年頭倒不老:有研究者說得直白,AGI 指的就是這個領域誕生之初的那個 AI。Mark Gubrud 1997 年討論全自動軍事生產時首次用了「artificial general intelligence」,Shane Legg 和 Ben Goertzel 在 2002 年前後把它重新引入並推廣開。
然後爭吵就開始了。2007 年 Legg 和 Hutter 那篇著名的綜述收了幾十種公開發表的智慧定義,全是職業研究者,用著同一個詞,指的東西卻實質不同。更早一年,AGI Workshop 的會議錄已經認輸:現在就斷定哪種「智慧」概念是「正確的」,為時尚早。快二十年過去,史丹佛 HAI 辭典的表述依然是「沒有普遍接受的測試」,所以各種宣稱都無法驗證。連「人工智慧」這個詞的發明人 John McCarthy 都在 2007 年寫道:我們至今說不清楚,到底想把什麼樣的計算過程稱為智慧。
順帶釐清一個近親詞:哲學界說的強人工智慧,專指有意識、有心智的程式,這是 Searle 1980 年提出的用法;通用人工智慧講的是跨領域效能,不管機器裡面有沒有「心智」。日常混用沒關係,認真時要分開。而最值得懂的那條最深裂縫,新聞裡大部分口水戰都從這兒來。一派按解題能力算:系統在任務上達到人類水準,就算智慧。Google DeepMind 的分級框架(下面細講)屬於這派。另一派咬定智慧是學習的能力本身:不能學習的系統不算智慧,答案再漂亮也不算,計算機算術全對,沒人說它是天才。我反覆讀的一篇定義論文把這點推得很尖:典型的機器學習系統在訓練階段是智慧的,部署之後就不再智慧,因為它停止學習了。按這個視角,一個刷遍所有基準測試但從不上進的模型,是一段很精緻的「錄影」,不是通用智慧。
兩派都沒錯,它們在回答不同的問題:「它能做什麼」和「它怎麼獲得的能力」。在這個領域對哪個問題更重要達成一致之前,定義會一直開著口子。
AI 效應:為什麼每個里程碑都會被判「不算」
AI 史上有個模式,有自己的名字:AI 效應。每當機器拿下一項被認為需要智慧的能力,輿論先是驚嘆,然後悄悄重新歸類:「哦,原來那只是搜尋」「只是統計」「只是模式匹配」。1997 年深藍贏了西洋棋,後來 Watson 贏了益智問答,2016 年 AlphaGo 贏了圍棋。每一次,球門都被搬走了。
前面那篇定義論文把機制戳穿了:問題一旦被解決,人們回頭看會發現,真正解決它的是人類開發者,機器只是執行。機器自己沒有獲取任何新知識,所以「不算數」。這個循環你現在就能親眼看到:模型一學會聊天,「聊天」就從智慧測試被降級成小把戲。可 1980 年代日本的第五代電腦計畫,還把「隨口閒聊」列在 AGI 級目標清單上。同一種能力,四十年前是里程碑,今天是起跑線。
這就是為什麼我常跟人說:你可能永遠等不到一個所有人都認帳的「AGI 正式誕生」官宣。任何候選系統都會被放到顯微鏡下,方法被逐層拆解,然後總有一批人裁定它「只是」某個技術。「只是」這兩個字,是每個 AI 里程碑都要交的過路費。
一把真能用的尺:DeepMind 五級框架
定義吵歸吵,有沒有實用的東西?有,到目前為止最好用的是 Google DeepMind 2023 年提出的分級框架。它的思路是不問「是不是通用人工智慧」,改問「到第幾級了」。
框架有兩條軸。效能軸分五級:入門(emerging)、勝任(competent)、專家(expert)、大師(virtuoso)、超人類(superhuman)。「勝任」的標準是在一大類非體力任務上超過一半熟練成年人,「超人類」是壓過幾乎所有人,那也就是 ASI 的起點。另一條是自主性軸,從工具(完全由人控制)到顧問、協作者,一路到完全自主的智慧代理人。最後這一級,正是我們另一篇講 AI 智慧代理人的地盤。
讓這個框架出名的那個定級很有意思:DeepMind 把 ChatGPT 這類大語言模型歸為「入門級 AGI」,在一大類任務上相當於不熟練的人類。不是零,也不是「和 AGI 毫無關係」,是入門。
批評也真實存在,而且批評本身很有教益。如果只按解題能力定義,那把一千個專用解題器整合到一台電腦上,理論上也夠格:它什麼題都能答,但沒有誰會叫它通用智慧。學習派在這裡再次發難:只量分數,說明不了系統面對真正的新情況時能不能適應,而「通用」的全部意義恰恰在這兒。
我的習慣是這樣:某家實驗室宣布某物是不是 AGI,我不再糾纏標籤,只問三件事:第幾級、哪條軸、誰打的分。宗教辯論瞬間變成表格填空。你滑到任何產品發表都能這麼量一遍,一分鐘的事。
現在到哪一步了:鋸齒狀,不是通用
那今天的模型到底站在哪?一個詞概括:鋸齒狀。前沿模型在某些切片上超人類(跨百萬文件的召回、部分競賽數學),在大量知識任務上中規中矩,在另一些地方又弱得讓人意外。這個形態有個專門的說法叫鋸齒狀智慧:能力分布極不均衡,這邊遠超人類,那邊連常識都缺。它不是註腳,它是這類系統學習方式的簽名。
具體說,離真正的通用人工智慧還差三塊硬骨頭:
可靠性。問題不是模型「不會」,而是它會非常自信地錯。這就是幻覺問題,機制我們單寫了一篇AI 幻覺,短版是:一個預測下一個詞的模型,天生沒有「我不知道」這個擋位。一個 95% 正確、100% 自信的系統,你還不能把全新的開放式工作交給它。
長程規劃。寫一個函式、安排一次旅行,模型在行。但跑一個以月計的專案:定目標、拆任務、受挫後恢復、世界變了重新規劃,這是另一種運動,智慧代理人才剛開始嘗試。
持續學習。今天的模型部署時就凍結了。它不會從你這次對話裡學到什麼,下個月也不記得,更不會自己更新自己。訓練時是智慧,推理時是雕像,定義之爭裡的那句批評,落到產品上就是這個體驗。
這也解釋了「像通用人工智慧」和「是通用人工智慧」的差距。一個能讀螢幕截圖、寫程式、用你的口吻說話的多模態模型,示範裡看起來很通用,底層仍是那個巨大的凍結函式。再驚豔歸再驚豔,離研究者嘴裡的「通用」還差著上面三塊。
還要多久:給你一張表,不給一個日期
所有人都在問 AGI 的時間表。誠實的答案只能是一張表,因為分歧本身就是答案:
| 誰說的 | 說法 |
|---|---|
| Demis Hassabis(DeepMind CEO,2023) | 十年內,甚至幾年 |
| 黃仁勳(NVIDIA CEO,2024) | 五年內 AI 通過任何人類測試 |
| Leopold Aschenbrenner(前 OpenAI,2024) | 2027 年「驚人地可信」 |
| Sam Altman(OpenAI CEO,2025.12) | 已經「咻一下過去了」 |
| 研究者民調中位數(2012-2013) | 50% 信心在 2040-2050 年間 |
| 同批民調平均 | 2081 年 |
| 同批民調 | 16.5% 的專家回答「永遠不會」 |
| 近期調查彙整(2025) | 多數認為 2100 年前;當前中位約 2040 |
看出形狀了嗎:公司正在造 AGI 的人,扎堆說「幾年」;全職研究它的人,扎堆說 2040,還有一條實打實的尾巴說永不。2012 年一項針對 95 個預測的後設分析還發現一件近乎喜劇的事:不管歷史上的還是現代的預測,都偏向「從現在起 16 到 26 年」。隨便哪一年去問,AGI 都還差 20 年。
這個領域被燙過兩次。1970 年代初,出資方發現研究者嚴重低估了問題難度,把錢轉去搞「應用 AI」。1980 年代日本第五代電腦計畫承諾十年做出接近 AGI 的目標,最後隨計畫一起垮掉。二十年裡預測錯了兩回之後,研究者乾脆不預測了,他們受夠了被叫「瞪大眼的夢想家」。今天 CEO 們那些篤定的幾年之約,和 1980 年代聽起來一模一樣;今天民調裡保守的中位數,是當年的疤在說話。
所以我的看法是:把通用人工智慧當方向,別當日期。能力確實在照節奏複利成長,而「抵達的那一刻」會被永遠爭論下去,因為它是一個定義事件,不是一個物理事件。
常見問題快答
AGI是什麼?一句話: 通用人工智慧是假設中的、在幾乎所有認知任務上達到或超過人類水準的 AI 系統,能跨領域遷移知識、解決沒人專門教過的新問題。
AGI和AI的差別是什麼? AI 是總稱,包括所有專用系統(推薦、人臉辨識、下棋引擎);通用人工智慧是假設中的終點:一個系統通吃所有領域,而不是一件事做得特別好。
ChatGPT 算 AGI 嗎? 按 DeepMind 的分級,ChatGPT 類模型是「入門級 AGI」,大致相當於不熟練的人類在很多任務上的表現。按學習派的標準,它們部署後就停止學習,根本談不上通用智慧。兩種說法都成立,「已有定論」不成立。
什麼是AGI時代? OpenAI 總裁 2026 年說新模型開啟了「AGI 時代」,這是廠商的行銷節點,不是學界共識。在定義都沒統一的當下,「XX 時代」這類說法聽個態度就行,別當時間戳。
AGI 多久能實現? 看你問誰:業界領袖說幾年內,研究者民調中位約 2040 年,還有 16.5% 的受訪專家說永遠不會。誰要是給你一個篤定的具體日期,多半是想賣你點什麼。
這篇只留一句話也行:別再問「到了沒有」,改問「第幾級、哪條軸、誰打的分」。這個問題不會過時,不管球門再搬多少次。