AGI(通用人工智能)是什么?和 AI 的区别、还要多久,一篇讲清楚
2025 年 12 月,OpenAI 的 CEO Sam Altman 说"我们已经造出 AGI 了",还说 AGI"嗖一下就过去了",社会影响不如预期,建议行业改聊超级智能。几周之后,2026 年,OpenAI 总裁 Greg Brockman 又宣布公司的新模型标志着"AGI 时代"的开始。同一家公司,同一个词。一边说已经过去,一边说刚刚开始。
这不是公关事故,这就是通用人工智能(AGI)的真实现状:一个还没有共识定义的目标。正因为没有共识,同一家公司才能在同一季度里,同时宣布它落在身后和横在眼前。这篇就把这件事讲透:AGI 到底指什么、定义为什么吵了几十年、你拿什么尺去量它,以及那些时间预测到底该信谁。
先排一个真实的雷:在美国税表上,AGI 是 adjusted gross income(调整后总收入)的缩写,IRS 的解释页常年和你搜的 AI 文章混在结果前两页。如果你是来查报税的,那是另一个 AGI。我们这篇讲的是 artificial general intelligence,通用人工智能,有些页面也译作人工通用智能,一个意思。
一句话定义,和它旁边的三个词
剥掉所有噪音,核心意思一句话:AGI 是一种假设中的人工智能系统,在几乎所有认知任务上达到或超过人类水平,而不只是它会做的那几件事。关键词是通用:能把一个领域学到的知识迁移到另一个领域,能解决没人专门教过它的新问题。下棋引擎不会报税,翻译模型学不会做饭,而通用人工智能原则上碰到哪样都能自己摸出门道。
它身边围着三个容易混淆的词,一张表分清:
| 词 | 含义 | 现状 |
|---|---|---|
| AI | 总称:一切需要"智能"才能完成的任务系统 | 无处不在:搜索、推荐、语音助手 |
| AIGC / 生成式 AI | 专注生成内容的那一支:文本、图像、音频、代码 | 当红:ChatGPT、Midjourney 们 |
| AGI(通用人工智能) | 跨全部认知任务达到人类水平 | 假设中。连判定标准都没有 |
| ASI | 全面超越人类的超级智能 | 更假设 |
注意"假设中"三个字。斯坦福 HAI 词典等几乎所有严谨的定义都带着这个词。通用人工智能没人造出来过,而且很多人没意识到的一点是:连"造出来该按什么标准验收",业内都还没吵出结果。
定义为什么吵了几十年
我第一次认真翻这个话题时被一个事实惊到:AGI 的定义之争比 ChatGPT 老,比深度学习老,几乎和这个学科一样老。
先说个反转。1956 年达特茅斯会议造出"人工智能"这个词的时候,目标本来就是通用智能:让机器用语言、形成抽象、解决留给人类的那类问题。这就是最初的梦想。后来几十年做出来的全是专用系统,做着做着,"AI"反倒成了专用的代名词。通用人工智能这个词冒出来,有一半动机就是把原意抢回来。缩写 AGI 的年头倒不老:有研究者说得直白:AGI 指的就是这个领域诞生之初的那个 AI。时间上,Mark Gubrud 1997 年讨论全自动军事生产时首次用了"artificial general intelligence",Shane Legg 和 Ben Goertzel 在 2002 年前后把它重新引入并推广开。
然后争吵就开始了。2007 年 Legg 和 Hutter 那篇著名的综述收了几十种公开发表的智能定义,全是职业研究者,用着同一个词,指的东西却实质不同。更早一年,AGI Workshop 的会议录已经认怂:现在就断定哪种"智能"概念是"正确的",为时尚早。快二十年过去,斯坦福 HAI 词典的表述依然是"没有普遍接受的测试",所以各种宣称都无法验证。连"人工智能"这个词的发明人 John McCarthy 都在 2007 年写道:我们至今说不清楚,到底想把什么样的计算过程称为智能。
顺带辨析一个近亲词:哲学界说的强人工智能,专指有意识、有心智的程序,这是 Searle 1980 年提出的用法;通用人工智能讲的是跨领域性能,不管机器里面有没有"心智"。日常混用没关系,较真时要分开。而最值得懂的那条最深裂缝,新闻里大部分嘴仗都从这儿来。一派按解题能力算:系统在任务上达到人类水平,就算智能。Google DeepMind 的分级框架(下面细讲)属于这派。另一派咬定智能是学习的能力本身:不能学习的系统不算智能,答案再漂亮也不算,计算器算术全对,没人说它是天才。我反复读的一篇定义论文把这点推得很尖:典型的机器学习系统在训练阶段是智能的,部署之后就不再智能,因为它停止学习了。按这个视角,一个刷遍所有基准测试但从不上进的模型,是一段很精致的"录像",不是通用智能。
两派都没错,它们在回答不同的问题:"它能做什么"和"它怎么获得的能力"。在这个领域对哪个问题更重要达成一致之前,定义会一直开着口子。
AI 效应:为什么每个里程碑都会被判"不算"
AI 史上有个模式,有自己的名字:AI 效应。每当机器拿下一项被认为需要智能的能力,舆论先是惊叹,然后悄悄重新归类:"哦,原来那只是搜索""只是统计""只是模式匹配"。1997 年深蓝赢了国际象棋,后来 Watson 赢了智力问答,2016 年 AlphaGo 赢了围棋。每一次,球门都被搬走了。
前面那篇定义论文把机制戳穿了:问题一旦被解决,人们回头看会发现,真正解决它的是人类开发者,机器只是执行。机器自己没有获取任何新知识,所以"不算数"。这个循环你现在就能亲眼看到:模型一学会聊天,"聊天"就从智能测试被降级成小把戏。可 1980 年代日本的第五代计算机计划,还把"随口闲聊"列在 AGI 级目标清单上。同一种能力,四十年前是里程碑,今天是起跑线。
这就是为什么我常跟人说:你可能永远等不到一个所有人都认账的"AGI 正式诞生"的官宣。任何候选系统都会被放到显微镜下,方法被逐层拆解,然后总有一批人裁定它"只是"某个技术。"只是"这两个字,是每个 AI 里程碑都要交的过路费。
一把真能用的尺:DeepMind 五级框架
定义吵归吵,有没有实用的东西?有,到目前为止最好用的是 Google DeepMind 2023 年提出的分级框架。它的思路是不问"是不是通用人工智能",改问"到第几级了"。
框架有两条轴。性能轴分五级:入门(emerging)、胜任(competent)、专家(expert)、大师(virtuoso)、超人类(superhuman)。"胜任"的标准是在一大类非体力任务上超过一半熟练成年人,"超人类"是压过几乎所有人,那也就是 ASI 的起点。另一条是自主性轴,从工具(完全由人控制)到顾问、协作者,一路到完全自主的智能体。最后这一级,正是我们另一篇讲 AI 智能体的地盘。
让这个框架出名的那个定级很有意思:DeepMind 把 ChatGPT 这类大语言模型归为"入门级 AGI",在一大类任务上相当于不熟练的人类。不是零,也不是"和 AGI 毫无关系",是入门。
批评也真实存在,而且批评本身很有教益。如果只按解题能力定义,那把一千个专用解题器集成到一台计算机上,理论上也够格:它什么题都能答,但没有谁会叫它通用智能。学习派在这里再次发难:只量分数,说明不了系统面对真正的新情况时能不能适应,而"通用"的全部意义恰恰在这儿。
我的习惯是这样:某家实验室宣布某物是不是 AGI,我不再纠缠标签,只问三件事:第几级、哪条轴、谁打的分。宗教辩论瞬间变成表格填空。你刷到任何产品发布都能这么量一遍,一分钟的事。
现在到哪一步了:锯齿状,不是通用
那今天的模型到底站在哪?一个词概括:锯齿状。前沿模型在某些切片上超人类(跨百万文档的召回、部分竞赛数学),在大量知识任务上中规中矩,在另一些地方又弱得让人意外。这个形态有个专门的说法叫锯齿状智能:能力分布极不均衡,这边远超人类,那边连常识都缺。它不是脚注,它是这类系统学习方式的签名。
具体说,离真正的通用人工智能还差三块硬骨头:
可靠性。问题不是模型"不会",而是它会非常自信地错。这就是幻觉问题,机制我们单写了一篇AI 幻觉,短版是:一个预测下一个词的模型,天生没有"我不知道"这个挡位。一个 95% 正确、100% 自信的系统,你还不能把全新的开放式工作交给它。
长程规划。写一个函数、安排一次旅行,模型在行。但跑一个以月计的项目:定目标、拆任务、受挫后恢复、世界变了重新规划,这是另一种运动,智能体才刚开始尝试。
持续学习。今天的模型部署时就冻结了。它不会从你这次对话里学到什么,下个月也不记得,更不会自己更新自己。训练时是智能,推理时是雕像,定义之争里的那句批评,落到产品上就是这个体验。
这也解释了"像通用人工智能"和"是通用人工智能"的差距。一个能读截图、写代码、用你的口吻说话的多模态模型,演示里看起来很通用,底层仍是那个巨大的冻结函数。再惊艳归再惊艳,离研究者嘴里的"通用"还差着上面三块。
还要多久:给你一张表,不给一个日期
所有人都在问 AGI 的时间表。诚实的答案只能是一张表,因为分歧本身就是答案:
| 谁说的 | 说法 |
|---|---|
| Demis Hassabis(DeepMind CEO,2023) | 十年内,甚至几年 |
| 黄仁勋(NVIDIA CEO,2024) | 五年内 AI 通过任何人类测试 |
| Leopold Aschenbrenner(前 OpenAI,2024) | 2027 年"惊人地可信" |
| Sam Altman(OpenAI CEO,2025.12) | 已经"嗖一下过去了" |
| 研究者民调中位数(2012-2013) | 50% 信心在 2040-2050 年间 |
| 同批民调均值 | 2081 年 |
| 同批民调 | 16.5% 的专家回答"永远不会" |
| 近期调查汇总(2025) | 多数认为 2100 年前;当前中位约 2040 |
看出形状了吗:公司正在造 AGI 的人,扎堆说"几年";全职研究它的人,扎堆说 2040,还有一条实打实的尾巴说永不。2012 年一项针对 95 个预测的元分析还发现一件近乎喜剧的事:不管历史上的还是现代的预测,都偏向"从现在起 16 到 26 年"。随便哪一年去问,AGI 都还差 20 年。
这个领域被烫过两次。1970 年代初,出资方发现研究者严重低估了问题难度,把钱转去搞"应用 AI"。1980 年代日本第五代计算机计划承诺十年做出接近 AGI 的目标,最后随计划一起崩掉。二十年里预测错了两回之后,研究者干脆不预测了,他们受够了被叫"瞪大眼的梦想家"。今天 CEO 们那些笃定的几年之约,和 1980 年代听起来一模一样;今天民调里保守的中位数,是当年的疤在说话。
所以我的看法是:把通用人工智能当方向,别当日期。能力确实在按节奏复利增长,而"抵达的那一刻"会被永远争论下去,因为它是一个定义事件,不是一个物理事件。
常见问题快答
AGI是什么?一句话: 通用人工智能是假设中的、在几乎所有认知任务上达到或超过人类水平的 AI 系统,能跨领域迁移知识、解决没人专门教过的新问题。
AGI和AI的区别是什么? AI 是总称,包括所有专用系统(推荐、人脸识别、下棋引擎);通用人工智能是假设中的终点:一个系统通吃所有领域,而不是一件事做得特别好。
ChatGPT 算 AGI 吗? 按 DeepMind 的分级,ChatGPT 类模型是"入门级 AGI",大致相当于不熟练的人类在很多任务上的表现。按学习派的标准,它们部署后就停止学习,根本谈不上通用智能。两种说法都成立,"已有定论"不成立。
什么是AGI时代? OpenAI 总裁 2026 年说新模型开启了"AGI 时代",这是厂商的营销节点,不是学界共识。在定义都没统一的当下,"XX 时代"这类说法听个态度就行,别当时间戳。
AGI 多久能实现? 看你问谁:业界领袖说几年内,研究者民调中位约 2040 年,还有 16.5% 的受访专家说永远不会。谁要是给你一个笃定的具体日期,多半是想卖你点什么。
这篇只留一句话也行:别再问"到了没有",改问"第几级、哪条轴、谁打的分"。这个问题不会过时,不管球门再搬多少次。