AI智能体是什么?一个问题验出真假

问十个人什么是AI智能体,大概会得到三种答案。厂商把聊天机器人也包装成智能体,研究者专指自主系统,工程团队则把它当个筐,部署了什么都往里装。LangChain 跑了四年生产级智能体,说得直接:这个定义取决于你问谁。

但定义之争底下有一个所有说法共享的硬核。AI智能体就是建立在大型语言模型上、由模型自己决定下一步的系统。不是决定一次,而是一路决定下去,直到目标完成。LangChain 的工程表述:用 LLM 决定应用控制流的系统。Anthropic 的版本:由 LLM 动态指挥自身流程和工具使用的系统。剥掉术语,其实就是一个问题:下一步谁说了算——你的代码,还是模型?

这篇文章把定义讲清、把智能体的运转循环拆开看,并且(多数科普文跳过的部分)讲讲什么时候你根本用不上智能体,以及它真实要花多少成本。

会聊还是会干:聊天机器人止步的地方

IBM 给的定义是:AI智能体是能自主执行任务的系统,它会用可用的工具自己设计工作流。聊天机器人则是对提示词做回应:回答、总结、起草,然后停在那里等下一条。

有一个问题能戳穿所有产品演示:这个 AI 是真能把活干了,还是只能聊聊这个活?

Cloudflare 有个最日常的对比例子。你让大模型"帮我写一封邀请邮件,请公司前十大客户参加晚宴",它给你一封邮件,写得还不错。你让智能体"邀请公司前十大客户来参加晚宴",它会去 CRM 里查出这前十位是谁,给每人写一封个性化的邀请,然后发出去(前提是你给了它这些权限)。前者给你的是作业,后者交给你的是办完的事。

维度聊天机器人AI智能体
主要行为回应消息一步步追着目标跑
典型产出答案、摘要、草稿完成的动作
自主性低,每条提示都要等高,在边界内自己规划推进
上下文聊天记录、粘贴的文本任务状态、工具结果、产品数据
工具可选或很窄执行的核心

中文社区有个流行说法:智能体是给大模型装上了"手"和"眼"。模型一直是大脑,智能体是让它能对世界下手的身体。

一轮循环里发生了什么

让大模型智能体成为智能体的不是什么特别的模型,是一个循环。LLM 在圈里跑:读当前状态→选一个动作→调用工具→观察结果→更新记忆→决定继续还是收手。

设想一个研究型请求:"总结这个季度客户投诉最多的前几个问题"。循环的一轮可能是这样:智能体读了请求,判断需要工单数据库,查了一下,拿回 400 条工单,发现一次总结不完,分成批,逐批总结,合并,再对照原始数量抽查合并质量,最后写出报告。这条路径没有人预先写死,每一步都是模型看着上一步的结果选的。

任何智能体里都有四个组件:

  • 模型:决定下一步动作的 LLM。推理能力和工具调用能力比参数量更要紧
  • 工具:API、数据库、代码执行、检索,甚至其他智能体。智能体靠这些动手
  • 记忆:跨轮次留存的上下文:对话历史、长期状态。这里的物理上限就是模型的上下文窗口,我们单独写过一篇讲透
  • 循环:把上面三者串起来的推理周期。想一下、动一下、看一眼,循环到做完

注意工具清单里有"检索"。一条建得好的检索管线,往往是智能体瞎忙和干完活之间的分水岭。检索的机制我们放在RAG 详解里拆过了。

自主是光谱,不是开关

没人会问 Level 2 辅助驾驶"算不算真的自动驾驶"——汽车行业定了分级,工程师只讨论自己在交付哪一级。AI 还没有这种共识,所以"这算不算真的智能体"能吵到天荒地老。

有用的做法是停止争吵,把系统放到光谱上:一端是手写逻辑,往右是一次 LLM 调用、链、路由器、状态机,最右端才是全自主智能体:自己挑工具、记住自己造过什么。你交给模型的控制越多,围绕它的基建就要越厚:可观测、评测、权限、安全执行。

实际中最好用的分界线是工作流和智能体之别。工作流靠代码写死的路径编排模型和工具;智能体让模型在运行时自己决定路径。Anthropic 把两者统称"智能体式系统",区分只看一个问题:控制流有多少写死在代码里,有多少交给模型运行时决定。

两种误用的代价都是真的。工作流就够用的时候硬上智能体,你买到的是不需要的不确定性——同样的输入,两次运行两个样。真需要智能体的时候只肯写工作流,你的硬编码路径在输入第一次变形时就会断。多数生产系统是混着来的:步骤清楚的用确定性代码,输入脏乱的地方交给模型判断。

什么时候你其实用不上AI智能体

每篇科普都讲智能体能干什么,几乎没人讲反面。这里补上,LangChain 在生产里趟出来的建议,我压缩了一下:

  1. 从单个智能体和好提示词起步。一个提示词写好的 LLM 配上几个工具,能解决的真实问题比例大得惊人
  2. 先加工具,再加智能体。智能体缺什么能力就给它什么工具。一个工具比把推理拆到多个智能体便宜得多,也好调试得多
  3. 撞到明确上限才上多智能体。上下文装不下、能力蔓延失控、团队边界。这三种情况才值得上子智能体和路由。在那之前,单智能体就是正确答案
  4. 检索优先于推理。在多数知识任务上,一条好的检索管线胜过一个平庸的智能体。(如果你的问题是"模型不知道 X",你要的是 RAG,不是智能体)
  5. 别外包你自己评估不了的判断。你要是认不出正确答案,你的智能体也认不出——你只是把盲目信任自动化了

我自己看过不少团队上智能体之后补一条:如果你说不出哪一步必须由模型来选,你就没有智能体场景。你有一个工作流,而工作流没什么不好。

真实成本:80% 的脏活

有一个数字不会出现在产品发布会里。MIT 研究者给癌症病人部署了一个从临床记录里检测不良事件的AI智能体,最大的挑战不是提示词工程,也不是模型微调。这篇 2025 年的论文发现,80% 的工作被数据工程、干系人对齐、治理和工作流集成吃掉了,全是不好看的部分。

同一篇 MIT 文章还戳破了 ROI 算法。"智能体替某人省下 20% 的时间,不等于省下 20% 的人力成本。"省下来的时间只有被别的事情接住,才会变成钱。

失效形态也很具体,不是科幻片那种:

  • 死循环。不会反思的智能体会反复调同一个工具,永不停止。IBM 的对策很直白:把可中断做进去
  • 连坐。架在同一个基座模型上的多个智能体共享同一批盲区——一个缺陷可能掀翻整条链
  • 权限和问责。要干活的智能体需要权限,权限需要审计日志;高风险动作(群发邮件、金融交易)必须人工签字。一个基于错误数据拒掉房贷申请的智能体,伤害比一段幻觉文案大得多

这些不是说AI智能体不值得。摩根大通用它做欺诈检测和贷款审批流程,沃尔玛用它做个人购物和商品规划,IBM 体系上一个法律研究助手把合同审查从 90 分钟压到 45 分钟,办法是让便宜的分类模型先接简单查询。这些说的是:预算里应该留出那无聊的 80%。

普通人怎么上手AI智能体

如果你是个人或者小团队,入口比营销画的小得多:

  • 先用再建。主流聊天产品已经内置智能体功能——深度研究、任务执行、代码助手都是;各类AI智能体平台也把入口做成了对话框。把真实工作扔进去跑一个月,记下哪里真的帮上忙
  • 一个智能体,几个工具。真要自己搭,忍住画多智能体组织图的冲动。一个配了三个好工具的智能体,胜过五个工具互相重叠的智能体委员会
  • 看循环,别看演示。演示给你看的是顺利路径。让它干要紧的事之前,先要求看 trace,智能体走过的完整步骤清单

常见问题快答

AI智能体一句话是什么? 建立在大型语言模型上、由模型自己决定下一步的系统:在循环里挑工具、选动作,直到目标完成,而不是只会回复提示词。你要问什么是AI智能体,记住这条判据就够了。

AI智能体和聊天机器人的区别是什么? 聊天机器人回应消息,智能体追逐目标。聊天机器人把邮件写好,智能体把客户找出来、逐个个性化、发出去。检验法就一条:下一步由谁决定。

agentic AI 和 AI agent 有什么区别? AI agent 指单个软件程序;agentic AI 是更宽的概念,常指多个智能体编排协作的系统。多数人混用,这没什么问题——除非你要架构一个。

普通人怎么用上AI智能体? 从你已经在用的聊天工具开始——深度研究、定时任务、代码助手现在都是智能体。只有碰到一个你能精确描述的重复多步任务时,再考虑自己搭。

AI智能体现在靠谱吗? 窄而监控到位的任务上靠谱,90 分钟变 45 分钟的战绩都来自这类场景。开放式工作上,按 80% 规则预期:你的精力大头会花在数据管道和护栏上,不是智能上。

下次有人给你演示"AI智能体",只问一个问题:下一步是谁决定的?答案如果是"模型,反复地,带着工具",这是智能体。如果是"代码,模型只是填空"——那是穿了智能体马甲的工作流。两种都有用。分清你眼前是哪种,你才不会为工作流的结果付智能体的钱。