AI智慧代理人?別被名詞繞暈,一個問題驗真假
問十個人什麼是AI智慧代理人,大概會得到三種答案。廠商把聊天機器人也包裝成代理人,研究者專指自主系統,工程團隊則把它當個筐,部署了什麼都往裡裝。LangChain 跑了四年生產級代理人,說得很直接:這個定義取決於你問誰。
但定義之爭底下有一個所有說法共享的硬核。AI智慧代理人就是建立在大型語言模型上、由模型自己決定下一步的系統。不是決定一次,而是一路決定下去,直到目標完成。LangChain 的工程表述:用 LLM 決定應用控制流的系統。Anthropic 的版本:由 LLM 動態指揮自身流程和工具使用的系統。剝掉術語,其實就是一個問題:下一步誰說了算——你的程式碼,還是模型?
這篇文章把定義講清、把代理人的運轉循環拆開看,並且(多數科普文跳過的部分)講講什麼時候你根本用不上代理人,以及它真實要花多少成本。
「智慧代理人」是台灣比較常見的譯法,中國大陸多寫「智能体」,英文都是 AI Agent。本文兩種說法混用,指同一個東西。
會聊還是會幹:聊天機器人止步的地方
IBM 給的定義是:AI代理人是能自主執行任務的系統,它會用可用的工具自己設計工作流。聊天機器人則是對提示詞做回應:回答、摘要、起草,然後停在那裡等下一條。
有一個問題能戳穿所有產品演示:這個 AI 是真能把活幹了,還是只能聊聊這個活?
Cloudflare 有個最日常的對比例子。你讓大模型「幫我寫一封邀請信,請公司前十大客戶參加晚宴」,它給你一封信,寫得還不錯。你讓代理人「邀請公司前十大客戶來參加晚宴」,它會去 CRM 裡查出這前十位是誰,給每人寫一封個人化的邀請,然後寄出去(前提是你給了它這些權限)。前者給你的是作業,後者交給你的是辦完的事。
| 維度 | 聊天機器人 | AI代理人 |
|---|---|---|
| 主要行為 | 回應訊息 | 一步步追著目標跑 |
| 典型產出 | 答案、摘要、草稿 | 完成的動作 |
| 自主性 | 低,每條提示都要等 | 高,在邊界內自己規劃推進 |
| 上下文 | 聊天記錄、貼上的文字 | 任務狀態、工具結果、產品資料 |
| 工具 | 可選或很窄 | 執行的核心 |
中文社群有個流行說法:代理人是給大模型裝上了「手」和「眼」。模型一直是大腦,代理人是讓它能對世界下手的身體。
一輪循環裡發生了什麼
讓大模型智慧代理成為代理的,不是什麼特別的模型,是一個循環。LLM 在圈裡跑:讀當前狀態→選一個動作→呼叫工具→觀察結果→更新記憶→決定繼續還是收手。
設想一個研究型請求:「統計這一季客訴最多的前幾個問題」。循環的一輪可能是這樣:代理人讀了請求,判斷需要工單資料庫,查了一下,拿回 400 筆工單,發現一次總結不完,分成批,逐批摘要,合併,再對照原始數量抽查合併品質,最後寫出報告。這條路徑沒有人預先寫死,每一步都是模型看著上一步的結果選的。
任何代理人裡都有四個組件:
- 模型:決定下一步動作的 LLM。推理能力和工具呼叫能力比參數量更要緊
- 工具:API、資料庫、程式碼執行、檢索,甚至其他代理人。代理人靠這些動手
- 記憶:跨輪次留存的上下文:對話歷史、長期狀態。這裡的物理上限就是模型的上下文視窗,我們單獨寫過一篇講透
- 循環:把上面三者串起來的推理週期。想一下、動一下、看一眼,循環到做完
注意工具清單裡有「檢索」。一條建得好的檢索管線,往往是代理人瞎忙和幹完活之間的分水嶺。檢索的機制我們放在RAG 詳解裡拆過了。
自主是光譜,不是開關
沒人會問 Level 2 輔助駕駛「算不算真的自動駕駛」——汽車行業定了分級,工程師只討論自己在交付哪一級。AI 還沒有這種共識,所以「這算不算真的代理人」能吵到天荒地老。
有用的做法是停止爭吵,把系統放到光譜上:一端是手寫邏輯,往右是一次 LLM 呼叫、鏈、路由器、狀態機,最右端才是全自主代理人:自己挑工具、記住自己造過什麼。你交給模型的控制越多,圍繞它的基建就要越厚:可觀測、評測、權限、安全執行。
實務中最好用的分界線是工作流和代理人之別。工作流靠程式碼寫死的路徑編排模型和工具;代理人讓模型在執行時自己決定路徑。Anthropic 把兩者統稱「代理式系統」,區分只看一個問題:控制流有多少寫死在程式碼裡,有多少交給模型執行時決定。
兩種誤用的代價都是真的。工作流就夠用的時候硬上代理人,你買到的是不需要的不確定性——同樣的輸入,兩次執行兩個樣。真需要代理人的時候只肯寫工作流,你的硬編碼路徑在輸入第一次變形時就會斷。多數生產系統是混著來的:步驟清楚的用確定性程式碼,輸入髒亂的地方交給模型判斷。
什麼時候你其實用不上AI智慧代理人
每篇科普都講代理能幹什麼,幾乎沒人講反面。這裡補上,LangChain 在生產裡趟出來的建議,我壓縮了一下:
- 從單一代理人和好提示詞起步。一個提示詞寫好的 LLM 配上幾個工具,能解決的真實問題比例大得驚人
- 先加工具,再加代理人。代理人缺什麼能力就給它什麼工具。一個工具比把推理拆到多個代理人便宜得多,也好除錯得多
- 撞到明確上限才上多代理人。上下文裝不下、能力蔓延失控、團隊邊界。這三種情況才值得上子代理和路由。在那之前,單代理人就是正確答案
- 檢索優先於推理。在多數知識任務上,一條好的檢索管線勝過一個平庸的代理人。(如果你的問題是「模型不知道 X」,你要的是 RAG,不是代理人)
- 別外包你自己評估不了的判斷。你要是認不出正確答案,你的代理也認不出——你只是把盲目信任自動化了
我自己看過不少團隊上代理之後補一條:如果你說不出哪一步必須由模型來選,你就沒有代理場景。你有一個工作流,而工作流沒什麼不好。
真實成本:80% 的髒活
有一個數字不會出現在產品發表會裡。MIT 研究者給癌症病人部署了一個從臨床記錄裡偵測不良事件的AI智慧代理人,最大的挑戰不是提示詞工程,也不是模型微調。這篇 2025 年的論文發現,80% 的工作被資料工程、利害關係人對齊、治理和工作流整合吃掉了,全是不好看的部分。
同一篇 MIT 文章還戳破了 ROI 算法。「代理人替某人省下 20% 的時間,不等於省下 20% 的人力成本。」省下來的時間只有被別的事情接住,才會變成錢。
失效形態也很具體,不是科幻片那種:
- 無限循環。不會反思的代理人會反覆呼叫同一個工具,永不停止。IBM 的對策很直白:把可中斷做進去
- 連坐。架在同一個基座模型上的多個代理共享同一批盲區,一個缺陷可能掀翻整條鏈
- 權限和問責。要幹活的代理人需要權限,權限需要稽核日誌;高風險動作(群發信件、金融交易)必須人工簽核。一個基於錯誤資料否決房貸申請的代理人,傷害比一段幻覺文案大得多
這些不是說AI智慧代理人不值得。摩根大通用它做詐欺偵測和貸款核准流程,沃爾瑪用它做個人購物和商品規劃,IBM 體系上一個法律研究助理把合約審查從 90 分鐘壓到 45 分鐘,辦法是讓便宜的分類模型先接簡單查詢。這些是說:預算裡應該留出那無聊的 80%。
普通人怎麼上手AI智慧代理人
如果你是個人或者小團隊,入口比行銷畫的小得多:
- 先用再建。主流聊天產品已經內建代理功能:深度研究、任務執行、程式碼助理都是;各類AI智慧代理人平台也把入口做成了對話框。把真實工作丟進去跑一個月,記下哪裡真的幫上忙
- 一個代理人,幾個工具。真要自己搭,忍住畫多代理組織圖的衝動。一個配了三個好工具的代理人,勝過五個工具互相重疊的代理人委員會
- 看循環,別看演示。演示給你看的是順利路徑。讓它幹要緊的事之前,先要求看 trace,代理走過的完整步驟清單
常見問題快答
AI智慧代理人一句話是什麼? 建立在大型語言模型上、由模型自己決定下一步的系統:在循環裡挑工具、選動作,直到目標完成,而不是只會回覆提示詞。你要問什麼是AI智慧代理人,記住這條判據就夠了。
AI智慧代理人和聊天機器人的差別是什麼? 聊天機器人回應訊息,代理人追逐目標。聊天機器人把信寫好,代理人把客戶找出來、逐一個人化、寄出去。檢驗法就一條:下一步由誰決定。
agentic AI 和 AI agent 有什麼差別? AI agent 指單一軟體程式;agentic AI 是更寬的概念,常指多個代理編排協作的系統。多數人混用,這沒什麼問題——除非你要架構一個。
普通人怎麼用上AI智慧代理人? 從你已經在用的聊天工具開始——深度研究、排程任務、程式碼助理現在都是代理。只有碰到一個你能精確描述的重複多步任務時,再考慮自己搭。
AI智慧代理人現在靠譜嗎? 窄而監控到位的任務上靠譜,90 分鐘變 45 分鐘的戰績都來自這類場景。開放式工作上,按 80% 法則預期:你的精力大頭會花在資料管道和護欄上,不是智能上。
下次有人給你演示「AI智慧代理人」,只問一個問題:下一步是誰決定的?答案如果是「模型,反覆地,帶著工具」,這是代理人。如果是「程式碼,模型只是填空」,那是穿了代理人馬甲的工作流。兩種都有用。分清你眼前是哪種,你才不會為工作流的結果付代理人的錢。