Agent 不是更聰明的 AI。它是三個主要零件的組合:大腦(LLM)、手腳(工具與權限)、迴圈(自己決定下一步)。強大來自零件,不來自智力;而每個零件,都對應一個躲不掉的管理決策。
從 2025 年進入所謂的「Agent 元年」開始,大家不只講 AI,還開始講 agent。上一篇看的是它跳了幾級,這一篇看的是它裝了什麼。Agent 到底是什麼?怎麼知道我的 AI 工具是不是 agent?最簡單的方式就是從零件來拆解:大腦、手腳、迴圈。
每個 agent 的核心都是一個大型語言模型(LLM)。關於這顆大腦,經營者要知道的是兩件事,而且都跟聰明不聰明無關。
第一,它是租來的。極少數公司會自己訓練模型;絕大多數 agent 的大腦,是向某幾家模型公司租的。按用量計費,會改版、會漲價、會退役,會卡住,一言不合還會突然下架。你的 agent 再怎麼客製,它的智力來源是別人的資產。
第二,它擁有通用知識,唯獨不知道你的公司。這顆大腦用公開資料訓練,像一位學識淵博的外包顧問:談產業趨勢頭頭是道,但你的公司結構、遠景策略、營運痛點,它一概不知。
只有大腦的 AI,做得到的只有一件事:給意見。長出手腳,指的是它能根據被授予的權限操作工具:串接其他功能、寄郵件、更新檔案、下訂單,甚至直接操作整台電腦。判斷有沒有手腳的方法:做完之後,改變有沒有發生。
舉個電商網站為例。同樣是客服機器人,能搜知識庫、調工具查詢訂單、回答問題的,都還只用到「說」的能力。但是當它能進一步幫你在訂單加上備註、變更收件地址或取消訂單時,就推進成「做」,因為異動發生了。
大腦加手腳,還不是 agent。交代一件事,它做一件事,做完就停,遇到問題就卡住,這是工具。讓它成為 agent 的,是第三個零件:迴圈。
迴圈的運作是:不再給單一動作指令,而是一個目標。它自己把目標拆成步驟、自己執行、自己檢查結果、自己決定下一步。想、做、看、再想,一圈一圈轉下去,不需要每步告訴它要做什麼。之前說的第三級的 AI「龍蝦」就是這一層。
開頭的那個問題,答案就在這裡:有沒有迴圈,決定眼前的東西是不是 agent。包著對話介面的問答機器人,沒有迴圈;照劇本跑的自動化流程,每一步都是人預先定義寫死的,也沒有迴圈。滿街的 agentic 產品,用這一條就能快速判斷。
迴圈也是這幾個零件裡唯一會自己花錢的。大腦按用量計費,而迴圈決定用量。之前提到的「龍蝦」,晚上你睡覺,它還在跑,盡責地用各種方式完成指定的目標,自然帳單就節節高升了。
三個零件湊齊,它已經是個會自己做事的 agent 了。但當你想把越來越多的事都交辦給它的時候,就會發現一個限制:它做的每一件事,都只活在當下,當工作結束時,過程發生的事全部卸載。所以記憶不是無中生有的第四個零件,它是為了要回答一個很簡單的問題:這一次學到的經驗,能不能留到下一次?
留不下來,它就是金魚腦:每次從零開始,昨天教過的今天重教。加上記憶,它記得你的公司背景、最新異動、上次犯過什麼錯,而且會越做越好。這就是新進員工和資深員工的那條分界。
🤿 深水區:Agent 的手腳和記憶
「手腳」在技術上不是模型長出來的,而是模型之外的能力。以單一目標流程走一次,看看每個環節怎麼使用手腳操作工具的:
- 你給目標、附上工具清單:你丟一個目標,順帶告訴模型「現在有哪些工具可用、每個長什麼樣」(這份工具說明書叫 schema)。
- 模型只決定、不動手 → function calling/tool use:模型讀完不自己執行,只吐一句結構化指令「呼叫 X 工具、參數 Y」。讓模型會這樣叫工具的整套機制,就是你常聽到的 function calling/tool use/tool calling。
- 真的動手的是工具串聯的外部系統 → orchestrator/agent runtime、MCP、RAG:將指令交給模型外的程式,去真的查 DB、打 API、跑程式。這個負責調度、真正執行的底座,就是 orchestrator 或 agent runtime。而 MCP 則是把五花八門的工具用同一種規格接起來(號稱「AI 界的 USB-C」)。如果是要「先翻公司內部文件、再把答案餵回模型」,那麼這個就是 RAG(Retrieval-Augmented Generation)。
- 結果餵回去、再問一次 → ReAct、autonomous/agentic:執行結果塞回給模型,模型檢查完要嘛再呼叫一個工具、要嘛回覆最終答案。這種「想一下、動一下、看結果、再想」的過程,就是 ReAct(Reasoning and Acting);一個會自己這樣轉到把事做完的系統,就是大家說的 autonomous/agentic(自主)agent。
- 人類和 AI 協作行為 → HITL、guardrails、multi-agent、hallucination:重要動作前插一道關卡,讓人審核或推進,叫 human-in-the-loop(HITL);限制它能碰哪些工具、能跑多遠,叫 guardrails(護欄);好幾個這種 agent 彼此呼叫分工,叫 multi-agent;它答不出來時自己編一個不存在的東西,就是 hallucination(幻覺)。
- 關於記憶:模型這一輪看得到的所有東西(你的話+工具結果)叫 context,用完就忘,這是它的短期記憶。想讓它跨對話記住,就把東西存起來、下次再撈回來塞進 context 給它參考。
導入 agent,聽起來像採購一套軟體。但拆開來看,大腦、手腳、迴圈、記憶,前三件決定它是不是 agent,第四件決定它會不會越做越好。你其實同時做了四個決定,而且沒有一個是純 IT 決定:
三個零件湊成一個 agent,卻牽出四個決定。這也是 agent 跟以往每一次軟體採購都不一樣的地方:以前買的是一個功能,現在管的是一個每個環節都會出事的系統。
哪些工作真的值得動用一整套 agent,哪些其實一顆大腦就夠,你需要的到底是 AI,還是 agent? 這一題留給第十天,你可以先帶著它觀察幾天。
一句話帶走:Agent 不是更聰明的 AI,是三個零件湊成的一套系統。
這幾個零件裡最難控制的是迴圈:一個會自己決定下一步的東西,我們該怎麼控制它?工程師其實已經跟這個問題纏鬥很久了,而那段歷史,剛好就是一部治理史。留待下回分解。