從 Chat Completion(聊天補全) 演進到 Agent(AI 代理),代表了生成式 AI 從「被動問答」走向「自主執行與決傷」的核心範式轉移(Paradigm Shift)。
這段演進過程可以拆解為四個關鍵升級階段:
1. Chat Completion:單次輪詢的文字輸入與輸出
-
核心機制:給定一段輸入 Prompt(包含 System, User, Assistant 訊息歷史),模型根據機率預測下一個 Token 並輸出回應。
-
行為模式:被動(Passive)與無狀態(Stateless)。
-
主要局限:
-
資訊時效性:僅能依賴模型訓練時的凍結知識庫(Cut-off Knowledge)。
-
幻覺(Hallucination):對於複雜計算或精確事實易產生錯誤。
-
無行動力:無法改變現實世界或外部系統狀態(例如無法幫你訂機票或發郵件)。
2. RAG 與 Function Calling:連結外部世界
為了解決 Chat Completion 的局限,AI 獲得了「眼睛」與「手腳」:
-
RAG(檢索增強生成):透過向量資料庫檢索實時或私有文件,讓模型獲取最新上下文。
-
Function Calling(函式呼叫 / Tool Use):
-
模型不再只是輸出自然語言,還能輸出結構化的數據(如 JSON),聲明「我需要呼叫哪一個 API、傳送什麼參數」。
-
應用程式執行該 API 後,將結果丟回給模型繼續總結。
-
轉變點:模型從「純文字生成器」轉變成「決策路由(Decision Router)」。
3. Agent 的誕生:自主循環與環境互動
當模型具備了呼叫工具的能力,並搭配自主循環機制(如 ReAct 框架:Reasoning + Acting),AI 代理(Agent)便正式形成。
Agent 的核心公式通常包含四大要素:
$$\text{Agent} = \text{LLM(大模型大腦)} + \text{Memory(記憶)} + \text{Planning(規劃)} + \text{Tools(工具箱)}$$
Agent 的四大核心模組
-
大腦 / 決策中心(LLM):負責邏輯推理、評估當前狀態與選擇下一步動作。
-
規劃能力(Planning & Reasoning):
-
目標拆解:將複雜的大任務(例如「幫我規劃一趟三天兩夜日本旅遊並訂好飯店」)拆解為多個子步驟。
-
自我反思(Self-Reflection):執行失敗時能分析原因並重新嘗試。
-
記憶機制(Memory):
-
短期記憶:當前任務的執行軌跡(Execution Logs / Context Window)。
-
長期記憶:跨對話的偏好儲存或透過向量庫累積經驗。
-
工具執行(Tools / Actions):呼叫 API、執行 Python 代碼、搜尋網頁、讀寫資料庫等。
4. Chat Completion vs. Agent 核心對比
| 維度 |
Chat Completion (對話補全) |
AI Agent (代理人) |
| 互動模式 |
單回合/多回合「一問一答」 |
目導向的「自主多步驟執行」 |
| 主動性 |
被動觸發,使用者給指令才回應 |
主動思考、自我修正、直到目標達成 |
| 控制流 |
應用程式/使用者控制流程 |
模型自主決定思考與行動流程(Loop) |
| 工具使用 |
無,或僅單次呼叫 |
動態鏈式呼叫(Chain of Tools) |
| 失敗處理 |
直接輸出錯的答案 |
捕獲 Error 訊息,自我修正後重新執行 |
演進的本質:從「回答問題」到「完成任務」
-
Chat Completion 時代,AI 扮演的是「知識百科全書/文字秘書」;
-
Agent 時代,AI 演變為「自主數位員工(Digital Worker)」——你給予它一個最終目標,它自己思考步驟、呼叫相應工具、處理中途異常,最後交付完整結果。