iT邦幫忙

2026 iThome 鐵人賽

DAY 5
0
自我挑戰組

AI Agent 從零開始系列 第 5

從 Chat Completion 到 Agent

  • 分享至 

  • xImage
  •  

Chat Completion(聊天補全) 演進到 Agent(AI 代理),代表了生成式 AI 從「被動問答」走向「自主執行與決傷」的核心範式轉移(Paradigm Shift)。

這段演進過程可以拆解為四個關鍵升級階段:


1. Chat Completion:單次輪詢的文字輸入與輸出

  • 核心機制:給定一段輸入 Prompt(包含 System, User, Assistant 訊息歷史),模型根據機率預測下一個 Token 並輸出回應。
  • 行為模式被動(Passive)與無狀態(Stateless)
  • 主要局限
  • 資訊時效性:僅能依賴模型訓練時的凍結知識庫(Cut-off Knowledge)。
  • 幻覺(Hallucination):對於複雜計算或精確事實易產生錯誤。
  • 無行動力:無法改變現實世界或外部系統狀態(例如無法幫你訂機票或發郵件)。

2. RAG 與 Function Calling:連結外部世界

為了解決 Chat Completion 的局限,AI 獲得了「眼睛」與「手腳」:

  • RAG(檢索增強生成):透過向量資料庫檢索實時或私有文件,讓模型獲取最新上下文。

  • Function Calling(函式呼叫 / Tool Use)

  • 模型不再只是輸出自然語言,還能輸出結構化的數據(如 JSON),聲明「我需要呼叫哪一個 API、傳送什麼參數」。

  • 應用程式執行該 API 後,將結果丟回給模型繼續總結。

  • 轉變點:模型從「純文字生成器」轉變成「決策路由(Decision Router)」。


3. Agent 的誕生:自主循環與環境互動

當模型具備了呼叫工具的能力,並搭配自主循環機制(如 ReAct 框架:Reasoning + Acting),AI 代理(Agent)便正式形成。

Agent 的核心公式通常包含四大要素:

$$\text{Agent} = \text{LLM(大模型大腦)} + \text{Memory(記憶)} + \text{Planning(規劃)} + \text{Tools(工具箱)}$$

Agent 的四大核心模組

  1. 大腦 / 決策中心(LLM):負責邏輯推理、評估當前狀態與選擇下一步動作。
  2. 規劃能力(Planning & Reasoning)
  • 目標拆解:將複雜的大任務(例如「幫我規劃一趟三天兩夜日本旅遊並訂好飯店」)拆解為多個子步驟。
  • 自我反思(Self-Reflection):執行失敗時能分析原因並重新嘗試。
  1. 記憶機制(Memory)
  • 短期記憶:當前任務的執行軌跡(Execution Logs / Context Window)。
  • 長期記憶:跨對話的偏好儲存或透過向量庫累積經驗。
  1. 工具執行(Tools / Actions):呼叫 API、執行 Python 代碼、搜尋網頁、讀寫資料庫等。

4. Chat Completion vs. Agent 核心對比

維度 Chat Completion (對話補全) AI Agent (代理人)
互動模式 單回合/多回合「一問一答」 目導向的「自主多步驟執行」
主動性 被動觸發,使用者給指令才回應 主動思考、自我修正、直到目標達成
控制流 應用程式/使用者控制流程 模型自主決定思考與行動流程(Loop)
工具使用 無,或僅單次呼叫 動態鏈式呼叫(Chain of Tools)
失敗處理 直接輸出錯的答案 捕獲 Error 訊息,自我修正後重新執行

演進的本質:從「回答問題」到「完成任務」

  • Chat Completion 時代,AI 扮演的是「知識百科全書/文字秘書」;
  • Agent 時代,AI 演變為「自主數位員工(Digital Worker)」——你給予它一個最終目標,它自己思考步驟、呼叫相應工具、處理中途異常,最後交付完整結果。

上一篇
LLM 究竟能做什麼?不能做什麼?
系列文
AI Agent 從零開始5
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言