好,經由昨天的練習,應該有初步了解甚麼是大語言模型。
那甚麼是AI Agent呢?是更強的模型嗎?
不是的,LLM是AI Agent的大腦,可以實現最小工程的一個簡潔公式:
AI Agent = LLM + 上下文(context window) + 工具(tools)
之前有稍微提到"環境"這個概念,在這邊不必把它含括進來。先稍微講解這3個名詞在AI Agent的定義以及用處
LLM = AI Agent的大腦,負責Agent的整個決策,去理解意圖、思考規劃、做判斷等...。這些能力主要是來自兩部分。預訓練讓模型累積世界知識與語言能力。後訓練則是決策策略分析。
上下文(context window) = Agent的眼睛。不只是輸入給模型的prompt,而是Agent在每個決策收到並保留的信息。這些來自環境的觀察、用戶記憶、領域的知識、自身狀態以及任務進度。
工具(tools) = Agent的手腳。這裡的工具是指Agent用來感知或改變外部世界的接口,包含工具定義、調用協調與適配器(這邊比較技術)。簡單來說LLM判斷出需要用何種工具之後從這邊做操作,所以說LLM不會直接參與工具的使用,是給出指令(像老闆)。
另一種更直觀的說法是:Agent = 大腦 + 眼睛 + 手腳。大腦負責思考和决策,眼睛接收環境提供的觀察,手脚將决策轉化為作用於環境的行動。
也可以把"上下文"與"工具",包裝成Harness(馬鞍,這邊代指外部工程)。
透過昨天的練習與今天的講解,應該可以知道LLM與AI Agent的差異了吧?