先來介紹MDP / State / Action/ Reward基本定義與用途~
MDP(Markov Decision Process,馬可夫決策過程)
| 名詞 | 定義 |
|---|---|
| State狀態 (S) | 環境「當下」的完整快照,決策所需的所有資訊都包含在裡面 |
| Action動作 (A) | Agent 在某個狀態下可以做的選擇 |
| Transition轉移機率(P) | 在某狀態做某動作後,會轉移到哪個新狀態的機率 |
| Reward獎勵 (R) | 做出動作後環境給的回饋分數,正代表好、負代表壞 |
我們來看看AI Agent與MDP的對應關係!
首先先來看看AI Agent怎麼學習?
| 名詞 | Agent task |
|---|---|
| State狀態 (S) | 目前的對話紀錄、當前的螢幕畫面 (Prompt/Context) |
| Action動作 (A) | 可做的動作,例如:呼叫某個工具、搜尋網頁 |
| Transition轉移機率 (P) | 當在『目前的狀態』下做了『某個動作』後,事情發展成『下一個特定狀態』的可能性有多大? |
| Reward獎勵 (R) | 量化「這一步做得好不好」 |
| Policy 策略(π) | LLM 本人,進行決策 |
AI 代理(Agent)或強化學習(RL)的決策與執行流程圖:
Day2 介紹了 RL 的基礎知識,明天會再深入了解 RL 相關知識!