今天聊聊RLHF、Agentic RL的差異,以及Agentic RL衍伸的問題!
RLHF 優化的是「一次性回答」,而Agentic RL 優化的是「一連串決策過程」。
| RLHF | Agentic RL | |
|---|---|---|
| 決策粒度 | 單輪、整段回答一次評分 | 多輪、每個動作(action)都可能被評分 |
| 環境 | 幾乎沒有真正的「環境」,回饋來自靜態偏好模型 | 有真實或模擬的環境,狀態會因行動改變 |
| 觀察性 | 全知(模型看得到完整 prompt) | 部分可觀察(環境資訊要靠工具查詢才能取得) |
| 動作空間 | 生成 token(文字) | 生成 token + 呼叫 API、執行程式碼、操作 GUI 等 |
| 獎勵來源 | 人類/AI 偏好排序(reward model) | 任務是否真的成功(可驗證獎勵,如測試通過、答案正確) |
當 RLHF 的獎勵只需要對「一次性的回答」打分時,功勞歸屬非常單純——分數要歸功那一整段回答本身。
但在Agent AI,模型需要在動態環境中執行長達數十、甚至上百輪的連續決策,原本單純的獎勵訊號就會遇上一個結構性的難題:軌跡拉長了,獎勵卻依然只在終點出現一次。 -> 模型不知道哪些動作實際上是對是錯。
如何在一段長軌跡中,把最終的成功或失敗,正確地「歸功」或「歸咎」到中間的每一個具體步驟?這就是信用分配問題(Credit Assignment Problem)!
此問題會以兩種型態出現:
1. 推理型 RL
需要把功勞分配到單一思維鏈生成過程中的每個 token 與步驟(約 500 到 3 萬個以上 token)
2. 代理式 RL
多輪的環境互動會帶來隨機的狀態轉移、部分可觀察性,以及超過 100 輪、對應 10 萬到 100 萬個 token 的長horizon,使得只看整個回合結果的信用分配訊號越來越沒有意義
與其在演算法層面費工夫「猜」哪一步該負責,不如從源頭讓獎勵訊號本身變得密集——每個中間步驟都直接給分數,不用猜
優點:直觀、實作簡單
缺點:需要針對每個任務類型手動設計檢查點,或額外訓練一個 PRM,成本較高,也可能引入 reward hacking 風險
明天會詳細說明RLVR 式的檢查點獎勵與過程獎勵模型~
補充 MDP 與 POMDP 的差異
在 LLM Agent 的領域,幾乎所有真實世界的任務都是 POMDP,而不是 MDP。