iT邦幫忙

2026 iThome 鐵人賽

DAY 11
1
AI Engineering

《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》系列 第 11

Day11 Agent RL 與傳統 RLHF 的本質差異及 Credit Assignment 難題

  • 分享至 

  • xImage
  •  

今天聊聊RLHF、Agentic RL的差異,以及Agentic RL衍伸的問題!

RLHF 優化的是「一次性回答」,而Agentic RL 優化的是「一連串決策過程」。

RLHF Agentic RL
決策粒度 單輪、整段回答一次評分 多輪、每個動作(action)都可能被評分
環境 幾乎沒有真正的「環境」,回饋來自靜態偏好模型 有真實或模擬的環境,狀態會因行動改變
觀察性 全知(模型看得到完整 prompt) 部分可觀察(環境資訊要靠工具查詢才能取得)
動作空間 生成 token(文字) 生成 token + 呼叫 API、執行程式碼、操作 GUI 等
獎勵來源 人類/AI 偏好排序(reward model) 任務是否真的成功(可驗證獎勵,如測試通過、答案正確)
  • RLHF 把 LLM 當作退化的單步 MDP 中運作——模型生成一個回答、拿到一個分數,訓練迴圈就結束了
  • Agentic RL 把 LLM 重新定義為嵌入在部分可觀察、時間跨度延伸的 POMDP 中的決策者,讓模型能連續行動、呼叫工具、觀察環境變化,再決定下一步。

這個「從單步到多步」的結構轉變,並非沒有代價

當 RLHF 的獎勵只需要對「一次性的回答」打分時,功勞歸屬非常單純——分數要歸功那一整段回答本身。

但在Agent AI,模型需要在動態環境中執行長達數十、甚至上百輪的連續決策,原本單純的獎勵訊號就會遇上一個結構性的難題:軌跡拉長了,獎勵卻依然只在終點出現一次。 -> 模型不知道哪些動作實際上是對是錯。

如何在一段長軌跡中,把最終的成功或失敗,正確地「歸功」或「歸咎」到中間的每一個具體步驟?這就是信用分配問題(Credit Assignment Problem)!


信用分配問題(Credit Assignment Problem)

模型跑了一長串動作,最後只拿到一個「成功/失敗」的分數——那到底是哪一步做對、哪一步做錯,根本沒人告訴它。

此問題會以兩種型態出現:
1. 推理型 RL
需要把功勞分配到單一思維鏈生成過程中的每個 token 與步驟(約 500 到 3 萬個以上 token)
2. 代理式 RL
多輪的環境互動會帶來隨機的狀態轉移、部分可觀察性,以及超過 100 輪、對應 10 萬到 100 萬個 token 的長horizon,使得只看整個回合結果的信用分配訊號越來越沒有意義

解法: 加密集獎勵(Dense Reward)

與其在演算法層面費工夫「猜」哪一步該負責,不如從源頭讓獎勵訊號本身變得密集——每個中間步驟都直接給分數,不用猜

  • RLVR 中間檢查點:每一步都各自給小獎勵,不用等到任務全部結束
  • 過程獎勵模型(Process Reward Model, PRM):訓練一個獨立模型,專門對「每一個中間步驟」打分,取代人工設計的規則式檢查點

優點:直觀、實作簡單
缺點:需要針對每個任務類型手動設計檢查點,或額外訓練一個 PRM,成本較高,也可能引入 reward hacking 風險


Takeaway

  • 信用分配問題(Credit Assignment Problem)的本質:稀疏、延遲的結果獎勵,無法告訴模型軌跡中「哪一步」該負責。
  • 在 Agent 的領域,幾乎所有真實世界的任務都是 POMDP
  • 加密集的中間獎勵(RLVR 式的檢查點獎勵、過程獎勵模型)

明天會詳細說明RLVR 式的檢查點獎勵與過程獎勵模型~


補充 MDP 與 POMDP 的差異

  • MDP(完全可觀察):就像下象棋。 Agent(玩家)隨時都能看見棋盤上所有棋子的確切位置。目前的狀態(State)是 100% 透明的。
  • POMDP(部分可觀察):就像打德州撲克。 Agent 只能看到自己的手牌和桌上的公牌(稱為 Observation, 觀察值),但看不見對手的手牌(隱藏的真實 State, 狀態)。Agent 必須在資訊不全的情況下做出決策(Action)。

在 LLM Agent 的領域,幾乎所有真實世界的任務都是 POMDP,而不是 MDP。


上一篇
Day10 DeepSeek 背後的演算法:GRPO 與 PPO 差異比較
下一篇
Day12 獎勵機制的抉擇:Outcome vs Process Reward Model 與可驗證獎勵
系列文
《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》16
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言