在前面的章節中,我們已經為強化學習的理論打下了基礎,也看過了 RLHF的標準流程。當正式跨入 Agentic RL 的領域時,對於我曾經有模型微調經驗的開發者,往往會帶著一種慣性思維:「我要怎麼從頭刻出一個最完美的 PPO 演算法?」、「該怎麼微調底層的Loss Function?」
但今天要踩個煞車,並確立本系列最重要的一個實戰心法:在 AI Agent 的訓練中,環境設計遠比演算法本身更重要。
讓我們先釐清一個觀念:不管是 PPO、DPO 還是最近熱門的 GRPO,它們在數學本質上都是強大的「優化器(Optimizer)」。它們的工作,是根據環境給出的回饋(Reward),找出最佳的策略(Policy)來最大化未來的預期收益。
優化器再強,也無法超越自己定義的「目標」。
這其實就像資料集中的標註陷阱 (Day8) :如果標註本身有偏差,模型就算學得再好,也只會更精準地學錯。放到 Agent RL 中也是一樣——如果狀態、動作或 Reward 設計得不好,Agent 可能不是真的在完成任務,而是在「鑽規則的漏洞」。
因此,RL 困難的地方,不只是選一個更強的演算法,而是要定義一個能正確引導 Agent 行為的環境與評估標準。
在 AI Agent 的場景中,建構一個好的「環境」,其實就是精心設計以下三個元素:
如果 Agent 解對了數學題給 +1 分,解錯給 -1 分,聽起來很合理對吧?但 如果它為了得到分數,學會了「不斷呼叫 Calculator 亂算一通直到剛好矇中」,這就是災難。我們需要設計的不僅僅是最終的 Outcome Reward,還有過程中的懲罰與引導。
在昨天有提到 Dense Reward 會有 reward hacking 的風險,明天會詳細探討 reward hacking 是什麼?