iT邦幫忙

2026 iThome 鐵人賽

DAY 6
0
AI Engineering

《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》系列 第 6

Day6 邁向 LLM 時代:Clip 大小實驗與第一階段 RL 脈絡總結

  • 分享至 

  • xImage
  •  

今天會實際進行一個小型實驗來看看Clip大小如何影響訓練~

實驗設計總覽

比較不同 Clip 大小對訓練穩定度與速度影響

  • 自變數: clip_range 的大小。我們設定三組:
    • 0.05
    • 0.2
    • 0.8
  • 應變數: 學習曲線 (Learning Curve),也就是訓練過程中獲得的平均獎勵 (Reward)
  • 環境: CartPole-v1

實驗結果分析

https://ithelp.ithome.com.tw/upload/images/20260912/20183658qMPxQTBsII.png

  1. Clip = 0.2 (綠線):這條線通常會最平穩且最快達到滿分 (500 分)。這是因為 0.2 允許模型有足夠的進步空間,又不會因為更新太大而把學到的好策略搞壞。
  2. Clip = 0.05 (藍線):學習速度會明顯偏慢。因為即使它發現了一個很好的新策略,Clip 機制也會強迫它只能「一小步一小步」地更新,導致需要更多的 timestep 才能收斂。
  3. Clip = 0.8 (紅線):這條線通常會劇烈震盪,甚至有時候分數會突然掉到底谷。這是因為缺乏限制,模型在更新時容易「走過頭」(Overshooting),把原本已經能平衡桿子的策略給破壞掉,導致訓練極度不穩定。

Clip是 PPO 演算法的「安全煞車系統」。設定得剛剛好,能保證 AI 穩健進步;設得太小會讓 AI 學習如龜速;設得太大則會導致 AI 走火入魔、忘掉學過的技能。建議使用0.2作為預設值

  • 0.05 (太小):步伐被極度限制
  • 0.2 (標準值):論文建議的最佳平衡點
  • 0.8 (太大):幾乎不限制,步伐太大

這幾天我們看了 RL 實際的運作方式。但如果把視野拉遠,會發現 RL 的應用早已不只是在遊戲中「拿高分」,而是逐漸進入語言模型與自主 Agent 的世界。


從經典 RL 到 LLM 時代:RL → RLHF → Agent RL 的進化脈絡

從早期的西洋棋、圍棋,到如今能寫詩、寫程式的大型語言模型(LLM),甚至未來能自主操作電腦的 AI 代理(Agent),背後都離不開 RL 的影子。接下來,我們將沿著這條演進脈絡,從經典 RL、RLHF 一路看到 Agent RL,了解強化學習如何讓 AI 從「在遊戲中學會做決策」,逐步走向「理解人類需求」,最後具備「自主完成任務」的能力。

1. 經典 RL:在試錯中尋找最佳策略(Trial and Error)

強化學習透過 Reward,讓 Agent 在 Environment 中不斷試錯,逐步學會最佳行動

  • 高光時刻: AlphaGo 擊敗李世乭、OpenAI Five 戰勝《Dota 2》頂尖戰隊,展現 RL 在規則明確的環境中的強大能力。
  • 面臨瓶頸: 遊戲中的勝負容易量化,但面對「寫得是否禮貌」、「故事是否有趣」等人類語言與價值觀,獎勵很難用數學公式定義。

2. RLHF:讓語言模型「對齊」人類價值觀

為了解決語言任務中「獎勵難以定義」的問題,RLHF(Reinforcement Learning from Human Feedback)透過人類偏好來建立可學習的獎勵信號。

  • 運作邏輯:
    1. 收集人類偏好: 人類比較 AI 產生的多個回答
    2. 訓練 Reward Model: 學習人類偏好,為回答打分
    3. PPO 優化: LLM 根據 Reward Model 的分數持續改善生成結果
  • 將主觀的「人類偏好」轉化為可優化的數學信號,讓 LLM 從單純的文本生成器,進一步成為更能理解指令、符合人類期待的 AI 助手。

3. Agent RL

當 LLM 不再只需要「說話」,而是進一步「做事」,Agent 時代便隨之而來。Agent RL 將 LLM 作為「大腦」,讓它能在網頁、軟體甚至機器人等環境中自主行動。

  • 互動模式:
    • State: 網頁、終端機訊息、視覺畫面
    • Action: 點擊、輸入程式碼、呼叫 API
    • Reward: 任務是否成功完成
  • 為何需要 RL? 面對複雜的長線任務,Agent 容易迷失或陷入死胡同。RL 能讓 Agent 從環境互動中學習,進一步提升決策、錯誤修正與工具使用能力。
  • 未來展望: Agent RL 將 AI 從「被動問答」推向「主動完成任務」的生產力工具。

Takeaway

  • 通常clip_range 的大小會預設 0.2
  • 從經典 RL 在遊戲中的完美運算,到 RLHF 成功將語言模型與人類價值觀對齊,再到如今 Agent RL 賦予大模型在複雜環境中自主行動的能力

明天主題預告: Reward Model ~


上一篇
Day5 避免模型崩潰的秘密:PPO Clip 機制與 KL Penalty 解析
下一篇
Day7 拆解 RLHF 全流程:SFT、Reward Model 到 PPO 的 Pipeline
系列文
《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》16
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言