iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》 系列

大型語言模型(LLM)近年快速演進成能自主決策、呼叫工具的 AI Agent,而強化學習(RL)正是讓 Agent 學會「做對的事」的核心技術。本系列將從最基礎的 MDP、Bellman Equation 出發,一路推進到 DQN、PPO、GRPO、DPO 等主流演算法,並實際手刻一個具備工具呼叫能力的 Agent 環境,最終透過 DPOTrainer 完成偏好資料的微調訓練。

30天內容涵蓋理論推導、演算法比較、實作環境建置、訓練除錯與量化評估(成功率、KL散度、reward曲線等),目標是打造一套可重現、有數據佐證的 Agent 強化學習訓練流程,適合想從理論扎實走向工程落地的讀者。

參賽天數 25 天 | 共 25 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文 |團隊黑色月亮
DAY 1

Day1 為什麼 Agent 需要 RL?——從 0 到 Agentic RL 實作的起點

什麼是 AI Agent? 從 ChatGPT Agent到 Claude Coworker,我們又更靠近一直以來對 AI 的幻想:只要告訴機器我們想做什麼,它...

2026-09-08 ‧ 由 ozymxt 分享
DAY 2

Day2 掌握 RL 基礎:什麼是 MDP ? Reward ? Policy 又是什麼 ?

介紹 MDP / State / Action/ Reward 基本定義 先來介紹MDP / State / Action/ Reward基本定義與用途~ MD...

2026-09-09 ‧ 由 ozymxt 分享
DAY 3

Day3 Value-based:為什麼 ChatGPT 不能直接用 Q-learning?

昨天最後補充如何算在某個state下有多好的數學理論公式,今天我們來討論如何使用到演算法中。 Valeu-based 是什麼? 決定 Agent 行為主要分為兩...

2026-09-10 ‧ 由 ozymxt 分享
DAY 4

Day4 Policy Gradient 演進:Actor-Critic 與 OpenAI 選擇 PPO 的關鍵

昨天提到除 Valeu-based,還有 Policy-Based。而 Policy-Based 的代表演算法是REINFORCE,我們來看看REINFORCE...

2026-09-11 ‧ 由 ozymxt 分享
DAY 5

Day5 避免模型崩潰的秘密:PPO Clip 機制與 KL Penalty 解析

昨天提到模型一次走太大步,會崩潰,那有沒有什麼方法可以避免呢?有的! 我們今天要介紹非常有名的PPO,但在這之前先介紹一下TRPO~ TRPO 是什麼? 他引入...

2026-09-12 ‧ 由 ozymxt 分享
DAY 6

Day6 邁向 LLM 時代:Clip 大小實驗與第一階段 RL 脈絡總結

今天會實際進行一個小型實驗來看看Clip大小如何影響訓練~ 實驗設計總覽 比較不同 Clip 大小對訓練穩定度與速度影響 自變數: clip_range 的大...

2026-09-13 ‧ 由 ozymxt 分享
DAY 7

Day7 拆解 RLHF 全流程:SFT、Reward Model 到 PPO 的 Pipeline

講 Reward Model 之前,我們先來聊聊RLHF流程,看看reward model用在哪裡? RLHF(Reinforcement Learning f...

2026-09-14 ‧ 由 ozymxt 分享
DAY 8

Day8 人工標註的陷阱:Reward Model 訓練實戰與資料品質探討

今天會詳細討論Preference Data 的品質問題所有「偏好標籤不可靠」的原因,可以分成兩大類: 第一大類:規格/設計層面的問題 就算標註員都很認真、很專...

2026-09-15 ‧ 由 ozymxt 分享
DAY 9

Day9 DPO vs PPO:為什麼 DPO 不需要 Reward Model 且更適合微調?

有了乾淨的偏好資料,我們今天來探討如何把這批資料變成真正能訓練模型的訊號? 先回顧傳統 RLHF(PPO 路線)在做什麼 詳細可以到 Day 5 看看 SFT...

2026-09-16 ‧ 由 ozymxt 分享
DAY 10

Day10 DeepSeek 背後的演算法:GRPO 與 PPO 差異比較

前面我們看到,DPO 將強化學習轉化為「二選一(Pairwise)」的偏好學習,只需判斷 y_1 與 y_2 哪個更好即可。然而,面對數學推理、程式碼生成等複雜...

2026-09-17 ‧ 由 ozymxt 分享