iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》 系列

大型語言模型(LLM)近年快速演進成能自主決策、呼叫工具的 AI Agent,而強化學習(RL)正是讓 Agent 學會「做對的事」的核心技術。本系列將從最基礎的 MDP、Bellman Equation 出發,一路推進到 DQN、PPO、GRPO、DPO 等主流演算法,並實際手刻一個具備工具呼叫能力的 Agent 環境,最終透過 DPOTrainer 完成偏好資料的微調訓練。

30天內容涵蓋理論推導、演算法比較、實作環境建置、訓練除錯與量化評估(成功率、KL散度、reward曲線等),目標是打造一套可重現、有數據佐證的 Agent 強化學習訓練流程,適合想從理論扎實走向工程落地的讀者。

參賽天數 25 天 | 共 25 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文 |團隊黑色月亮
DAY 11

Day11 Agent RL 與傳統 RLHF 的本質差異及 Credit Assignment 難題

今天聊聊RLHF、Agentic RL的差異,以及Agentic RL衍伸的問題! RLHF 優化的是「一次性回答」,而Agentic RL 優化的是「一連串決...

2026-09-18 ‧ 由 ozymxt 分享
DAY 12

Day12 獎勵機制的抉擇:Outcome vs Process Reward Model 與可驗證獎勵

昨天提到關於Credit Assignment的解法有Process Reward Model跟RLVR,今天我們先來聊聊Process Reward Mode...

2026-09-19 ‧ 由 ozymxt 分享
DAY 13

Day13 成功的一半:為什麼對 Agent 來說「環境設計」比演算法更重要?

在前面的章節中,我們已經為強化學習的理論打下了基礎,也看過了 RLHF的標準流程。當正式跨入 Agentic RL 的領域時,對於我曾經有模型微調經驗的開發者,...

2026-09-20 ‧ 由 ozymxt 分享
DAY 14

Day14 當 Agent 開始作弊:故意設計錯誤 Reward 誘發 Reward Hacking

今天我們來聊聊 Reward Hacking ~ Reward Hacking AI 找到了一個我們設計獎勵時沒想到的漏洞,透過作弊或走捷徑的方式刷了超高分,但...

2026-09-21 ‧ 由 ozymxt 分享
DAY 15

Day15 自我進化的開端:Self-play 迴圈與 Multi-Agent 協作入門

今天要聊的是Self-play / Self-improvement Loop,監督式學習(Supervised Learning)依靠人類給的資料學習,而人類...

2026-09-22 ‧ 由 ozymxt 分享
DAY 16

Day16 打造 Agent 競技場:手刻工具呼叫環境與評估資料集建立

今天要開始實作了,首先要先建立環境以及 Evaluation Dataset。 環境是什麼? 環境(Environment) 工具呼叫環境是連接 AI 語言模型...

2026-09-23 ‧ 由 ozymxt 分享
DAY 17

Day17 建立 Baseline 基準點:純 SFT 版本 Agent 的任務表現與極限

昨天我們寫好agent的基礎架構,今天我們要用 SFT 建立第一個 Benchmark,也是我們的Baseline 為什麼需要 Baseline? 在 RLHF...

2026-09-24 ‧ 由 ozymxt 分享
DAY 18

Day18 TRL 訓練實戰:Reward 第一版設計與被 Hack 全紀錄

經過 Day 17 建立的純 SFT Baseline 評估後,我們正式進入 Reinforcement Learning (RL) 的核心實作階段。今天,我們...

2026-09-25 ‧ 由 ozymxt 分享
DAY 19

Day19 Reward 第二版修正

今天會修正reward function,並看看是否避免發生 reward hacking 的發生。最後進行一個小型參數的比較。 第二版 Reward 設計 (...

2026-09-26 ‧ 由 ozymxt 分享
DAY 20

Day20 使用 TRL DPOTrainer 從日誌生成資料微調 Agent

今天實作DPO~DPO 透過巧妙的數學推導,證明了不需要 Reward Model,有興趣可以參考Day9。 DPO直接拿偏好資料(Preference Dat...

2026-09-27 ‧ 由 ozymxt 分享