iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》 系列

大型語言模型(LLM)近年快速演進成能自主決策、呼叫工具的 AI Agent,而強化學習(RL)正是讓 Agent 學會「做對的事」的核心技術。本系列將從最基礎的 MDP、Bellman Equation 出發,一路推進到 DQN、PPO、GRPO、DPO 等主流演算法,並實際手刻一個具備工具呼叫能力的 Agent 環境,最終透過 DPOTrainer 完成偏好資料的微調訓練。

30天內容涵蓋理論推導、演算法比較、實作環境建置、訓練除錯與量化評估(成功率、KL散度、reward曲線等),目標是打造一套可重現、有數據佐證的 Agent 強化學習訓練流程,適合想從理論扎實走向工程落地的讀者。

參賽天數 25 天 | 共 25 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文 |團隊黑色月亮
DAY 21

Day21 RL 訓練踩坑日記:不穩定現象 (KL Explosion, Collapse)

今天來聊聊這幾天踩的坑! 踩坑日記開始!! 策略崩潰(Policy Collapse / Mode Collapse) 在Day18 的時候,原本的目標是設計較...

2026-09-28 ‧ 由 ozymxt 分享
DAY 22

Day22 如何定義 Agent 成功?Evaluation Framework 與 Metrics 評估設計

前天訓練好 DPO model,今天拿 Day16 寫好的評估集做測試,並與 Day17 的baseline比較! 我先定義了多項關鍵評估指標來檢驗模型表現:...

2026-09-29 ‧ 由 ozymxt 分享
DAY 23

Day23 讓 Agent 學會「偏好」:從資料到模型的完整 DPO Pipeline

今天來看看 DPO 的訓練流程吧! 回顧一下 DPO 的目標,訓練一個 Agent,讓它不只是「會回答問題」,而是更懂得什麼樣的回答才是我們真正想要的。 1....

2026-09-30 ‧ 由 ozymxt 分享
DAY 24

Day24:Agent 會跑了,但跑得夠快嗎?API 封裝、延遲探討與量化取捨

在前幾天的實作中,我們成功用 DPO 訓練出了具備自主使用工具能力的 Agent(Success Rate 提升至 73%)。但一個存在於命令列裡的模型,還不能...

2026-10-01 ‧ 由 ozymxt 分享
DAY 25

Day25 Agent 記得越多,Context 撐得住嗎?上下文管理

今天,我們就來探討如何在多步驟任務中進行上下文管理 (Context Management)。 先來看看會遇到甚麼問題! 當工具回傳結果撐爆 Context W...

2026-10-02 ‧ 由 ozymxt 分享