大型語言模型(LLM)近年快速演進成能自主決策、呼叫工具的 AI Agent,而強化學習(RL)正是讓 Agent 學會「做對的事」的核心技術。本系列將從最基礎的 MDP、Bellman Equation 出發,一路推進到 DQN、PPO、GRPO、DPO 等主流演算法,並實際手刻一個具備工具呼叫能力的 Agent 環境,最終透過 DPOTrainer 完成偏好資料的微調訓練。
30天內容涵蓋理論推導、演算法比較、實作環境建置、訓練除錯與量化評估(成功率、KL散度、reward曲線等),目標是打造一套可重現、有數據佐證的 Agent 強化學習訓練流程,適合想從理論扎實走向工程落地的讀者。
今天聊聊RLHF、Agentic RL的差異,以及Agentic RL衍伸的問題! RLHF 優化的是「一次性回答」,而Agentic RL 優化的是「一連串決...
昨天提到關於Credit Assignment的解法有Process Reward Model跟RLVR,今天我們先來聊聊Process Reward Mode...
在前面的章節中,我們已經為強化學習的理論打下了基礎,也看過了 RLHF的標準流程。當正式跨入 Agentic RL 的領域時,對於我曾經有模型微調經驗的開發者,...
今天我們來聊聊 Reward Hacking ~ Reward Hacking AI 找到了一個我們設計獎勵時沒想到的漏洞,透過作弊或走捷徑的方式刷了超高分,但...
今天要聊的是Self-play / Self-improvement Loop,監督式學習(Supervised Learning)依靠人類給的資料學習,而人類...
今天要開始實作了,首先要先建立環境以及 Evaluation Dataset。 環境是什麼? 環境(Environment) 工具呼叫環境是連接 AI 語言模型...
昨天我們寫好agent的基礎架構,今天我們要用 SFT 建立第一個 Benchmark,也是我們的Baseline 為什麼需要 Baseline? 在 RLHF...
經過 Day 17 建立的純 SFT Baseline 評估後,我們正式進入 Reinforcement Learning (RL) 的核心實作階段。今天,我們...
今天會修正reward function,並看看是否避免發生 reward hacking 的發生。最後進行一個小型參數的比較。 第二版 Reward 設計 (...
今天實作DPO~DPO 透過巧妙的數學推導,證明了不需要 Reward Model,有興趣可以參考Day9。 DPO直接拿偏好資料(Preference Dat...