大型語言模型(LLM)近年快速演進成能自主決策、呼叫工具的 AI Agent,而強化學習(RL)正是讓 Agent 學會「做對的事」的核心技術。本系列將從最基礎的 MDP、Bellman Equation 出發,一路推進到 DQN、PPO、GRPO、DPO 等主流演算法,並實際手刻一個具備工具呼叫能力的 Agent 環境,最終透過 DPOTrainer 完成偏好資料的微調訓練。
30天內容涵蓋理論推導、演算法比較、實作環境建置、訓練除錯與量化評估(成功率、KL散度、reward曲線等),目標是打造一套可重現、有數據佐證的 Agent 強化學習訓練流程,適合想從理論扎實走向工程落地的讀者。
什麼是 AI Agent? 從 ChatGPT Agent到 Claude Coworker,我們又更靠近一直以來對 AI 的幻想:只要告訴機器我們想做什麼,它...
介紹 MDP / State / Action/ Reward 基本定義 先來介紹MDP / State / Action/ Reward基本定義與用途~ MD...
昨天最後補充如何算在某個state下有多好的數學理論公式,今天我們來討論如何使用到演算法中。 Valeu-based 是什麼? 決定 Agent 行為主要分為兩...
昨天提到除 Valeu-based,還有 Policy-Based。而 Policy-Based 的代表演算法是REINFORCE,我們來看看REINFORCE...
昨天提到模型一次走太大步,會崩潰,那有沒有什麼方法可以避免呢?有的! 我們今天要介紹非常有名的PPO,但在這之前先介紹一下TRPO~ TRPO 是什麼? 他引入...