從 ChatGPT Agent到 Claude Coworker,我們又更靠近一直以來對 AI 的幻想:只要告訴機器我們想做什麼,它就能自己規劃並完成整個任務。
它和我們每天使用的 ChatGPT、Gemini 或 Claude 這些大型語言模型(LLM)又什麼不同?
AI Agent 與 LLM 最大的不同是,AI Agent不僅會回答問題,而是理解使用者的需求並完成使用者的需求。
例子
任務:幫我規劃一趟日本自由行
整個過程中,它不是單純地「回答你的問題」,而是真正地「執行任務」
我們期待 Agent 能夠透過與環境互動、不斷嘗試與修正,逐漸學會完成複雜任務的最佳策略。
僅靠傳統的監督式微調(Supervised Fine-Tuning, SFT)仍然有所不足。因此,近年研究開始將焦點轉向強化學習(Reinforcement Learning, RL)。
這也是本系列文章接下來將深入探討的主題。
那為什麼SFT沒辦法訓練出AI Agent? 為什麼是 RL,而不是別的方法?我們來比較一下 SFT 跟 RL 吧!
| 面向 | SFT (監督式微調) | RL(強化學習) |
|---|---|---|
| 學習方式 | 模仿,讓模型輸出盡量接近標註的正確答案 |
試錯,模型自己生成,依據 reward 調整,提高 reward 行為的機率 |
| 能否處理「多種正確解」 | 困難,只能學到訓練資料裡出現過的那幾種寫法可以 |
只要 reward 設計得好,模型能處理「多種正確解」的問題 |
| 能否處理多步驟任務、在失敗時自行修正 | 困難, 很難標註「這一步錯」這種中間過程 |
相對適合,可以用 reward 針對整個軌跡或特定步驟給訊號 |
RL 的優勢在於RL用「結果好壞」當訊號,而不是「標準答案」
通常用於複雜任務的拆解與規劃
例子
當給 Agent 一個複雜指令(幫我上網查下週五台北到大阪最便宜的機票,並整理成表格傳到我的email),它不能只靠直覺,而是需要制定計畫。
RL 可以訓練 Agent 如何拆解步驟也就是它的思考路徑。
Agent 嘗試不同的拆解方式
這樣就可以讓 Agent 學會「先搜尋航班」->「比較價格」->「生成表格」->「呼叫 Email API」這樣的作業流程。
Day1 簡單介紹為什麼我們要用RL、RL有哪些好處、優勢,明天會開始 RL 的基礎知識!