iT邦幫忙

2026 iThome 鐵人賽

DAY 15
0
AI Engineering

《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》系列 第 15

Day15 自我進化的開端:Self-play 迴圈與 Multi-Agent 協作入門

  • 分享至 

  • xImage
  •  

今天要聊的是Self-play / Self-improvement Loop,監督式學習(Supervised Learning)依靠人類給的資料學習,而人類的資料是有限的,如果 AI 只學人類,那它的天花板就是人類的極限。

Self-play / Self-improvement Loop

讓 AI 透過與自己互動來發現錯誤、不斷進化。

應用Example

1. AlphaGo (Self-play 自我對弈)
2017 年的 AlphaGo Zero 完全沒有看過任何人類棋譜。它只知道圍棋規則,然後開始自己跟自己下棋。它花了 3 天的時間,自己跟自己下了 490 萬盤棋,接著就以 100:0 的戰績,打敗了之前擊敗過人類世界冠軍的舊版 AlphaGo。

2. Self-Refine (自我優化迴圈)
讓 AI 不要急著交卷,而是先寫出初稿,接著自己揪出缺點並給予回饋,最後根據這些回饋重新修改,直到產出高品質的最終解答。

3. Self-Improvement Agent (自我提升代理)
一個 Agent不僅能在「當下」自我修正,還能把學到的教訓寫進長期的記憶或更新自己的模型參數中。


到目前為止,我們提到的agent 都是一個,那多個agent 是怎麼合作的呢?


Multi-Agent Collaboration(多智能體協作)

當任務太龐大、太複雜時,單一個 AI 很容易出錯或產生幻覺。所以我們指派多個擁有「不同身份與專長」的 Agent,讓它們「互相對話、糾正、合作」來完成任務。

為了方便管理這些數位員工,發展了各種「框架(Frameworks)」,常見的有:

CAMEL:專注於「雙人角色扮演(Role-Playing)」

首創自動對話技術,讓兩個 Agent為了一個特定目標,自動展開對話與合作,直到解決問題。

AutoGen:專注於「多人群聊(Group Chat)」

可以建立一整間虛擬公司,包含工程師、測試員、產品經理,讓他們在一個聊天室裡共同解決複雜問題,甚至可以讓人類隨時插手參與。


Takeaway

  • Self-play(自我對弈) : 主要用於有明確規則與輸贏的環境(如棋類、遊戲),透過左右互搏找出最佳策略。
  • Self-Refine(自我優化) : 主要用於語言模型,透過「生成 → 評估 → 修正」的迴圈,在單次任務中提升產出品質。
  • Self-Improvement Agent : 讓 AI 能在不斷執行任務的過程中累積經驗,達到真正意義上的自主進化。
  • Multi-Agent 協作就是把複雜任務拆解,交給多個「專精不同領域的 AI 角色」透過互相對話與除錯來完成,藉此大幅提升準確率。CAMEL 擅長 1對1 深度角色扮演,AutoGen 則擅長打造 N對N 的虛擬團隊。

明天開始會進入實作系列!


上一篇
Day14 當 Agent 開始作弊:故意設計錯誤 Reward 誘發 Reward Hacking
下一篇
Day16 打造 Agent 競技場:手刻工具呼叫環境與評估資料集建立
系列文
《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》16
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言