今天要聊的是Self-play / Self-improvement Loop,監督式學習(Supervised Learning)依靠人類給的資料學習,而人類的資料是有限的,如果 AI 只學人類,那它的天花板就是人類的極限。
1. AlphaGo (Self-play 自我對弈)
2017 年的 AlphaGo Zero 完全沒有看過任何人類棋譜。它只知道圍棋規則,然後開始自己跟自己下棋。它花了 3 天的時間,自己跟自己下了 490 萬盤棋,接著就以 100:0 的戰績,打敗了之前擊敗過人類世界冠軍的舊版 AlphaGo。
2. Self-Refine (自我優化迴圈)
讓 AI 不要急著交卷,而是先寫出初稿,接著自己揪出缺點並給予回饋,最後根據這些回饋重新修改,直到產出高品質的最終解答。
3. Self-Improvement Agent (自我提升代理)
一個 Agent不僅能在「當下」自我修正,還能把學到的教訓寫進長期的記憶或更新自己的模型參數中。
到目前為止,我們提到的agent 都是一個,那多個agent 是怎麼合作的呢?
當任務太龐大、太複雜時,單一個 AI 很容易出錯或產生幻覺。所以我們指派多個擁有「不同身份與專長」的 Agent,讓它們「互相對話、糾正、合作」來完成任務。
為了方便管理這些數位員工,發展了各種「框架(Frameworks)」,常見的有:
首創自動對話技術,讓兩個 Agent為了一個特定目標,自動展開對話與合作,直到解決問題。
可以建立一整間虛擬公司,包含工程師、測試員、產品經理,讓他們在一個聊天室裡共同解決複雜問題,甚至可以讓人類隨時插手參與。
明天開始會進入實作系列!