昨天收在一個問題:看得見之後,系統會自動變好嗎?L4 的第三塊就是這個:讓每一次執行變成下一次的養分。這塊的行情很亂:幾乎每個 agent 系統都宣稱自己「越用越強」,但打開原始碼,這四個字背後的工程決策從底層就不同:有的進化知識、有的進化工具能力、有的動到模型權重,還有兩個系統刻意選擇完全不自動進化。把六個系統攤開來比,比看任何單一系統都清楚。
| 系統 | 進化什麼 | 觸發方式 | 人工介入 |
|---|---|---|---|
| GenericAgent | 技能庫(跑通的執行路徑) | agent 自主觸發 | 無 |
| HermesAgent | 技能庫 + 模型權重 | 每 10 次 tool-call 自動 | 無 |
| DeerFlow | 對用戶的認知(facts) | 每次工具執行後自動 | 無 |
| NanoClaw | 執行環境(容器能力) | agent 提出申請 | 必須人工核准 |
| HolmesGPT | 不進化(靜態 playbook) | 手動撰寫 | 全部 |
| OpenClaw | 技能庫(社群市集) | 手動安裝 | 全部 |
GenericAgent 結晶執行路徑。 這個約三千行 Python 的極簡框架(Day 2 看過它的 system prompt),只讓成功跑通的任務有資格變成 SOP:agent 完成新任務後自己判斷值不值得保留,值得就提取成 Markdown 寫進技能庫、更新索引。最有意思的特性是私有性:同樣的種子代碼,兩個用了半年的用戶長出完全不同的技能樹,因為做過的任務不同。進化的是屬於特定用戶的積累,而非通用能力。
HermesAgent 走兩層。 prompt 層叫 skill nudge:每 10 次 tool-call 之後,fork 一個背景 review agent 檢視剛才的對話,判斷值不值得結晶成 SKILL.md,判斷標準只有一條:這次任務有沒有試錯過程?沒有試錯的任務不需要記憶,這個門檻防止技能庫被平庸的重複任務稀釋。Day 20(Skills)提過它會提醒 agent 把做法存成 skill,機制全貌就是這樣:agent 主動存,背景 daemon 兜底。它同時還把成功和失敗的完整軌跡存下來餵強化學習、微調模型本身,那是動權重的領域,超出這個系列的範圍,只提一句:它是六個系統裡唯一走到那層的,複雜度和維護成本也最高。
DeerFlow 進化的是對用戶的認知。 不積累技術 SOP,每次工具執行後非同步讓 LLM 分析對話、提取該記住的 facts。三個品質機制:信心值低於 0.7 直接丟棄;超過 100 條就驅逐最低分;還有信號感知,偵測到用戶說「不對」就更激進地清除錯誤記憶,說「就是這樣」就調高信心值。用戶的語氣變成記憶策略的旋鈕。
NanoClaw 進化的是 agent 能跑什麼。 agent 需要新的 package 或 MCP server,透過工具提出申請,host 端發核准卡片給管理員,點了 Approve 才走 docker rebuild。所有真正的系統修改都在容器外執行,agent 只能提出請求。這是風險管理:裝錯的 package 會弄壞容器,惡意的 MCP server 是新的攻擊面。
HolmesGPT(Day 7 看過它的極致 prompt)的 skills 是靜態 playbook,沒有任何自動生成機制。這是刻意的選擇:它的定位是 production SRE 調查工具,可預測性比適應性重要。agent 自動修改自己的診斷流程,人就說不清某次調查是照哪個版本的邏輯跑的;靜態 playbook 可以 code review、可以 rollback、可以解釋給 on-call 的人。OpenClaw 則把進化外包給生態:ClawHub 技能市集由社群把關品質,安裝手動觸發,進化的決定權明確在人手上。
兩個系統的共同邏輯:agent 在生產環境對結果負責的時候,行為的可追溯性比適應性更有價值。這跟 Day 26 是同一條線:連進化本身,都要是可回溯的。
進化什麼? 從系統定位推導:個人化 assistant 記用戶偏好(DeerFlow)、autonomous agent 積累技術 SOP(GenericAgent)、production 工具要可預測(HolmesGPT)。誰決定值得記? agent 自判、規則門檻、人工核准,對應三種不同的信任假設。可逆嗎? 多數系統沒認真回答這題:DeerFlow 的驅逐是靜默的,某個事實被丟掉了用戶不會知道;NanoClaw 的核准記錄和 HolmesGPT 的 version control 是少數例外。成本算了嗎? 每次 skill nudge 是一個額外的背景 agent,每次記憶更新是一次額外呼叫,docker rebuild 要十五分鐘,進化本身有帳單。
還有一個問題藏在所有會進化的系統底下,比這四個都深:它們全都預設自己知道什麼叫「變好」。GenericAgent 用「跑通」當標準、HermesAgent 用「有沒有試錯」當門檻、DeerFlow 用信心值當閘門,這些標準本身,就是一個個 evaluation function。它設計得多準,系統就能改進到多遠;設計得歪,系統只會更快地往錯的方向跑。明天講 L4 的最後一課:eval function 的設計,以及它為什麼是自我改進的天花板。