AI Agent 難的不是讓它會回話,而是跑久了還不受控:記不記得先前的事、清不清楚自己是誰、會不會動到不該動的東西?換更強的模型解決不了,要處理的是怎麼駕馭模型。給它工具、劃出邊界,讓每個動作可確認可喊停,這就是駕馭工程(Harness Engineering)。
系列由三個元件組成:Hermes Agent 是整套系統的骨幹,負責長期運作的各個環節;Gemini 負責推理判斷;MCP 讓工具介接走標準協定。三者可各自替換,換掉模型不必動到其他部分。
接下來 30 天,從模型設定開始,做到它自己排程、自己完成任務,過程中的故障與修正一併記錄。
Context engineering 是四個範式裡的第二個,它與 prompt engineering 的分界在各自處理的對象。以下整理兩份一手資料各自怎麼界...
開一個新 session,第一句話之前 context window 已經被佔掉一塊。這塊有多大、由哪幾項組成、哪一項裁掉最有效,要量過才知道。Hermes 有...
昨天量的是一個 session 開場時的固定開銷,對話往下走之後,這個數字會一路長到觸發壓縮。以下依序釐清三個問題:session 保存在哪裡、壓縮在哪一個數字...
前天量出工具 schema 佔掉固定開銷的 63%,34,093 B、20 個工具。今天把它拆到可操作的層級:逐一停用 toolset,每停一組量一次,看數字怎...
前兩天量的是固定開銷與工具 schema,都是我這台機器上的數字。記憶這一層在動手量之前先換一組來源:它在 2026 年已經有專屬的綜述與基準。以下依序釐清三件...
昨天整理的三個維度裡,control policy 問的是由誰決定存什麼、取什麼、丟什麼。今天把這個問題換成可以量的形式:寫一則偏好進去、把 session 結...
昨天量的是記憶那一層,寫入由模型決定、核准閘門預設關閉。同一套自我改進機制在技能這一側有一個背景程序在跑,它會標記、封存、整併它管理範圍內的技能。今天把它跑起來...