Agent 的 Demo 很快能跑起來,交付真實工作後,問題常出在模型外面:按了停止還在改檔、Timeout 後又寄一次信、文件寫了卻沒被讀到。組裝 Context、執行工具、決定何時停下的這層程式,就是 Harness。我實作 Harness 時也踩過類似的坑,於是整理 OpenAI、Anthropic、Shopify 等團隊公開的工程文章,看他們面對同樣問題怎麼取捨。三十天分為五個主題:任務狀態與恢復、Context 與知識、工具與副作用、權限與信任邊界、運行與改善。每篇從一個問題出發,比較做法的代價,整理成設計判斷,讓讀者檢查自己的 Agent 時,知道該補哪一層、補到什麼程度。
我為什麼想寫這個系列? Hi 大家好,我是 David,目前在 Synology 擔任軟體工程師,主要負責備份相關功能。 因為平常就喜歡研究一些 Harness...
💡 Agent 做不好,不一定是模型做不好。先看模型拿到了什麼、能做什麼,再沿著 Agent Loop 找真正的瓶頸。 昨天在 Day 1|Producti...
🔎 Tool 接上了,不代表事情就做得完。Tool 後面的 Environment 還要讓 Agent 找得到做法、真的跑得起來,最後也拿得到可以檢查的結果。...