Agent 的 Demo 很快能跑起來,交付真實工作後,問題常出在模型外面:按了停止還在改檔、Timeout 後又寄一次信、文件寫了卻沒被讀到。組裝 Context、執行工具、決定何時停下的這層程式,就是 Harness。我實作 Harness 時也踩過類似的坑,於是整理 OpenAI、Anthropic、Shopify 等團隊公開的工程文章,看他們面對同樣問題怎麼取捨。三十天分為五個主題:任務狀態與恢復、Context 與知識、工具與副作用、權限與信任邊界、運行與改善。每篇從一個問題出發,比較做法的代價,整理成設計判斷,讓讀者檢查自己的 Agent 時,知道該補哪一層、補到什麼程度。
📦 不一定。以 Claude Code 為例,開了 sandbox 之後 Bash 只能寫專案目錄、連不到沒允許的網址,但家目錄的憑證檔和環境變數裡的密鑰照樣...
🆔 用它自己的身分,再註明它代表你。Claude Code 在你電腦上跑 gh 用的是你登入的 token,GitHub 上看起來就是你本人,分不出是它做的,...
✅ 使用者同意的,是他按下去那一刻看到的那一筆:這行指令、這些參數、當時的狀態。工具卻常把一次同意放大:Claude Code 的「Yes, and don'...
🧪 擋不完,就別讓 Agent 在同一輪湊齊三樣:讀到外人寫的內容、讀得到私有資料、寫得到外人看得到的地方。模型分不出哪句是你說的、哪句是外人寫的,訓練和過濾...