這 30 天從 Codex、HolmesGPT、OpenClaw、oncall-kit 等 Agent 專案一路往下看,也穿插 τ²-bench、EvalScope 等評估方法。重點不是做框架排名,而是藉著讀 Repo、追程式碼與研究資料,理解不同 Agent 怎麼處理 Tool、SOP、Memory、控制機制與評估,也記錄一路看下來的差異與發現。
前幾天把 Codex App Server 接起來後,我開始遇到一個比 Tool 更實際的問題。 假設我要做的是: LINE ↓ FastAPI ↓ C...
前面幾天看 Codex 時,比較常從 Agent Runtime 往內拆:Thread 怎麼保存、Turn 怎麼跑、Tool 怎麼執行、Sandbox 怎麼限制...
上一篇拆完 commerce-agents 的 Shopping Agent 後,這篇不再繼續拆每一個 Agent module,而是回答兩個問題: Tool...
上一篇看完 commerce-agents 的 Runtime 與 MCP,這篇來看它另一個很值得拆的設計:Memory。 假設乘客第一次跟客服說: 我長途航...
前幾天已經分別看過 Codex,以及 Anthropic 的 commerce-agents。 兩邊都有 Prompt、Skill、Tool、Memory,也都...
前幾篇介紹 Codex 和 Claude 時,我們追的是一個 Agent Run,OpenClaw 當然也有。 但如果真的想自己打造一個長期運作的 Agent,...
第一次看 OpenClaw,很容易覺得: 不也是讓 Agent 接 Tool,再用 SKILL.md 告訴它怎麼做事嗎? 但 OpenClaw 比較值得看的...
如果 Agent 學到的不是「做事方法」,而是一個人、一個事實或一個長期決策,它到底怎麼變成 Memory? 例如: 「以後 code example 都用...
前幾篇已經分別看過 Codex、Claude 與 OpenClaw 的 Memory。 現在的 Agent Framework 早就不是「每次對話結束就失憶」:...
上一篇看 Hindsight 時,已經看到一種做法:把 Memory 從 Agent Runtime 抽出來,放進獨立的 Memory Service。 今天看...