這 30 天從 Codex、HolmesGPT、OpenClaw、oncall-kit 等 Agent 專案一路往下看,也穿插 τ²-bench、EvalScope 等評估方法。重點不是做框架排名,而是藉著讀 Repo、追程式碼與研究資料,理解不同 Agent 怎麼處理 Tool、SOP、Memory、控制機制與評估,也記錄一路看下來的差異與發現。
今年想趁鐵人賽,花 30 天把最近一直遇到、卻沒有真正完整看過的 Agent 專案整理一輪。 這兩年 Agent Repo 越來越多。Codex、OpenCod...
今天參加完 2026 國泰金控技術年會後,我決定先分享。 非常感謝國泰金控,舉辦這麼棒的年會,也很幸運有機會可以參加。 因為前一天還在討論: 一個 Age...
回到原本的研究主線,我還是想先回答一個問題: Agent Demo 跑成功一次不難,但我們到底要用什麼證據,證明它真的有把事情做好? 如果只是一般問答模型,...
anthropics/oncall-kit 不是重新打造一套 Agent runtime,而是示範:如果底層已經有 Claude Code / Claude 的...
上一篇介紹 anthropics/oncall-kit 時,有一個設計我特別喜歡:setup 被拆成五個 Phase,而且每個 Phase 都要求 Human...
前兩天看 anthropics/oncall-kit,比較像是在 Claude Code 這個既有 Runtime 上,加入 Skill、SOP 與 Human...