iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

30天拆Agent:從Repo看設計 系列

這 30 天從 Codex、HolmesGPT、OpenClaw、oncall-kit 等 Agent 專案一路往下看,也穿插 τ²-bench、EvalScope 等評估方法。重點不是做框架排名,而是藉著讀 Repo、追程式碼與研究資料,理解不同 Agent 怎麼處理 Tool、SOP、Memory、控制機制與評估,也記錄一路看下來的差異與發現。

參賽天數 26 天 | 共 26 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 1

30 天要看哪些 Agent?先畫一張 Repo 閱讀地圖

今年想趁鐵人賽,花 30 天把最近一直遇到、卻沒有真正完整看過的 Agent 專案整理一輪。 這兩年 Agent Repo 越來越多。Codex、OpenCod...

2026-09-14 ‧ 由 Vivianou 分享
DAY 2

Day 2|從國泰技術年會看 Agent 如何真的進企業

今天參加完 2026 國泰金控技術年會後,我決定先分享。 非常感謝國泰金控,舉辦這麼棒的年會,也很幸運有機會可以參加。 因為前一天還在討論: 一個 Age...

2026-09-15 ‧ 由 Vivianou 分享
DAY 3

Day 3|研究界怎麼評估 Agent?為什麼不能只看最後答案

回到原本的研究主線,我還是想先回答一個問題: Agent Demo 跑成功一次不難,但我們到底要用什麼證據,證明它真的有把事情做好? 如果只是一般問答模型,...

2026-09-16 ‧ 由 Vivianou 分享
DAY 4

Day 4|Anthropic oncall-kit:從 Repo 架構理解 Skill、Memory、Human Gate 與 Replay Eval

anthropics/oncall-kit 不是重新打造一套 Agent runtime,而是示範:如果底層已經有 Claude Code / Claude 的...

2026-09-17 ‧ 由 Vivianou 分享
DAY 5

Day 5|Claude Code 的強制阻擋設定

上一篇介紹 anthropics/oncall-kit 時,有一個設計我特別喜歡:setup 被拆成五個 Phase,而且每個 Phase 都要求 Human...

2026-09-18 ‧ 由 Vivianou 分享
DAY 6

Day 6|HolmesGPT:當 Agent 自己掌握 Tool Loop,控制點會放在哪裡?

前兩天看 anthropics/oncall-kit,比較像是在 Claude Code 這個既有 Runtime 上,加入 Skill、SOP 與 Human...

2026-09-19 ‧ 由 Vivianou 分享
DAY 7

Day 7|HolmesGPT 的 Tool 怎麼設計?

上一篇已經看過 HolmesGPT 自己掌握 Model → Tool → Result → Model 的執行迴圈。 這篇不再重複 Agent Loop,而是...

2026-09-20 ‧ 由 Vivianou 分享
DAY 8

Day 8|HolmesGPT 的 Memory 有什麼特別?從 Checkpoint、Resume 到 Feedback

上一篇看 HolmesGPT 的 Tool 設計時,重點是 Model 這一輪到底有哪些能力可以用。 這一篇換成 Memory。 HolmesGPT 沒有另外包...

2026-09-21 ‧ 由 Vivianou 分享
DAY 9

Day 9|Codex Agent 架構:OpenAI 怎麼把 Model + Tool 做成一套 Runtime?

前幾天看 HolmesGPT 時,我們已經看過一個典型 Agent loop: Model ↓ Tool Call ↓ Tool Result ↓...

2026-09-22 ‧ 由 Vivianou 分享
DAY 10

Day 10|Codex App Server:把 Codex Core 接到真正的產品介面

上一篇介紹 Codex Core 時,看到它用 Submission / Event 跟 Client 互動。 Core 負責真正的 Agent loop: 收...

2026-09-23 ‧ 由 Vivianou 分享