iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

30天拆Agent:從Repo看設計 系列

這 30 天從 Codex、HolmesGPT、OpenClaw、oncall-kit 等 Agent 專案一路往下看,也穿插 τ²-bench、EvalScope 等評估方法。重點不是做框架排名,而是藉著讀 Repo、追程式碼與研究資料,理解不同 Agent 怎麼處理 Tool、SOP、Memory、控制機制與評估,也記錄一路看下來的差異與發現。

參賽天數 6 天 | 共 6 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

30 天要看哪些 Agent?先畫一張 Repo 閱讀地圖

今年想趁鐵人賽,花 30 天把最近一直遇到、卻沒有真正完整看過的 Agent 專案整理一輪。 這兩年 Agent Repo 越來越多。Codex、OpenCod...

2026-09-14 ‧ 由 Vivianou 分享
DAY 2

Day 2|從國泰技術年會看 Agent 如何真的進企業

今天參加完 2026 國泰金控技術年會後,我決定先分享。 非常感謝國泰金控,舉辦這麼棒的年會,也很幸運有機會可以參加。 因為前一天還在討論: 一個 Age...

2026-09-15 ‧ 由 Vivianou 分享
DAY 3

Day 3|研究界怎麼評估 Agent?為什麼不能只看最後答案

回到原本的研究主線,我還是想先回答一個問題: Agent Demo 跑成功一次不難,但我們到底要用什麼證據,證明它真的有把事情做好? 如果只是一般問答模型,...

2026-09-16 ‧ 由 Vivianou 分享
DAY 4

Day 4|Anthropic oncall-kit:從 Repo 架構理解 Skill、Memory、Human Gate 與 Replay Eval

anthropics/oncall-kit 不是重新打造一套 Agent runtime,而是示範:如果底層已經有 Claude Code / Claude 的...

2026-09-17 ‧ 由 Vivianou 分享
DAY 5

Day 5|Claude Code 的強制阻擋設定

上一篇介紹 anthropics/oncall-kit 時,有一個設計我特別喜歡:setup 被拆成五個 Phase,而且每個 Phase 都要求 Human...

2026-09-18 ‧ 由 Vivianou 分享
DAY 6

Day 6|HolmesGPT:當 Agent 自己掌握 Tool Loop,控制點會放在哪裡?

前兩天看 anthropics/oncall-kit,比較像是在 Claude Code 這個既有 Runtime 上,加入 Skill、SOP 與 Human...

2026-09-19 ‧ 由 Vivianou 分享