iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

同一把尺,30 天橫評 AI Agent Skill:從單篇實測到一份能查的選用指南 系列

我平常會用 Skill 處理 AI 開發裡的重複工作,但不是每個裝了就有用。這 30 天,我用同一套評分尺——會不會被觸發、輸出對不對、什麼情況會失敗、多花多少成本、最後留不留——逐一實測我真的在用的 Skill。每篇是一次獨立實測,但用的是同一把尺;到第 30 天,這些結果會收成一份可查閱的選用指南,不是 30 篇各自獨立的心得。

參賽天數 23 天 | 共 23 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1 | Skill 裝了,怎麼知道有用?從一次 18 回合實測開始

我在 Claude Code 裡裝了不少 Skill,但老實說,裝的時候很少真的驗證過它有沒有用——大多是看到別人推薦、讀起來合理,就裝上去了。這 30 天,我...

2026-09-15 ‧ 由 Ci 分享
DAY 2

Day 2 | 換官方的來測:code-review 到底在幫我看什麼?

Day 1 測的 Atomic Commit 是我自己維護的 Skill。今天想換一個從沒自己寫過的——Claude Code 內建的 code-review,...

2026-09-16 ‧ 由 Ci 分享
DAY 3

Day 3 | 接下來不測我自己做的,先講清楚為什麼、測什麼方向

兩天測下來,我發現一件比任何單一結果都重要的事:這個系列很容易滑向「工具箱文」——裝一個 Skill、講一下感覺、下一篇換一個。要避免這件事,光靠自己小心不夠,...

2026-09-17 ‧ 由 Ci 分享
DAY 4

Day 4 | 我問 Claude「現在該怎麼寫」,結果它答的是半年前的正確答案

上禮拜我遇到一件小事,但後來越想越不安。 我在寫一段要打 Anthropic API 的程式碼,想省點 token 成本,就順口問了 Claude「現在要怎麼開...

2026-09-18 ‧ 由 Ci 分享
DAY 5

Day 5 | 我們自己在用的記憶外掛,這次換我來查它有沒有在唬爛

寫這個系列到第五天,我第一次要測一個我自己每天都在用、離不開的工具——claude-mem。前四天測的都是「聽過、裝了、順手試試」的東西,這篇不一樣:這個外掛已...

2026-09-19 ‧ 由 Ci 分享
DAY 6

Day 6 | 資安掃描工具抓到了漏洞,也漏掉了一個更大的漏洞

前五天測的都是「產出品質」型的 skill——寫得好不好、抓得準不準、記得住記不住,錯了頂多重來一次。今天測的是 Trail of Bits——一間在資安圈子裡...

2026-09-20 ‧ 由 Ci 分享
DAY 7

Day 7 | 明明講對了完成的話,它卻沒有停下來

前六天測過的 skill,考驗的大多是「這個東西懂不懂它宣稱懂的事」——文件查得準不準、記憶記不記得住、掃描抓不抓得到漏洞,這些都是能力層面的問題。今天測的是...

2026-09-21 ‧ 由 Ci 分享
DAY 8

Day 8 | 不是變短,是變得能馬上做

前七天累積下來的清單裡,測過的都是「工具能不能把事情做對」,今天想補一個完全不同的角度:一個 skill 能不能把「事情做對」這件事,用一個特定讀者真正用得上...

2026-09-22 ‧ 由 Ci 分享
DAY 9

Day 9 | 我設計了一個只有進階工具才追得到的漏洞,結果人工也追到了

寫這篇之前,我對今天的結果其實有一個很篤定的預設劇本:CodeQL 追到、人工追不到,證明進階工具有它不可取代的價值。實測完全不是這樣,這篇能寫成現在這個樣子,...

2026-09-23 ‧ 由 Ci 分享
DAY 10

Day 10 | 少了六個問題,換來一組親手驗證的數字

今天測的是 codex——Claude Code 官方市集裡橋接 OpenAI Codex(GPT-5.4)的套件,讓你在 Claude Code 裡直接叫一個...

2026-09-24 ‧ 由 Ci 分享