iT邦幫忙

2026 iThome 鐵人賽

DAY 20
0
Claude AI

如何讓 AI 主動完成複雜任務?Claude Code × Agentic Workflow 實戰系列 第 20 篇

Day 20|讓 Claude Code 自己檢查:真的完成了嗎?

  • 分享至 

  • xImage
  •  

昨天讓 Claude Code 按照 Task Plan 完成文章搜尋功能,最後執行完整 Test,結果是 24 passed, 0 failed。

看到所有 Test 都通過後,我開始思考另一個問題:

Test 全部通過,就代表這個功能真的完成了嗎?

其實不一定。

因為 Test 只能確認「我們有寫進去的測試案例」是否符合預期。如果一開始就漏掉某個需求,或根本沒有針對某個情況建立 Test,那麼即使所有 Test 都通過,也不代表功能一定完整。

所以今天我想測試 AI Self-Check。

這次我沒有直接讓 Claude Code 修改程式,而是讓它重新檢查昨天完成的功能,並且對照原本的需求與 Task Plan。

我給它的指令是:

請重新檢查剛才完成的文章搜尋功能。

請對照原本的需求與 Task Plan,確認:

1. 每一個 Task 是否都已完成
2. 新增的 Test 是否全部通過
3. 原本的 Test 是否仍然通過
4. 是否有漏掉的需求
5. 是否有修改到與這次任務無關的程式碼

如果發現任何問題,
請列出問題與原因。

先不要修改程式碼。

image

這次我特別加上「先不要修改程式碼」,因為我想觀察的是 Claude Code 能不能自己找出問題,而不是發現問題後直接幫我修掉。

這也讓我發現,Test 和 Self-Check 其實是在檢查不同的事情。

昨天的 Test 比較像是在確認:

「這段程式的行為是不是符合預期?」

今天的 Self-Check 則是在確認:

「我是不是有把原本要求的事情全部完成?」

例如這次的文章搜尋功能,原本的需求包含搜尋 title、搜尋 content、不分大小寫,以及沒有 keyword 時維持原本的行為。

假設我只實作了 title 搜尋,但 Test 剛好沒有測試 content,那麼 Test 仍然有可能全部通過。

所以:

Test 通過 ≠ 需求一定完整。

這也是我這幾天實驗後開始感受到的差別。

如果 AI 只是寫完 Code,然後看到 Test 通過就直接回報「完成」,它比較像是一個執行工具。

但如果 AI 能夠在完成工作後,再回頭查看自己的修改,重新對照需求、Task Plan、Test 結果,確認有沒有遺漏,這就更接近我前面研究的 Agent。

我也開始把「完成一個任務」這件事情重新定義。

不是:

Code 寫完 = 完成

也不是:

Test 通過 = 完成

而是需要同時確認:

需求有完成
+
Test 有通過
+
沒有遺漏需求
+
沒有產生不必要的修改

這讓我覺得 Self-Check 是 AI 開發工作流中很重要的一個環節。

因為人寫 Code 時也不可能只確認「程式有沒有報錯」,還需要回頭確認自己是不是做對事情。

如果 AI 未來可以自己完成「執行 → 測試 → 檢查 → 發現問題 → 修正 → 再驗證」這一整套循環,那它就不只是幫我寫 Code,而是真的開始具備一個能夠完成任務的工作流程。

而這也讓我開始思考下一個問題:

如果 AI 發現問題,是不是每一件事情都應該讓它自己決定?

有些程式修改可能可以直接讓 AI 處理,但如果涉及資料庫結構、API 設計或重要架構,就可能需要人先確認。

所以接下來,我想研究的不是「AI 能不能自己做」,而是:

什麼事情可以讓 AI 自己決定,什麼事情需要人來確認?
明天研究主題:Human-in-the-Loop:哪些事情該讓 AI 自己決定?


上一篇
Day 19|讓 Claude Code 自己完成一個完整功能
系列文
如何讓 AI 主動完成複雜任務?Claude Code × Agentic Workflow 實戰 共 20 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言