
今天來聊聊,從 Prompt Engineering,走到 Context Engineering,最後進入 Harness + Loop Engineering。
🧭 先搞懂:Prompt、Context、Harness 與 Loop Engineering 到底差在哪裡?
先把幾個常被混在一起的名詞拆開來看。Prompt Engineering 是把任務、角色、輸出格式與限制講清楚;Context Engineering 則是把必要的資料、 歷史紀錄、參考文件與工具補進來,讓 AI 不要只靠猜。
但如果只做到這裡,AI 還是可能像一位很熱心、可是有點脫線的實習生:你交代了事情, 他也很認真做,結果檔名、格式、權限與驗證全部自由發揮。這時候就需要 Harness Engineering,也就是幫 Agent 裝上「韁繩」。

🎯 Harness Engineering:幫 Agent 裝上韁繩
明確定義 Agent 可以做什麼、不能做什麼。
設定工具、規則、限制與成功條件。
把驗證流程納入執行過程,而不是最後才祈禱。
把重複工作整理成可重複使用的 skill 或 flow。
簡單講,Prompt 是交代任務,Context 是補足背景,Harness 則是把活動範圍畫好。 不然 Agent 一開心跑出去,最後可能連你的 production 都想順便重構,這就不是加菜,是加班了 ![]()
Harness 的核心:規則、限制、驗證與可重複使用的流程
🔁 Loop Engineering:讓 Agent 不只做一次,而是反覆修正
Plan → Execute → Evaluate → Refine,這就是 Coding Agent 的迭代循環
另一個重點是 Loop Engineering。筆者自己覺得它很像管理學裡常講的 PDCA,只是換成比較符合 Agent 工作方式的節奏: Plan、Execute、Evaluate、Refine。
也就是先規劃,再執行;執行後評估結果,如果發現錯誤,就修正方法、重新執行, 一直迭代到結果可用為止。其實現在不少前沿模型裡,已經內建類似的行為: 先思考、再執行,遇到錯誤就找原因,修正後再跑一次。
🔄 Loop 的實務檢查表
Plan:先確認任務拆解與執行順序。
Execute:使用指定工具與既定規則完成工作。
Evaluate:檢查輸出是否符合測試、格式與品質要求。
Refine:失敗就修正,不要把錯誤當成「AI 風格」。
口訣可以記成:先規劃、再執行;有錯修正,反覆驗證。 這不是讓 AI 無限鬼打牆,而是讓每一輪都有清楚的檢查點。而且現在的模型通常已經具備思考、執行、找錯與修正的循環能力了
🧼 Uncle Bob 的震撼發言:他居然不看 Agent 寫的程式碼?
接下來要提到一位寫程式資歷比筆者年紀還大的傳奇人物——Uncle Bob,也就是 Robert C. Martin。熟悉 Clean Code 的朋友應該不陌生,他寫過不少影響軟體工程師的書, 如果你想把寫程式這條路走得更長,Clean Code 確實值得拿來翻一下。 只是不要只買來供在書架上,書架不會幫你 Refactor 啊~

Uncle Bob 提出:自己不直接閱讀 Agent 產生的所有程式碼
幾個月前,Uncle Bob 在 X 上提到,他現在的策略是不閱讀 Agent 寫出的每一行程式碼。 這句話一出來,社群當然炸鍋,支持與反對兩邊馬上開戰,彷彿工程師最熟悉的 code review 宗教戰爭又重新開服了。
但筆者覺得,這句話不能直接理解成「從此不用看程式碼,也不用測試」。 真正的重點是:他用非常嚴格的限制、測試與品質流程,把 Agent 圍起來, 讓程式碼必須通過一層又一層的驗證。
極端限制與多層驗證,才是這個方法能成立的關鍵
🛡️ 不看每一行程式碼,靠什麼建立信任?
Unit tests:驗證程式行為是否正確。
Gherkin tests:用具體情境驗證需求,接近 Specification by Example。
QA procedures:透過流程確保品質,而不是只看一次執行結果。
Quality metrics:用可量化指標追蹤品質。
Mutation testing:故意破壞程式,確認測試真的抓得到問題。
Test coverage:確認測試範圍沒有大洞。
這裡筆者要強調一下:不是「不看 Code」很厲害,而是「有能力不看 Code」很厲害。 前提是你的 Harness 夠完整、測試夠嚴格、驗證夠可靠。否則只是把眼睛閉起來, 然後祈禱 production 不會爆而已,這種工程方法通常叫作勇敢,台灣俗稱3好+1好=死好 😅
更多心得分享,請參考完整版影片囉
📌 本日結論
這一段最重要的結論是:Harness 與 Loop 不是兩個漂亮的新名詞,而是把工程實務重新套到 AI Agent 身上。Prompt 負責講清楚,Context 負責補足資料,Harness 負責規範行為, Loop 負責持續修正,最後再用測試與品質流程把關成果。
Agent 要跑得快,規則就要畫得好;測試做得足,晚上才睡得著啊!!!![]()
筆者不會說從此可以完全不看程式碼,因為不同專案、不同風險等級,做法一定不一樣。 但如果我們能把規則、工具、限制、測試與驗證流程設計好,確實可以把時間從 「逐行檢查 AI 到底在寫什麼」移到「設計更可靠的工程系統」。
Prompt 講得清,Context 補得齊,Harness 管得住,Loop 修得好