本系列將從零實作一套輕量級 AI Agent 測試驗證系統,聚焦於 Trace、Eval 與 Guardrails 三個核心面向。不同於只展示 Agent 最終回答,本系列會記錄 Agent 的執行過程、工具呼叫、輸出結果與錯誤狀態,讓原本黑盒的 Agent 行為變得可觀察。接著建立測試資料集與自動評分流程,分析 Agent 的成功率、失敗類型與穩定性。最後加入輸出格式驗證、Retry 與工具權限限制等 Guardrails,觀察這些機制是否能提升 Agent 的可靠性。透過 30 天實作,探索 AI Agent 從開發到落地前所需的測試、追蹤與驗證流程