本系列將從零實作一套輕量級 AI Agent 測試驗證系統,聚焦於 Trace、Eval 與 Guardrails 三個核心面向。不同於只展示 Agent 最終回答,本系列會記錄 Agent 的執行過程、工具呼叫、輸出結果與錯誤狀態,讓原本黑盒的 Agent 行為變得可觀察。接著建立測試資料集與自動評分流程,分析 Agent 的成功率、失敗類型與穩定性。最後加入輸出格式驗證、Retry 與工具權限限制等 Guardrails,觀察這些機制是否能提升 Agent 的可靠性。透過 30 天實作,探索 AI Agent 從開發到落地前所需的測試、追蹤與驗證流程
前言 這幾年 LLM 進步很快。早期我們多半拿它來回答問題,後來開始讓它呼叫工具、查資料、操作檔案,甚至執行程式。到了這一步,它就不只是 Chatbot,而是開...
前言 Day 1 先談了為什麼 AI Agent 需要被測試、追蹤與驗證。 從今天開始進入實作。不過在 Trace、Eval、Guardrails 出現之前,我...
前言 Day 2 我們先建立了最小可用的 Agent Runner。 目前的流程是: User Task -> Agent Runner -> LL...
前言 Day 3 我們替 Agent 加上了第一個工具 calculator。 目前 Agent 已經可以根據任務呼叫工具,例如: User Task -&...
前言 Day 4 我們設計了 TraceStep 和 AgentTrace,讓 Agent 在執行時可以記錄每一步發生了什麼。 目前流程大概是: User Ta...
前言 Day 5 我們把 Agent 執行產生的 trace 存進 SQLite。 目前系統已經可以做到: Agent 執行 -> 產生 AgentT...
前言 前六天,我們從一個最小可用的 Agent Runner 開始,逐步替它加上工具呼叫、Trace 資料模型、SQLite 儲存,以及簡單的 Trace Vi...
前言 第一週我們完成了 Trace 相關的基礎建設。 目前平台已經可以回答: Agent 執行過程中發生了什麼? 透過 Trace Viewer,我們可以看...
前言 Day 8 我們先定義了 Agent Evaluation 的概念。 Evaluation 的主要想法是: 不要只手動測幾題,而是用固定測試集重複測量...
前言 Day 9 我們設計了第一版 test case 格式,並建立了前 5 筆測試案例。 一筆最小 test case 目前包含: id input expe...