iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

從黑盒到可驗證:30 天打造 AI Agent 的 Trace、Eval 與 Guardrails 系統 系列

本系列將從零實作一套輕量級 AI Agent 測試驗證系統,聚焦於 Trace、Eval 與 Guardrails 三個核心面向。不同於只展示 Agent 最終回答,本系列會記錄 Agent 的執行過程、工具呼叫、輸出結果與錯誤狀態,讓原本黑盒的 Agent 行為變得可觀察。接著建立測試資料集與自動評分流程,分析 Agent 的成功率、失敗類型與穩定性。最後加入輸出格式驗證、Retry 與工具權限限制等 Guardrails,觀察這些機制是否能提升 Agent 的可靠性。透過 30 天實作,探索 AI Agent 從開發到落地前所需的測試、追蹤與驗證流程

參賽天數 17 天 | 共 17 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文 |團隊nutc imac
DAY 1

Day 1|為什麼 AI Agent 需要被測試?

前言 這幾年 LLM 進步很快。早期我們多半拿它來回答問題,後來開始讓它呼叫工具、查資料、操作檔案,甚至執行程式。到了這一步,它就不只是 Chatbot,而是開...

2026-09-15 ‧ 由 黃盈雅 分享
DAY 2

Day 2|建立最小可用 Agent Runner

前言 Day 1 先談了為什麼 AI Agent 需要被測試、追蹤與驗證。 從今天開始進入實作。不過在 Trace、Eval、Guardrails 出現之前,我...

2026-09-16 ‧ 由 黃盈雅 分享
DAY 3

Day 3|替 Agent 加上第一個工具

前言 Day 2 我們先建立了最小可用的 Agent Runner。 目前的流程是: User Task -> Agent Runner -> LL...

2026-09-17 ‧ 由 黃盈雅 分享
DAY 4

Day 4:設計 Trace:記錄 Agent 每一步

前言 Day 3 我們替 Agent 加上了第一個工具 calculator。 目前 Agent 已經可以根據任務呼叫工具,例如: User Task -&...

2026-09-18 ‧ 由 黃盈雅 分享
DAY 5

Day 5|把 Trace 存進 SQLite

前言 Day 4 我們設計了 TraceStep 和 AgentTrace,讓 Agent 在執行時可以記錄每一步發生了什麼。 目前流程大概是: User Ta...

2026-09-19 ‧ 由 黃盈雅 分享
DAY 6

Day 6|建立簡單 Trace Viewer

前言 Day 5 我們把 Agent 執行產生的 trace 存進 SQLite。 目前系統已經可以做到: Agent 執行 -> 產生 AgentT...

2026-09-20 ‧ 由 黃盈雅 分享
DAY 7

Day 7|第一週回顧:Agent 不再是黑盒

前言 前六天,我們從一個最小可用的 Agent Runner 開始,逐步替它加上工具呼叫、Trace 資料模型、SQLite 儲存,以及簡單的 Trace Vi...

2026-09-21 ‧ 由 黃盈雅 分享
DAY 8

Day 8|什麼是 Agent Evaluation?

前言 第一週我們完成了 Trace 相關的基礎建設。 目前平台已經可以回答: Agent 執行過程中發生了什麼? 透過 Trace Viewer,我們可以看...

2026-09-22 ‧ 由 黃盈雅 分享
DAY 9

Day 9|設計 Test Case 格式

前言 Day 8 我們先定義了 Agent Evaluation 的概念。 Evaluation 的主要想法是: 不要只手動測幾題,而是用固定測試集重複測量...

2026-09-23 ‧ 由 黃盈雅 分享
DAY 10

Day 10|建立第一組 Eval Dataset

前言 Day 9 我們設計了第一版 test case 格式,並建立了前 5 筆測試案例。 一筆最小 test case 目前包含: id input expe...

2026-09-24 ‧ 由 黃盈雅 分享