iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

從黑盒到可驗證:30 天打造 AI Agent 的 Trace、Eval 與 Guardrails 系統 系列

本系列將從零實作一套輕量級 AI Agent 測試驗證系統,聚焦於 Trace、Eval 與 Guardrails 三個核心面向。不同於只展示 Agent 最終回答,本系列會記錄 Agent 的執行過程、工具呼叫、輸出結果與錯誤狀態,讓原本黑盒的 Agent 行為變得可觀察。接著建立測試資料集與自動評分流程,分析 Agent 的成功率、失敗類型與穩定性。最後加入輸出格式驗證、Retry 與工具權限限制等 Guardrails,觀察這些機制是否能提升 Agent 的可靠性。透過 30 天實作,探索 AI Agent 從開發到落地前所需的測試、追蹤與驗證流程

參賽天數 17 天 | 共 17 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文 |團隊nutc imac
DAY 11

Day 11|實作 Batch Evaluation Runner

前言 Day 10 我們建立了第一組 Eval Dataset。 目前 evals/cases.json 裡已經有 15 筆測試案例,包含: calculat...

2026-09-25 ‧ 由 黃盈雅 分享
DAY 12

Day 12|實作最簡單的自動評分

前言 Day 11 我們完成了 Batch Evaluation Runner。 目前 runner 已經可以: 讀取 evals/cases.json -...

2026-09-26 ‧ 由 黃盈雅 分享
DAY 13

Day 13|加入 JSON 格式驗證

前言 Day 12 我們替 Batch Evaluation Runner 加上了最基本的自動評分。 目前 evaluator 已經支援兩種評分方式: exac...

2026-09-27 ‧ 由 黃盈雅 分享
DAY 14

Day 14|第二週回顧:第一份 Agent 評測報告

前言 第二週我們開始處理這個系列的第二個主題:Eval。 第一週的 Trace 讓我們可以回答: Agent 執行過程中發生了什麼? 第二週的 Eval 則開...

2026-09-28 ‧ 由 黃盈雅 分享
DAY 15

Day 15|從 Fake 到 Real:接上 Gemini Flash

前言 Day 14 我們整理了第一份 Agent 評測報告。 到目前為止,平台已經可以做到: evals/cases.json -> batch ru...

2026-09-29 ‧ 由 黃盈雅 分享
DAY 16

Day 16|定義 Agent 失敗類型,並加入評測結果

前言 Day 15 我們把 Agent 從 FakeLLMClient 接到 Gemini Flash。 接上真正的 LLM 後,evaluation resu...

2026-09-30 ‧ 由 黃盈雅 分享
DAY 17

Day 17|建立錯誤分析表格與 Failure Dashboard

前言 Day 16 我們把 evaluation result 從單純的: { "passed": false, "fai...

2026-10-01 ‧ 由 黃盈雅 分享