iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

30 天 AI eval 實戰:一隻 PM agent,改完之後怎麼確定它還是對的 系列

改了一行 prompt、換一個模型、多接一個工具,怎麼知道沒有改壞別的地方?手動測過、看起來很成功,然後在別人手上出事 —— 這 30 天要解的就是這件事。

我會自己建一隻需求釐清 agent:讀進需求方給的雜亂 ticket,輸出結構化 ticket,並標出 AC 裡彼此衝突、不可驗證、與描述不符的那幾條。接著一層層把驗收機制建起來:可重跑的 case、寫得出對錯的 goal state、自己寫的 scorer,再讓模型當裁判,並回頭校準這個裁判。

最後手上會有一份 dataset、一支判定程式和一組上線門檻 —— 改完跑一次就知道這次有沒有改壞什麼。

參賽天數 28 天 | 共 28 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 21

# Day 21|路徑比對、任務成功,該用哪種評估指標?

任務是否完成,要檢查實際產出;覆寫前是否取得同意,要另外檢查,與參考路徑相符不能代替這兩項驗收。 需求釐清 agent 要把一張退貨流程的 ticket 整理成...

2026-09-23 ‧ 由 rara7777 分享
DAY 22

Day 22|攔截紀錄都是空的,安全閘真的有用嗎?

驗收安全閘,要刻意送入受限制的工具呼叫,檢查拒絕回應、攔截紀錄與資料狀態;空的紀錄檔不足以證明它正常運作。 需求釐清 agent 整理 ticket 時,可以更...

2026-09-24 ‧ 由 rara7777 分享
DAY 23

Day 23|Goal 有文字就通過,還沒檢查內容對不對

要用模型判斷 Goal 的內容,先提供原始需求與一條具體標準,讓它回傳判定及依據;欄位非空的通過結果,不能代替這項檢查。 需求釐清 agent 會把雜亂的 ti...

2026-09-25 ‧ 由 rara7777 分享
DAY 24

Day 24|AI 的判定,要和人工逐筆核對

要知道模型裁判判得準不準,先由人確認判斷依據,分開檢查兩類誤判,修改規則後再用保留資料驗證。 需求釐清 agent 整理 ticket 時,會用一句 Goal...

2026-09-26 ‧ 由 rara7777 分享
DAY 25

Day 25|改一行 prompt 之後,用一個命令重跑整份 dataset

改了一行 prompt,要知道結果有沒有變差,就用一個命令把整份 dataset 重跑一遍,每趟在乾淨環境裡跑、逐個欄位給分、每筆重跑同樣的次數;報表也要記下實...

2026-09-27 ‧ 由 rara7777 分享
DAY 26

Day 26|收不回的動作,要把 7 個工具逐個列出來

要決定哪些動作不能讓 agent 直接做,就把它手上的 7 個工具逐個裁定,設 gate 的和判定不需要的都寫進同一份清單,每條裁定再配一個強制送出該呼叫的測試...

2026-09-28 ‧ 由 rara7777 分享
DAY 27

Day 27|門檻訂成五次全過,重跑要花多少錢

這隻需求釐清 agent 的結果門檻,要設為 16 筆 case 各跑 5 次、次次通過,並把重跑的費用與等待時間一起算進去。 需求釐清 agent 會整理 t...

2026-09-29 ‧ 由 rara7777 分享
DAY 28

# Day 28|分數掉了三個百分點,先補齊缺趟,再成對比較

改一行 prompt 後分數掉了三個百分點,先確認前後兩批納入相同的趟數,再讓兩個版本同時開跑、各跑兩批,差距要大過同一個 prompt 自己兩批的差距,兩組方...

2026-09-30 ‧ 由 rara7777 分享