iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

30 天 AI eval 實戰:一隻 PM agent,改完之後怎麼確定它還是對的 系列

改了一行 prompt、換一個模型、多接一個工具,怎麼知道沒有改壞別的地方?手動測過、看起來很成功,然後在別人手上出事 —— 這 30 天要解的就是這件事。

我會自己建一隻需求釐清 agent:讀進需求方給的雜亂 ticket,輸出結構化 ticket,並標出 AC 裡彼此衝突、不可驗證、與描述不符的那幾條。接著一層層把驗收機制建起來:可重跑的 case、寫得出對錯的 goal state、自己寫的 scorer,再讓模型當裁判,並回頭校準這個裁判。

最後手上會有一份 dataset、一支判定程式和一組上線門檻 —— 改完跑一次就知道這次有沒有改壞什麼。

參賽天數 7 天 | 共 7 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1|手動測過了、看起來很成功,然後在別人手上出事

這件事幾乎每週都在上演,而且出事的時候不會亮紅燈 —— 流程照樣跑完,只是有一件該做的事沒做。 大家應該都遇過 AI 產出不夠穩定的狀況:明明事先手動測試通過了...

2026-09-03 ‧ 由 rara7777 分享
DAY 2

Day 2|先讓它動起來:一張雜亂無章的 ticket 進去,一張結構化的 ticket 出來

AI agent 執行完之後,最常的檢查做法是檢查它的結果有沒有做正確:ticket (例如 Trello card) 最後變成什麼樣子、有疑慮的 AC 有沒有...

2026-09-04 ‧ 由 rara7777 分享
DAY 3

Day 3|改了一行 prompt,結果運作模式整個改變,AI 也不會告知

當修改一行給 AI Agent 的 prompt 後,Agent 出錯時不一定會報錯,即使中間出錯,Agent 還是會把整個流程照樣跑完,而它不會告訴你哪些細節...

2026-09-05 ‧ 由 rara7777 分享
DAY 4

# Day 4|那我寫測試不就好了? 對一次呼叫寫 assert,抓不到的四件事

Day 4|那我寫測試不就好了? 對一次呼叫寫 assert,抓不到的四件事 過往開發的「寫測試」常見是「餵一份輸入 data、呼叫一次 api/functio...

2026-09-06 ‧ 由 rara7777 分享
DAY 5

# Day 5|是我的 agent 特別爛,還是大家都這樣?

現在 AI 模型和兩年前相比進步非常多,公開 benchmark 上排前四名的 agent,跑一次就對的比率都在 73% 以上,榜首 78.4%。但同一張表改問...

2026-09-07 ‧ 由 rara7777 分享
DAY 6

# Day 6|eval、dataset、grader、scorer、harness 這五個詞,各自負責哪一段?

eval、dataset、grader、scorer、harness 這五個詞裡,只有 dataset 是資料,harness 負責跑,grader 和 sco...

2026-09-08 ‧ 由 rara7777 分享
DAY 7

Day 7|一筆 case 通過的條件誰來寫?寫完誰來驗?

Day 7|一筆 case 通過的條件誰來寫?寫完誰來驗? 判斷標準要在動手改 prompt 或寫功能之前先寫下來,寫完還得再花一次力氣驗它。沒被驗過的判斷標準...

2026-09-09 ‧ 由 rara7777 分享