改了一行 prompt、換一個模型、多接一個工具,怎麼知道沒有改壞別的地方?手動測過、看起來很成功,然後在別人手上出事 —— 這 30 天要解的就是這件事。
我會自己建一隻需求釐清 agent:讀進需求方給的雜亂 ticket,輸出結構化 ticket,並標出 AC 裡彼此衝突、不可驗證、與描述不符的那幾條。接著一層層把驗收機制建起來:可重跑的 case、寫得出對錯的 goal state、自己寫的 scorer,再讓模型當裁判,並回頭校準這個裁判。
最後手上會有一份 dataset、一支判定程式和一組上線門檻 —— 改完跑一次就知道這次有沒有改壞什麼。
這件事幾乎每週都在上演,而且出事的時候不會亮紅燈 —— 流程照樣跑完,只是有一件該做的事沒做。 大家應該都遇過 AI 產出不夠穩定的狀況:明明事先手動測試通過了...
AI agent 執行完之後,最常的檢查做法是檢查它的結果有沒有做正確:ticket (例如 Trello card) 最後變成什麼樣子、有疑慮的 AC 有沒有...
當修改一行給 AI Agent 的 prompt 後,Agent 出錯時不一定會報錯,即使中間出錯,Agent 還是會把整個流程照樣跑完,而它不會告訴你哪些細節...
Day 4|那我寫測試不就好了? 對一次呼叫寫 assert,抓不到的四件事 過往開發的「寫測試」常見是「餵一份輸入 data、呼叫一次 api/functio...
現在 AI 模型和兩年前相比進步非常多,公開 benchmark 上排前四名的 agent,跑一次就對的比率都在 73% 以上,榜首 78.4%。但同一張表改問...
eval、dataset、grader、scorer、harness 這五個詞裡,只有 dataset 是資料,harness 負責跑,grader 和 sco...
Day 7|一筆 case 通過的條件誰來寫?寫完誰來驗? 判斷標準要在動手改 prompt 或寫功能之前先寫下來,寫完還得再花一次力氣驗它。沒被驗過的判斷標準...