改了一行 prompt、換一個模型、多接一個工具,怎麼知道沒有改壞別的地方?手動測過、看起來很成功,然後在別人手上出事 —— 這 30 天要解的就是這件事。
我會自己建一隻需求釐清 agent:讀進需求方給的雜亂 ticket,輸出結構化 ticket,並標出 AC 裡彼此衝突、不可驗證、與描述不符的那幾條。接著一層層把驗收機制建起來:可重跑的 case、寫得出對錯的 goal state、自己寫的 scorer,再讓模型當裁判,並回頭校準這個裁判。
最後手上會有一份 dataset、一支判定程式和一組上線門檻 —— 改完跑一次就知道這次有沒有改壞什麼。
任務是否完成,要檢查實際產出;覆寫前是否取得同意,要另外檢查,與參考路徑相符不能代替這兩項驗收。 需求釐清 agent 要把一張退貨流程的 ticket 整理成...
驗收安全閘,要刻意送入受限制的工具呼叫,檢查拒絕回應、攔截紀錄與資料狀態;空的紀錄檔不足以證明它正常運作。 需求釐清 agent 整理 ticket 時,可以更...
要用模型判斷 Goal 的內容,先提供原始需求與一條具體標準,讓它回傳判定及依據;欄位非空的通過結果,不能代替這項檢查。 需求釐清 agent 會把雜亂的 ti...
要知道模型裁判判得準不準,先由人確認判斷依據,分開檢查兩類誤判,修改規則後再用保留資料驗證。 需求釐清 agent 整理 ticket 時,會用一句 Goal...
改了一行 prompt,要知道結果有沒有變差,就用一個命令把整份 dataset 重跑一遍,每趟在乾淨環境裡跑、逐個欄位給分、每筆重跑同樣的次數;報表也要記下實...
要決定哪些動作不能讓 agent 直接做,就把它手上的 7 個工具逐個裁定,設 gate 的和判定不需要的都寫進同一份清單,每條裁定再配一個強制送出該呼叫的測試...
這隻需求釐清 agent 的結果門檻,要設為 16 筆 case 各跑 5 次、次次通過,並把重跑的費用與等待時間一起算進去。 需求釐清 agent 會整理 t...
改一行 prompt 後分數掉了三個百分點,先確認前後兩批納入相同的趟數,再讓兩個版本同時開跑、各跑兩批,差距要大過同一個 prompt 自己兩批的差距,兩組方...