昨天先訂出五項驗收標準,今天馬上遇到第一個現實問題:如果需求本身寫得像猜謎,AI 再聰明也可能交出一份「看起來對、其實沒對題」的成果。
所以 Day 2 不急著追求更厲害的提示詞,而是先做一件比較樸素、卻很有效的事:把「我想要什麼」翻成「我要怎麼確認它真的完成」。
最近在整理 Power Apps 的個人品牌商品管理 App 時,我碰到的修改需求很具體:
把這些濃縮成「幫我把畫面調好看一點」,人類或許能靠上下文猜到七八成,AI 卻很可能只改顏色、字體和間距,然後很有自信地說完成。
問題不一定是 AI 偷懶,而是「好看一點」沒有明確終點。
我把每一項需求拆成五欄:
| 欄位 | 要回答的問題 | 這次的例子 |
|---|---|---|
| 畫面 | 在哪裡修改? | 商品管理畫面 |
| 物件 | 要改哪個元件? | 香水類型下拉選單 |
| 屬性/動作 | 具體改什麼? | NoSelectionText |
| 預期結果 | 完成後要看到什麼? | 顯示「請選取香水類型」 |
| 驗證證據 | 怎麼證明完成? | 重新開啟畫面,未選取時可見指定文字 |
這張表的重點,不是把簡單事情寫得很官僚,而是把模糊形容詞改成可以觀察的結果。
例如:
這次我沒有假裝跑出漂亮的效率數據,而是先用既有需求做一次紙上測試。結果發現三個常見問題。
一大段話同時塞版面、功能、儲存與匯出,AI 很容易抓到前半段,漏掉最後兩項。修正方式是:一個條件一行,並替每一行編號。
「設定 NoSelectionText」是動作;「未選取時顯示指定文字」才是結果。兩者都寫,才能避免屬性填了卻沒有真的生效。
如果回覆只有「已修改」,我仍然不知道它改了哪裡。比較可驗收的交付,至少要附上:
不能確認,就應該說不能確認。這句話有時比「全部完成」更有價值。
把今天的驗收單放回系列的五項框架:
其中今天最關鍵的是「完整性」。因為 AI 最危險的錯,不一定是做錯,而是漏做了,卻沒有提醒你它漏了。
下次交代 ChatGPT 或 Codex 時,可以先貼這段:
請先把我的需求整理成驗收清單,每項包含位置、物件、修改內容、預期結果與驗證方式。完成後逐項回報:已完成、未完成或無法確認,並附上可檢查的證據。不要把「已產出」當成「已驗收」。
這個格式可以套在 App、競賽企畫、問卷、簡報或 Word 文件上。工具會變,驗收的邏輯不太會變。
今天的答案很簡單:AI 有做,不代表有照題目做;有照題目做,也不代表每一題都做完。
先把需求變成清單,再讓 AI 工作,最後依同一張清單驗收。這樣做不保證零錯誤,但至少能讓錯誤有地方被看見。
明天我會繼續追問:驗收條件寫好了,怎麼分辨哪些能交給 AI 自查,哪些一定要由人親手確認?
啊突然想到!驗收清單還可以多一欄「誰來驗」。文字格式、欄位是否存在,適合先讓 AI 自查;畫面好不好懂、內容能不能交付,最好由人再走一次。把責任寫清楚,就不會大家都以為別人驗過了。
這次整理 Power Apps 才真的感受到,需求小到一句提示文字、圖片往下一點,都可能被整齊的畫面掩蓋。以前我會看一眼覺得差不多,現在會逐項對課堂筆記;不是變龜毛,是不想在匯出前才發現漏了一格。
好奇大家最常遇到哪種「有做但沒照題目」?是漏掉格式、少做一個功能,還是內容很完整卻答非所問?如果只能挑一項放進 AI 驗收清單,你會先防哪個坑?