昨天我把模糊需求拆成驗收清單,今天接著問一個更危險的問題:清單寫好了,可以直接叫 AI 自己驗自己嗎?
這就像考生交卷後,老師說:「答案你自己改,分數也自己填。」不是完全沒用,但如果最後每一題都被圈成滿分,這張考卷大概只剩情緒價值。
我拿昨天的文章與 Power Apps 驗收清單做一輪示範自查。任務很簡單:
請依正確性、完整性、可追溯性、可使用性、人工修正成本逐項檢查,並說明證據。
AI 很快就能確認文章有標題、小標、表格、五項框架,也能找到「請選取香水類型」、頁尾、圖片位置、儲存與匯出等需求。
但真正關鍵的不是它找到什麼,而是它無法證明什麼。
例如,文章寫了下拉選單要顯示指定文字,AI 可以確認這句需求存在,卻不能只靠文章證明 App 裡真的設定成功;它能判斷文字看起來清楚,卻不能代表第一次使用的人一定看得懂。
如果把「有寫到」誤當成「有做到」,自查就會從驗收變成自我安慰。
這類項目有明確答案,容易重複檢查:
ChatGPT 適合檢查文字、邏輯與清單;Codex 適合實際讀取檔案、執行公式、查看結構或測試功能。這些工作不是百分之百不會錯,但很適合先用機器篩掉低階問題。
這些項目有依據,卻需要情境判斷:
做法不是全盤相信,也不是每個字重做。可以請 AI 標出高風險處,再由人抽查原始資料與關鍵結論。
這些事情不能只靠自動勾選:
AI 可以提醒,但責任不能外包。
第一個漏洞是把文字存在當成成果存在。修正方式:要求附上畫面、計算過程、檔案位置或測試結果。
第二個漏洞是不確定也硬給結論。修正方式:答案只能使用「已驗證、合理推測、無法驗證」三種狀態,不准全部寫完成。
第三個漏洞是自己訂標準、自己宣布及格。修正方式:驗收條件必須在任務開始前先固定,不能看到成果後才偷偷放寬。
| 查核項目 | AI 適合做什麼 | 人要補什麼 |
|---|---|---|
| 正確性 | 重算、比對、找矛盾 | 核對原始資料與情境 |
| 完整性 | 逐項掃描需求 | 確認需求本身沒有漏 |
| 可追溯性 | 整理來源與對照表 | 判斷來源是否可信 |
| 可使用性 | 檢查格式與操作步驟 | 請真人實際使用 |
| 人工修正成本 | 記錄錯誤與修改項目 | 評估時間是否真的省下 |
這張表讓我更確定:AI 很適合當第一層濾網,但不適合獨占最後一個印章。
請依驗收清單逐項檢查,每項只能標記「已驗證、合理推測、無法驗證」。已驗證必須附證據;合理推測要說明假設;無法驗證要列出需要人工確認的步驟。最後不要自行宣布整體完成。
這句「不要自行宣布整體完成」很重要。我要的不是一份充滿綠色勾勾的報告,而是一張真的能幫我找到風險的地圖。
AI 可以自己改考卷,但不能自己決定畢業。
最有效率的做法,是讓 ChatGPT 或 Codex 先處理可計算、可搜尋、可重複的檢查,再把需要情境、責任與真人感受的部分交回人手上。AI 負責把問題找快一點,人類負責決定這個答案能不能真的拿去用。
明天,我要繼續驗收另一個常被忽略的地方:AI 附了來源,就代表資料可靠嗎?
對了,剛剛漏講一招:不必每次都從頭人工重驗,可以先請 AI 標出「無法驗證」與「高風險」項目,再抽查其餘內容。省時間的關鍵不是少檢查,而是把人工留給最需要判斷的地方。
我參加過不少競賽後才發現,企畫排版整齊、章節齊全,只能算第一關。真正容易失分的往往是策略沒有接回題目,或數據看似合理卻支撐不了結論。這種判斷,我到現在都不敢只交給 AI 自己打勾。
如果只能選一項,你最不放心讓 AI 自己驗收什麼?是數據、引用來源、企畫邏輯、程式功能,還是文章公開後會不會被誤解?想看看大家心中的「人工必驗區」是不是一樣。