iT邦幫忙

2026 iThome 鐵人賽

DAY 3
0

昨天我把模糊需求拆成驗收清單,今天接著問一個更危險的問題:清單寫好了,可以直接叫 AI 自己驗自己嗎?

這就像考生交卷後,老師說:「答案你自己改,分數也自己填。」不是完全沒用,但如果最後每一題都被圈成滿分,這張考卷大概只剩情緒價值。

今天的問題:AI 能不能當自己的驗收員?

我拿昨天的文章與 Power Apps 驗收清單做一輪示範自查。任務很簡單:

請依正確性、完整性、可追溯性、可使用性、人工修正成本逐項檢查,並說明證據。

AI 很快就能確認文章有標題、小標、表格、五項框架,也能找到「請選取香水類型」、頁尾、圖片位置、儲存與匯出等需求。

但真正關鍵的不是它找到什麼,而是它無法證明什麼

例如,文章寫了下拉選單要顯示指定文字,AI 可以確認這句需求存在,卻不能只靠文章證明 App 裡真的設定成功;它能判斷文字看起來清楚,卻不能代表第一次使用的人一定看得懂。

如果把「有寫到」誤當成「有做到」,自查就會從驗收變成自我安慰。

我把驗收分成紅黃綠三區

綠燈:適合先讓 AI 自查

這類項目有明確答案,容易重複檢查:

  • 標題、段落、指定欄位是否存在
  • 字數、格式、檔名是否符合規定
  • 問卷百分比能否重新計算
  • 表格是否有空白、重複或異常值
  • 公式、連結與檔案能否正常開啟
  • 需求清單是否逐項回報

ChatGPT 適合檢查文字、邏輯與清單;Codex 適合實際讀取檔案、執行公式、查看結構或測試功能。這些工作不是百分之百不會錯,但很適合先用機器篩掉低階問題。

黃燈:AI 先查,人類抽查

這些項目有依據,卻需要情境判斷:

  • 問卷數據是否真的支持結論
  • 市場資料是否過期或引用錯對象
  • 企畫策略能否接回競賽題目
  • 圖表是否誠實呈現差異
  • 簡報頁面是否一致又不無聊

做法不是全盤相信,也不是每個字重做。可以請 AI 標出高風險處,再由人抽查原始資料與關鍵結論。

紅燈:一定要由人確認

這些事情不能只靠自動勾選:

  • 是否洩露不該公開的資料
  • 競賽提案是否真的符合評審情境
  • 訪談或問卷是否被過度解讀
  • 內容會不會讓真人誤會
  • 最終交付、發布與重要決策

AI 可以提醒,但責任不能外包。

今天抓到的三個自查漏洞

第一個漏洞是把文字存在當成成果存在。修正方式:要求附上畫面、計算過程、檔案位置或測試結果。

第二個漏洞是不確定也硬給結論。修正方式:答案只能使用「已驗證、合理推測、無法驗證」三種狀態,不准全部寫完成。

第三個漏洞是自己訂標準、自己宣布及格。修正方式:驗收條件必須在任務開始前先固定,不能看到成果後才偷偷放寬。

五項框架再驗一次

查核項目 AI 適合做什麼 人要補什麼
正確性 重算、比對、找矛盾 核對原始資料與情境
完整性 逐項掃描需求 確認需求本身沒有漏
可追溯性 整理來源與對照表 判斷來源是否可信
可使用性 檢查格式與操作步驟 請真人實際使用
人工修正成本 記錄錯誤與修改項目 評估時間是否真的省下

這張表讓我更確定:AI 很適合當第一層濾網,但不適合獨占最後一個印章。

可直接使用的自查指令

請依驗收清單逐項檢查,每項只能標記「已驗證、合理推測、無法驗證」。已驗證必須附證據;合理推測要說明假設;無法驗證要列出需要人工確認的步驟。最後不要自行宣布整體完成。

這句「不要自行宣布整體完成」很重要。我要的不是一份充滿綠色勾勾的報告,而是一張真的能幫我找到風險的地圖。

今日結論

AI 可以自己改考卷,但不能自己決定畢業。

最有效率的做法,是讓 ChatGPT 或 Codex 先處理可計算、可搜尋、可重複的檢查,再把需要情境、責任與真人感受的部分交回人手上。AI 負責把問題找快一點,人類負責決定這個答案能不能真的拿去用。

明天,我要繼續驗收另一個常被忽略的地方:AI 附了來源,就代表資料可靠嗎?


上一篇
Day 2|AI 有做完,但真的有照題目嗎?
系列文
《AI 說完成,我偏要驗收:ChatGPT × Codex 的 30 天成果查核實驗》3
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中
0
lin1015
iT邦新手 5 級 ‧ 2026-09-12 12:33:09

對了,剛剛漏講一招:不必每次都從頭人工重驗,可以先請 AI 標出「無法驗證」與「高風險」項目,再抽查其餘內容。省時間的關鍵不是少檢查,而是把人工留給最需要判斷的地方。

0
lin1015
iT邦新手 5 級 ‧ 2026-09-12 12:33:19

我參加過不少競賽後才發現,企畫排版整齊、章節齊全,只能算第一關。真正容易失分的往往是策略沒有接回題目,或數據看似合理卻支撐不了結論。這種判斷,我到現在都不敢只交給 AI 自己打勾。

0
lin1015
iT邦新手 5 級 ‧ 2026-09-12 12:33:29

如果只能選一項,你最不放心讓 AI 自己驗收什麼?是數據、引用來源、企畫邏輯、程式功能,還是文章公開後會不會被誤解?想看看大家心中的「人工必驗區」是不是一樣。

我要留言

立即登入留言