iT邦幫忙

2026 iThome 鐵人賽

DAY 7
1

AI 幫忙整理資料很快,但資料一多,我不可能每個儲存格都從頭看完。問題來了:只抽查幾筆,真的驗得出問題嗎?如果剛好抽到三筆都正常,會不會只是運氣很好?

今天不用真實研究資料,而是用一份明確標示的示範資料來測:假設有一張活動問卷表,包含年級、參與次數、滿意度與文字意見,請 AI 協助統一格式、標示缺漏。示範資料刻意放入空白值、超出範圍的分數、重複列,以及格式不同的日期。

隨機抽查不夠,還要挑「容易出事的」

如果只隨機看三筆,有機會全部正常。因此我把抽查分成三層:

  1. 隨機樣本:檢查一般資料有沒有被意外改壞。
  2. 邊界樣本:專看最小值、最大值、空白、超長文字。
  3. 異常樣本:專看重複、格式不一、邏輯衝突的資料。

這不是宣稱抽幾筆就能證明整份資料百分之百正確,而是用有限時間優先碰高風險位置。

驗收不能只看最後的乾淨表格

AI 若把空白值補成 0,畫面會變整齊,意思卻可能完全不同;「沒有填答」不等於「參與零次」。若它刪掉重複資料,也要確認那是真重複,還是兩位受訪者剛好答案相同。

因此我要求保留三份資訊:原始值、處理後的值、處理理由。再套用五項查核:

項目 驗收問題
正確性 數值與文字是否被錯改
完整性 缺漏、異常與重複是否都有標記
可追溯性 能否從處理結果找回原始列
可使用性 整理後能否直接進 Excel、SPSS 或圖表流程
人工修正成本 要重做多少筆、查多少處理紀錄

這次示範抓到的典型錯誤

第一種是「好心補值」:AI 把缺漏填成看似合理的數字,卻沒有說明依據。第二種是「過度統一」:日期格式統一了,但無法判斷日月順序的資料也被強行轉換。第三種是「重複誤刪」:只因答案相同,就當成同一筆。

修正方式是把任務改成「只標示、不自行決定」:可確定的格式轉換才執行;需要研究判斷的項目另外列入待確認清單。

我的抽查清單

  • 至少一筆正常資料,確認沒有誤傷。
  • 每種邊界情況至少一筆。
  • 每種異常規則至少一筆。
  • 處理前後筆數是否合理。
  • 隨機回查幾筆原始資料。
  • 每項自動修改是否留下原因。

今日結論

抽查不是少看幾筆就算了,而是要讓樣本代表不同風險。AI 可以幫我找異常、做格式整理,但它不能替研究者決定空白代表什麼、哪些資料該刪。抽得少沒關係,不能抽得毫無策略;比起只看三筆正常值,我更願意看一筆正常、一道邊界和一個最可疑的地方。


上一篇
Day 6|提示詞改一行,答案差一大截
下一篇
Day 8|先看評分表,別讓創意裸奔
系列文
《AI 說完成,我偏要驗收:ChatGPT × Codex 的 30 天成果查核實驗》14
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中
0
lin1015
iT邦新手 5 級 ‧ 2026-09-16 10:21:57

對了,抽查前可以先做一張「風險地圖」:哪些欄位會影響結論、哪些格式最容易混亂、哪些值一錯就會連帶影響圖表。高風險欄位多抽,純顯示用欄位少抽,時間會花得更值得。

0
lin1015
iT邦新手 5 級 ‧ 2026-09-16 10:22:14

我用 Excel、SPSS 整理資料時,最有壓力的不是公式報錯,而是表格看起來完全正常。這也是我現在會保留原始檔、不直接覆蓋的原因;有處理紀錄,才有機會回頭找出是哪一步改壞了。

0
lin1015
iT邦新手 5 級 ‧ 2026-09-16 10:22:32

如果你只能抽查資料的三個地方,會挑隨機三筆,還是專看空白、極端值和重複資料?也想知道大家遇過最難發現的資料錯誤是哪一種。

謝謝 lin1015!這問題問得好——與其背死數字,不如讓 runtime 自己坦白。

我會建議讀者寫個極簡的「探針迴圈」:單純迴圈 append 到 10,000 筆,只要偵測到當前 cap 改變,就印出 (舊 cap -> 新 cap, 增長倍率)。讀者在自己本地一跑,就能親眼看到 Go 或 Python 在當前版本真實的擴容階梯。

這剛好能無縫接上你 Day 7 的思維:

  • 邊界樣本:剛好對齊實驗測出的跳變門檻(如 Go 的 256 臨界點前後一格)。
  • 異常樣本:測多個 sub-slice 悄悄共用 backing array 互相覆寫的隱蔽雷區。

這也讓我很好奇:像「官方在 minor version 偷偷改了擴容常數」這種表格看起來完全正常、底層邏輯卻變了的狀況,在你的抽查策略裡會歸進哪一層?還是得開獨立的一層版本契約測試來抓?

我要留言

立即登入留言