iT邦幫忙

2026 iThome 鐵人賽

DAY 19
0
Claude AI

研究生自救指南:30 天用 Claude Code 打造我的論文工具箱系列 第 19

Day 19|第三週回顧:資料這週,錯的代價比文獻週高很多

  • 分享至 

  • xImage
  •  

第二週回顧我說「看的不是誰犯錯,是哪個流程會讓人犯錯」。這句話這週更貼切,因為這週真的犯了一個錯——不是工具犯的,是我自己在三個月前犯的,Day 18 那件事。今天先算帳,再處理一個寫這篇的時候自己抓到的新問題。

四個工具,一張表
工具 這週用了幾次 一次省下(估) 出錯幾次 還在用嗎
Day 14 清理腳本 3(規則改了兩次重跑) 首次建置約 2 小時,重跑幾乎為零 2(反向做兩次、全體平均補值) 是
Day 15 SPSS 匯出 2 首次約 1.5 小時(對比手動一個下午),重跑幾秒 2(missing_ranges 格式錯、忘記設遺漏值代碼) 是
Day 16 表一 2 首次約 1 小時,重跑幾秒 2(分母未排除遺漏值、小數位數不一致) 是
Day 17 圖表 1 約 1 小時(含挑色票、核對灰階) 1(色盲安全色票灰階亮度太接近) 是
省下的時間看起來比第二週好看,但這週的「省下」意義不太一樣:文獻週省的是重複勞動的時間,這週省的更多是因為有腳本可以重跑,所以規則改了不用整批重做。Day 14 的清理規則這週改了兩次(遺漏值門檻、離群值範圍),如果是手動在 Excel 裡拉公式,兩次修改大概各要一個晚上;因為是腳本,兩次都是改規則檔、重跑,幾分鐘的事。

老實算:這週真正的成本不是時數
Day 18 那件事沒有出現在上面的表格裡,因為它不是這週發生的,是三個月前的舊帳,這週只是把它寫出來、把補救措施做完整。但它必須被算進這週的帳,理由是:它是這四個工具會存在的原因。 沒有那次教訓,我不會在 Day 4 訂下 raw 唯讀的規則,這週的清理腳本也不會堅持「只從 01_renamed.csv 讀、不動前面」。

所以這週真正的成本,不是建工具花的那幾個小時,是三個月前那次沒有留下任何紀錄可以回溯的下午。這個成本沒辦法用小時計算,因為代價不是「多花時間」,是「差一點失去重來的機會」。這件事我想留在這裡提醒自己:工具箱省下的時間,永遠比不上一次不可逆的錯誤所需要的代價。

寫這篇回顧時,抓到一個新問題
檢查 Day 16 和 Day 17 兩篇的時候,我發現一個不一致:Day 16 的表一,算性別百分比時把遺漏值(拒答)排除在分母外;但 Day 17 的圖表,算倦怠總分平均數的時候,是對全部 279 筆算的,沒有排除 Day 14 標記為 bo_missing_flag 的那 6 筆——那 6 筆是遺漏題數超過門檻、沒有補值的受試者,他們的加總分其實是不完整的,不該被當成正常分數算進平均。

這是同一週、同一批資料,兩支不同的腳本用了不一致的排除邏輯。原因很直接:Day 16 的規格檔明文寫了「排除遺漏值」這條規則,Day 17 的規格檔只管配色和字型,沒有提到資料要不要篩選——規則沒寫,工具就不會做。

這件事我還沒有重新跑過圖表去修正,先誠實記在這裡,列進本週待辦:任何會計算描述統計的規格檔,都要明文寫排除規則,不能假設「反正資料清理那邊已經處理過了」。 這跟 Day 16 那句「遺漏值代碼設對,不代表用到它的每一支程式都記得排除它」是同一個教訓,這次換我自己在系列裡示範了一次。

哪些還是得人做
這週四個工具做的事情,共同點是:規則寫清楚、可驗證、可重跑的部分,交給腳本;規則本身怎麼訂,還是我。

遺漏值的門檻(超過幾題算缺失)、離群值的合理範圍——這些數字是我跟老師討論定的,工具只負責照著算。
表一要放哪些變項、要不要放倦怠總分——這是我的判斷,不是工具能決定的。
圖表配色的亮度門檻(0.15)——這是我自己抓的經驗值,沒有標準答案。
最根本的一件事:要不要讓 AI 直接碰資料。 這條線我整週守得很緊,AI 只寫碰資料的程式,不直接動資料本身,而且程式我要讀得懂才跑。
上週留下的問題,這週的答案
中文文獻查證怎麼辦(Day 12)。 還沒做,這週全部時間都在資料上,下週回文獻的部分再處理。

老師要不要知道我用這些工具(Day 12)。 這週有一次機會可以講,但沒講。倒是 Day 18 那件事讓我意識到,如果我早點跟老師坦白說「我在清理階段用腳本,而且腳本的每一步都有紀錄」,也許三個月前那次會更早被發現——因為腳本會留下清理前後的版本,不會像我當初那樣,資料被覆蓋了都不知道。這件事我打算下次 meeting 提。

語氣被改肯定的錯,還是抓不到(Day 12)。 這週沒有新進展,這是文獻工具的問題,資料工具目前沒有類似情況——資料是數字,沒有語氣可以被改。

三個新的、還沒有答案的問題
規格檔要多細,才不會再出現 Day 16/Day 17 那種不一致。 每支腳本各自的規格檔已經讓規則變透明,但「排除遺漏值」這種跨腳本共用的規則,寫在每個規格檔裡容易漏、寫成共用檔案又要處理版本同步。這個結構問題我還沒想清楚。

Google 試算表的版本記錄能保留多久,我需要一個更可靠的答案,而不是「這次剛好還在」。 我打算去查清楚版本記錄的保留政策,如果不夠可靠,之後每次問卷關閉都要更早做匯出跟備份的動作,Day 18 的三層防線可能還要再加一層。

分析階段(相關、迴歸、Cronbach's α)要不要也寫成腳本。 Day 15 說這些目前手動在 SPSS 做,這週做完資料整理的四個工具之後,我更確定「規則明確、可驗證、可逆」這條判準在分析階段一樣適用,但分析階段的判斷成分更高,這條線要畫在哪,我還沒決定,可能要等真的開始跑分析才會有答案。

下週
第四週回到寫作與整合:文獻回顧段落草稿、把生成語感改回人話、口試模擬、修訂追蹤,最後把前三週的工具串成一條從資料到論文的流水線。

Day 20:文獻回顧段落草稿生成——以及為什麼我不會直接把它貼進論文。


上一篇
Day 18|沒有「回頭」這個選項:我在原始資料上直接動手的那三個月
下一篇
Day 20|文獻回顧段落草稿:它寫的每一句都對,合起來卻什麼都沒說
系列文
研究生自救指南:30 天用 Claude Code 打造我的論文工具箱21
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言