如果一篇 CFA 文章有 3,000 字、模型圖、R 程式和三篇文獻,卻把高配適度寫成「三構念已被證實」,這篇算完成嗎?這個例子讓昨天的教師學習任務變得具體:我要訂的完成條件,必須能擋下這類看起來齊全、判斷卻越界的稿件。今天先從一個可驗收的動作開始,再把它擴成整篇文章的檢查方式。
如果不先回答,Claude 的速度反而會製造麻煩。它可以在同一下午產生五個版本:長版、短版、條列版、給大學生的版本、附 R 程式的版本。每一份看起來都像成果,卻沒有一個共同標準告訴我該停在哪裡。最後最常見的判準只剩「內容很多」或「讀起來順」,這兩項都不能保護教材免於錯誤。
可以先請 Claude 草擬「學會一個心理計量方法」的完成條件,再檢查它用的動詞。若清單只有「理解核心概念、掌握應用情境、正確解釋結果」,還看不出讀者要交什麼。兩個人都可以說自己理解信度,其中一人能說出 alpha 的條件,另一人卻只記得 0.7。條件要分得出這兩種情況。
我把每個抽象動詞改成可留下證據的動作:
| 模糊完成條件 | 可驗收版本 | 可保存的證據 |
|---|---|---|
| 理解構念 | 能用一個題目反例說明 response 不等於 construct | 反例卡 |
| 掌握 CTT | 能定義重複測量條件並手算一次變異分解 | 計算頁 |
| 會看信度 | 能比較 alpha 與 omega 的條件,不以單一係數判定量表品質 | 決策表 |
| 會做 CFA | 能把理論限制寫成語法、執行並說明 fit 不能證明什麼 | 模型卡 |
| 會比較群體 | 能說明 configural、metric、scalar 各允許哪種比較 | 恆等性階梯 |
| 會做 IRT | 能代入 2PL 並解釋 item information 的局部性 | ICC 與手算表 |
| 能教學生 | 能把教師版主張映射到學習單,保留證據邊界 | 版本對照表 |
這個表是今天的主要媒介。它把不可觀察的「懂」拆成作品與行為;它仍不能單獨證明長期保留、遷移或教學效果。要回答那些問題,需要延宕測驗、不同任務與學生資料,而本系列不會假裝已經做過。
我把完成條件分成四層。第一層是內容:文章有明確問題、必要概念、完整例題、反例 和限制。第二層是證據:核心主張有第一手來源或可重現計算,來源帶有頁碼、章節或段落定位。第三層是協作:文中看得出 Claude 做了什麼,也看得出教師如何查核與改寫。第四層是系列:今天的產物真的被下一篇接走,術語與共同案例沒有偷偷換版本。
這四層可以形成一個由外向內的完成漏斗:
有文章
└─ 有可學的問題與例子
└─ 有可追溯、可重做的證據
└─ 有人工裁決與跨篇交接
└─ verified
漏斗的用途不是讓寫作看起來工程化,而是避免一個常見錯誤:把「檔案存在」誤認為「教材完成」。最外層很容易由 AI 產生,愈往內,教師的責任愈重。
只有正面條件不夠。我拿一篇假想的 CFA 文章做壓力測試:正文 3,000 字、有模型圖、有 lavaan 程式,也引用三篇文獻;但作者把 CFI 很高寫成「三構念已被證實」,程式沒有交代 estimator,資料版本也不明。若完成條件只看字數、圖片與引用數,這篇會通過。若檢查「推論邊界」「可重現輸入」與「主張定位」,它會停在 draft。
第二個失敗案例更微妙:文章統計上沒有明顯錯誤,但和前一篇使用不同的 BE03 題目文字。單篇閱讀不一定發現,集結成書時卻會讓 CFA、IRT 與學生學習單對不到同一個指標。這就是為何系列一致性本身也是完成條件。
把這兩個案例交給 Claude 時,可以要求它逐條引用完成條件,再說明通過或失敗。若它把「有三篇來源」判為足夠,就追問哪一篇、哪一段支持哪一句話。驗收的單位是主張與證據的對應關係;文獻數量只能當清單資訊。這種問法也讓教師看得出模型漏查的是定位、條件,還是整個推論。
為了讓完成條件能實際運作,本系列只使用四個狀態:outline 表示依賴、來源種子與產物已定義;draft 表示正文存在但仍有關卡未通過;verified 表示這個版本已通過來源、篇幅、媒介、協作、查核與交接;published 則表示作者已人工發布並記錄公開網址。verified 不是永遠正確,也不等於同儕審查,它只是對一個版本負責。
今天的 完整例題 是把「會做 CFA」改寫成模型卡;反例是那篇把 fit 寫成證明的文章。兩者共同說明,完成條件要能接受具體輸入、產生一致判定。若規則只能在成功範例上使用,它還不是規格,只是願望。
這份教材完成條件(Definition of Done)要求:每篇文章必須同時通過內容、證據、協作與系列四層關卡,才可從 draft 進入 verified。這解決了何時停止生成、開始負責的問題;它尚未回答我是否具備閱讀心理計量所需的數學與統計先備知識。
基礎閱讀可先看本系列的每日文章;發展閱讀是 2014 年《Standards for Educational and Psychological Testing》對分數解釋、信度與使用責任的安排;研究閱讀則要進一步看各方法的原始論文。下一篇會用這份完成條件反過來設計先備診斷:不是問我看過哪些名詞,而是看我在哪個依賴節點會卡住。
我還加了一條停止規則:若文章已通過所有關卡,新增加的段落卻沒有改變讀者的判斷、證據或操作,就不再為了接近整數字數而擴寫。篇幅是負載預算,不是內容品質的代理變項。相反地,若篇幅不足,先找缺的是例題、反例、查核還是邊界,而不是補一段「AI 很重要」的背景。這條規則會在最後的全系列字數稽核再次使用。
以「會做 CFA」這列為例,讀者可先交一份只有模型語法的小卡,再補上估計方法、資料版本與結果限制。每補一項,都能回答一個先前無法回答的問題;如果只是多寫一段介紹,卻仍找不到資料或判斷依據,就還沒完成這列。下一篇會反過來問:要交出這張卡,我目前缺少哪個先備概念?