讀完 Claude 整理的心理計量摘要,我能不能判斷:「量表的 alpha 很高,就表示題目都在測同一個構念嗎?」如果說不出成立的條件,也找不到一個會讓答案失效的例子,名詞雖然熟了,研究判斷還沒有跟上。這是本系列的起點:大學教師需要自學陌生方法時,怎麼把快速取得的說明整理成真正能用、也能再教給學生的教材?
這裡的「用」不是在會議上說出 Cronbach's alpha、CFA 或 IRT 的全名。我要能判斷一個研究問題需要哪種測量證據,知道模型依賴哪些假設,看得出程式雖然跑完、推論卻跨過了資料能支持的邊界。更現實一點,我還要能把這些內容教給學生。摘要可以讓名詞變熟,卻沒有替我承擔這些判斷。
我把「請 AI 摘要」和「替自己做一本可學教科書」放在同一張表裡比較:
| 問題 | 一般摘要 | 可學教科書 |
|---|---|---|
| 讀完要做什麼 | 知道文章談過什麼 | 完成一個可驗收的判斷或計算 |
| 不懂時怎麼辦 | 再請 AI 解釋一次 | 回到先備知識、來源定位與 完整例題 |
| 如何知道內容正確 | 語句聽起來合理 | 主張連到原始來源、公式或可重跑程式 |
| 如何處理錯誤 | 改寫答案 | 保存 反例與失敗案例 |
| 如何交給學生 | 縮短或改簡單 | 先保留教師版證據,再做教學轉譯 |
| 下一步 | 另一份摘要 | 前一章產物成為下一章輸入 |
這張表的用途是區分兩種完成條件;它不能證明某一種形式一定帶來較好的學習成效。那需要另外的研究設計。它只指出:如果我的目標包含研究判斷、重現和教學,摘要交付的東西不夠。
最容易犯的錯,是把流暢度當成理解。假設 Claude 用三段話把信度解釋得很順,我也能在課堂上重述,這仍不能回答:「同一批題目的 alpha 很高,能不能因此宣稱量表是單一構念?」只要我說不出 alpha 的模型條件,也拿不出一個高 alpha、兩因素的反例,我的理解就還停在語言層。
這個系列不把 Claude 排除在外。相反地,我會讓它做很適合的工作:快速產生章節候選結構、比較兩個概念的說法、把公式拆成步驟、生成 R 程式骨架、提出反例候選,或把教師版內容轉成不同程度的解釋。Anthropic 對 Claude Projects 的說明指出,Project 可以保存共享的 knowledge base 與 instructions;這適合維持一套教材的共同脈絡,但「有共同脈絡」仍不等於內容已獲學術驗證。
我先給 Claude 的任務不是「寫一本心理計量教科書」,而是:
根據我提供的教材工程規格,比較摘要與可學教科書的交付差異;每個差異都要能轉成後續驗收項目,不要補入未提供的心理計量主張。
這個提示要找出的是來源、練習與章節交接三類缺口。檢查草稿時,我會特別看它有沒有把「協助查核」寫成「確保正確」。前者可以要求 Claude 列出待查處,後者則必須靠來源、計算與人的判斷才有根據。即使表格的分類完整,每一列仍要能轉成後續可實際執行的動作。
教材的章節可以先放一個需要判斷的問題,再讓直覺做法碰到困難,這時才引入方法。方法出現時,要交代資料如何產生、想估什麼、依賴哪些假設、能觀察什麼,以及如何計算和解讀。章末留下來源位置、反例與下一章要接收的結果。這些安排需要逐項設計;一句「請幫我摘要」沒有提供足夠的完成條件。
所以我把本系列的第一個產物定為一張教師學習任務單:我要在三十天內完成一套以「大學生學習投入量表」為共同案例的心理計量教材;它必須能追溯來源、重跑分析、解釋失敗,最後才轉成學生教材。Claude 負責加速探索與產生可檢查的草稿,我負責問題、證據、修正與署名。
我希望讀者看完一章後,能留下比摘要多一步的東西。例如面對剛才的 alpha 問題,至少寫出欲解釋的分數、使用的資料與模型條件,再說明這個係數還不能回答什麼。若其中一項答不出來,就回到對應來源或例題補上。這份可檢查的回答,才是下一篇要定義的完成條件。