兩位學生同樣得到 36 分,他們的真分數也相同嗎?先別看解答,試著寫下你會把哪些情境視為「重複測量」。這道題讓我檢查,自己只是記得古典測驗理論的公式,還是能說明公式裡的量。昨天訂出的完成條件,到這裡變成一個自學前就能動手做的小任務。
傳統的先備盤點常問「你學過統計嗎」「你知道因素分析嗎」。這類自陳題資訊太少。有人修過課卻不會解釋共變異,也有人沒修過心理計量,卻熟悉潛在變項模型。更好的問題是:為了完成 Day 11–20 的作品,我必須先能做哪些較小的工作?
我先把心理計量主線拆成五種能力,而不是一串名詞:
| 能力 | 最小診斷任務 | 後續會卡住的地方 |
|---|---|---|
| 機率與期望 | 解釋「重複測量下的期望」不是某人的理想分數 | CTT 真分數 |
| 變異與共變異 | 由小型共變異矩陣說出哪些題目一起變動 | 信度、因素分析 |
| 線性模型 | 區分觀察量、參數、殘差與限制 | CFA、恆等性 |
| logistic 函數 | 代入能力、難度與鑑別度計算作答機率 | 2PL、CAT |
| 研究推論 | 區分估計結果、模型條件與分數用途 | 效度、所有方法邊界 |
這張矩陣不拿來替教師貼上「程度不足」的標籤。它的用途是安排補橋順序;它也不是標準化診斷測驗,沒有常模、信度或分類準確率證據。用心理計量語言說,這只是課程設計工具,不能反過來被包裝成一份正式量表。
用下表設計診斷時,我會給 Claude 這樣的任務:每種能力各產生一題,不靠術語記憶,可以在十分鐘內回答;先列題目,答案與常見錯誤另外保存。本文用來示範的題目是:
兩位學生同樣得到 36 分。這是否表示兩人的「真分數」相同?請先說明你把哪些情境視為重複測量,再回答。
這題逼我先定義隨機實驗。若我只是背過 X=T+E,很可能立刻回答相同;但 CTT 的真分數概念和指定的測量程序、作答條件與重複分布有關。觀察到同分,不足以推出兩人的期望相同。
批改時要小心「真分數是排除誤差後的能力」這種說法。它容易讓人以為學生身上藏著一個能被直接找出的純能力,也省略了重複程序。查核應回到 Lord 與 Novick 對真分數的定義,並要求答案能用期望值表達;書目頁只能確認書籍身分,定義與條件仍須查原章節。
我實際保留五題:
y = λη + ε 中標示觀察量、潛在變項、loading 與 residual,並指出需要固定尺度的原因。a=1.2, b=0.5, θ=0.5 時判斷 2PL 作答機率在 0.5 的哪一側,不使用軟體。使用這五題時,先手答,再讓 Claude 依事先寫好的驗收規準指出缺口。如果先讀模型答案,作答便混入提示效果,無法看出原本會在哪裡卡住。下面兩個地方尤其值得追問:次序尺度題目進入相關與因素模型時,估計方法會受資料尺度影響;IRT 的識別與尺度設定,也需要說明固定了什麼。這是建議的診斷重點,本文沒有據此報告一份已施測的能力測量結果。
假設 Claude 看到我不熟 IRT,建議依序閱讀 Rasch、1PL、2PL、3PL、GRM、PCM、GPCM、DIF、linking、equating、CAT。清單沒有錯,卻可能讓三十天計畫崩潰。因為我的完成條件只要求能以 2PL 解釋 item information,並手走一次 CAT 選題;其他模型可以放到研究路徑,而不是全部塞進主線。
另一個反例是「有缺口就補完整章」。我若對 logistic 函數不熟,不必先修一學期微積分;只需補足單調性、中心點、斜率與機率邊界,並能代值。先備不是愈多愈好,而是足以支撐下一個可驗收任務。
我用三個規則校正 Claude 的診斷題。每題必須對應後續作品;錯答要能指向一段明確補橋材料;題目不能偷偷測量尚未教過的術語。手答後,我還反向走查:如果五題全答對,是否真的足以開始?答案仍是否定的,因為來源判讀與軟體環境不是短題能涵蓋。它們會在後續獨立驗收。
今天完成的是一張先備知識矩陣與五題最小診斷。它解決了「我該從哪裡開始」,但不宣稱測得某種穩定能力。基礎閱讀是期望、變異與 logistic 函數;發展閱讀是 CTT 與潛在變項模型;研究閱讀則依後續方法進入原始論文。下一篇要處理診斷無法回答的問題:即使我算得出來,教材中的一句方法主張要如何找到真正支持它的來源?
先備矩陣還有一個實務用途:控制 Claude 解釋的起點。我把已通過的節點放入 project instructions,例如「讀者會解讀 共變異數矩陣,但尚未學過 潛在尺度識別」;要求模型不要重講已通過內容,首次使用新符號時則補一個最小例子。若後面文章發現我其實不會處理 次序尺度指標,矩陣就把該節點由通過改回補橋,連帶標記 EFA、CFA 與恆等性三篇需要重新檢查。這比把讀者籠統標成初學者或進階者更可操作。
可以把每題的作答另記成「答案、理由、待補概念」三欄。例如第一題即使算出 36,仍要解釋它是指定機率下的期望,並不等於每次都觀察到 36。若理由缺了,就先補期望值;若已能解釋,再往 CTT 讀。這份紀錄只對目前任務提供線索,不能延伸為對一位教師研究能力的總評。