同樣是行為投入平均 2.7,拿來討論全班活動與拿來扣個別學生的分,能要求同一套證據嗎?昨天的概念圖把分數用途放在起點,今天就用這個差別寫出測量問題。先說誰在什麼情境作答、分數代表什麼、教師準備採取什麼行動,後面才知道要檢查哪一種誤差與風險。
我為 ENGAGE-v1(本系列自建的合成示範量表,三構念各四題,第 8 天會完整介紹)選一個低風險用途:教師在一門課內,觀察班級層級的行為、情緒與認知投入分布,作為調整教材與活動的診斷線索。它不決定個人成績,不淘汰學生,不跨校排名,也不做臨床判斷。這些排除不是附註,而是控制後續證據負擔。
| 擬議用途 | 最少需要處理的問題 | 本系列是否支持 |
|---|---|---|
| 同一門課的班級教材回饋 | 內容代表性、分數穩定、結構、作答情境 | 主線示範 |
| 比較 A/B 兩群平均 | 再加測量恆等性與群體差異解釋 | 教學示範,不做實質結論 |
| 決定個別學生是否及格 | 個人分數精確度、決策錯誤與後果 | 不支持 |
| 跨校系排名 | sampling、linking、fairness、情境可比性 | 不支持 |
| 診斷心理健康 | 臨床理論、專業規範與風險治理 | 明確排除 |
表格的用途是讓證據需求跟著決策風險變動;它不能代表列出的證據已經取得。尤其「教學示範」只表示文章會走過方法,不表示合成資料支持真實群體結論。
若只給 Claude 題目草稿與「協助教師了解學習投入」,要防止回答自行加上「辨識低投入學生、提供個人化介入、追蹤改善成效」。這些延伸看似合理,卻已把班級描述推到個人分類與介入。沒有新增效度、公平性或決策錯誤證據,就不能將它們寫成既定用途。
提示可以分成兩段:先列出輸入中明說的用途,再列每個延伸用途額外需要的證據。這樣教師能檢查主張走了多遠,而不是從流暢文字裡猜模型是否擴大範圍。明確指令與脈絡仍不夠;教材任務還要寫清楚「不得自行擴大分數用途」,並用上面的個人分類案例測試這條規則。
把前述班級回饋用途展開,完整例題如下:
每一步都有新前提。從作答反應(response)到分數(score)要有評分規則;從一次分數到一般化要處理誤差;從分數到構念(construct)要有內容與結構證據;從解釋到教材調整還需要行動邏輯與後果監測。心理計量分析提供的是鏈中的證據,不是一次跳到終點的電梯。
反例是同樣得到 BE 平均 2.7。A 教師把它當成班級活動參與的討論起點;B 教師據此列出低投入學生並扣分。數字相同,第二個用途的風險、個人精確度與公平性要求高得多。若文章只報信度(reliability),無法讓 B 的決策變得合理。
雖然今天還沒進入估計,我先用六層表檢查用途:資料機制是五點自陳反應;目標是班級層級三面向模式;假設包括題意可理解、作答情境近似與反應不被強迫;可觀察量是題目分布、相關與後續模型摘要;估計/決策規則尚未選定,因為要由下游方法篇補上;保證也尚未成立,只能說這是一個待驗證的 argument(論證)。
「估計不適用」不能寫,因為未來確實需要;正確狀態是 pending,並指定交接。這個細節讓規格和研究進度不混為一談。
為了不讓「低風險」成為免責詞,我再問三個問題。第一,如果班級分數偏低,教師準備改掉哪一個活動?第二,改動會不會讓某些學生承受額外負擔?第三,若分數其實受題目理解或作答情境影響,教師有沒有第二種資料可以核對?這些問題把分數用途(score use)從統計報表拉回實際行動。
例如 CE 偏低,合理的下一步不是宣告學生缺乏深度學習,而是提出一個可反駁假設:「目前作業較少要求比較假設,因此認知投入題目的反應偏低。」教師可以檢查作業設計、訪談或學習歷程,再決定是否調整。量表在這裡是提出問題的入口,不是對學生本質下判決。
Claude 的語言常把「可以作為參考」寫得很安全,但參考仍會影響行動。我要求每個用途句後面接一個動詞:調整、提醒、分類、淘汰、診斷或排名。動詞一旦具體,證據責任與倫理風險就較容易看見。這也是為何本系列明確禁止個人扣分與淘汰,而不是只寫「請謹慎使用」。
這一輪查核沒有估計新參數,卻已經改變後文:Day 13 要談班級分數的一致性而非個人高風險精確度;Day 18 的群體分析只示範可比性問題;Day 26–28 的學生素材不能把合成分數當成個人診斷結果。
換一個用途就應重新走一次推論鏈,不能只在報告結尾補上一句限制。尤其從全班描述走向個人分類時,要先停下來核對決策錯誤。
這條推論鏈給 ENGAGE-v1 劃出工作範圍:教師可用班級模式提出教材調整假設,但合成資料不能支持真實學生的分類或介入成效。讀到後面的係數與模型輸出時,請把結果帶回這條鏈,指出它補的是哪一步,還缺哪一步。基礎閱讀看 Standards(美國教育與心理測驗標準)的指定分數解釋與用途;發展閱讀看 Kane 的論證方法;研究閱讀再追使用後果與公平性。
下一篇會固定共同案例的題目、構念、群體與資料版本。沒有版本化案例,今天寫的用途會在後面被不同題目與不同 scoring(計分)悄悄改寫。