後面第 13 天會用 BE03 算信度,第 19 天再用它談 IRT(試題反應理論)。如果中間換過題目文字,題號即使相同,兩篇也不再分析同一個指標。昨天已把用途限定在低風險的課程回饋與方法示範;今天要固定 ENGAGE-v1 的題本、資料與生成設定,讓後面的差異能追到方法,而不是未說明的換題。
最直覺的做法是讓 Claude 生成一份量表,再為每章微調題目。它很快,也能避免資料太髒。但只要第 13 天的 BE03 和第 19 天的 BE03 文字不同,信度、CFA(驗證性因素分析)與 IRT 就不再談同一個 indicator(指標題目)。教科書的案例一致性不能靠題號看起來相同。
案例有三個暫定構念,每個四題:
| 構念 | 題號 | 題意範圍 | 不代表什麼 |
|---|---|---|---|
| 行為投入 BE | BE01–BE04 | 準備、參與、持續、依進度完成 | 服從、成績或人格 |
| 情緒投入 EE | EE01–EE04 | 興趣、期待、好奇、享受理解 | 臨床情緒狀態 |
| 認知投入 CE | CE01–CE04 | 連結、比較假設、自我檢查、找證據 | 一般智力 |
以下把十二題的題意逐字固定下來;後面各篇引用相同題號時,指的都是這段文字,不再另行改寫。
| 構念 | 題號 | 題意 |
|---|---|---|
| 行為投入 BE | BE01 | 我會準時完成課前準備 |
| 行為投入 BE | BE02 | 我會持續參與課堂活動 |
| 行為投入 BE | BE03 | 遇到困難時我仍會完成學習任務 |
| 行為投入 BE | BE04 | 我會依進度繳交課程作業 |
| 情緒投入 EE | EE01 | 我對課程內容感到有興趣 |
| 情緒投入 EE | EE02 | 我期待參與這門課 |
| 情緒投入 EE | EE03 | 課堂活動會引起我的好奇 |
| 情緒投入 EE | EE04 | 我享受理解課程概念的過程 |
| 認知投入 CE | CE01 | 我會把新概念連回已知內容 |
| 認知投入 CE | CE02 | 我會比較不同解法的假設 |
| 認知投入 CE | CE03 | 我會檢查自己的理解是否有漏洞 |
| 認知投入 CE | CE04 | 我會為困難概念尋找額外證據 |
所有題目使用 1–5 的 Likert 作答反應(李克特量尺)。資料共有 600 筆,A、B 兩組各 300 筆;群體只是示範 measurement invariance(測量恆等性)的教學標籤,不對應真實校系。生成器使用 seed(隨機種子) 20260901:先在 R 中抽出三個彼此相關的潛在構念(相關分別為 .55、.50、.60),再依各題的因素負荷量(loading)產生連續反應並以五個切點轉成 1–5,B 組的 BE04 額外加入 0.25 的位移;完整生成程式會在第 22 天整篇列出,讀者可自行重建同一份資料。這張表的用途是維持識別碼和內容範圍,不是內容效度證據;題目是否充分代表學習投入,需要更完整的理論與專家程序。
可請 Claude 先把每題對應到預定構念,再提出「它可能測到別的東西」的解釋。例如 BE01 與 BE04 都涉及按時完成,就值得追問是否過度集中在服從要求。這只是內容審查的起點;語言模型提出的疑點,不能代替專家判斷與目標族群的理解證據。
我保留四題,是因為後續需要一個穩定示例,並在 ledger(來源與主張帳本)中註明內容窄化。若這是真實量表開發,我會加入目標族群訪談、專家審查、認知訪談與試測;這裡不假裝完成那些程序。
若為了增加題目變化,把 BE03 改成反向題「遇到困難時我會放棄」,就要重新評估它帶來的方法效應。這個反例可用來討論疏忽作答,卻不應直接加入既有題本,讓後面的三因素模型多出未計畫的解釋。需要展示反向題問題時,應另建失敗案例並標明版本。
本例先生成三個相關的潛在變項,再依固定因素負荷量加上殘差,形成連續反應,最後以切點分成五類。A、B 組設定大致相同,但 BE04 在 B 組加入小幅位移,供恆等性篇討論局部差異。讀者因此能同時看到模型符合生成設定的部分,以及刻意留下、不能靠換資料消除的問題。
生成器跑出的 smoke test 是 600 rows、12 題目(item),總量表 alpha(內部一致性信度係數)約 0.843。這個數字只確認資料具有預期的相關結構,不是量表品質結論。後面 Day 13 會說明,總 alpha 甚至可能掩蓋三構念。
我為 CSV(逗號分隔的資料檔)加了最小 schema test(資料結構定義):必須正好 600 列、12 個題目欄、所有反應都在 1–5、id 唯一、group 只有 A/B。這些檢查抓得到欄名錯誤與遺漏,抓不到構念定義錯誤。因此 schema 與內容審查分開記錄:前者可由程式重跑,後者要回到資料字典與用途。
資料版本還要固定「已知缺陷」。BE04 的 group shift 是刻意設計的教學事件,不能在 Day 18 因 fit(模型與資料摘要的相容程度)不漂亮而修掉。若模型只在完美資料上教,讀者會把任何不合預期的結果視為程式錯誤;保留局部不恆等,才能示範限制、診斷與不應比較的結論。
我另外保留生成機制與分析資料的界線。教師知道潛在變項(latent variable)和因素負荷量,是因為我們建立了合成資料;分析文章卻只讀 CSV,不把真值餵給模型。這讓完整例題可以比較估計與生成設定,又不會把「知道答案」混進實際分析程序。
最後,題目中文是教材的一部分,不只是欄名旁的說明。任何改字都可能改變理解與作答機制,所以 data dictionary(資料字典)、文章例句、學生學習單和 AI 助教必須引用同一份題目文字。版本一致性在此比生成更多樣本更重要。
反例是重新執行生成器卻不固定 seed。每次文章截圖會有不同相關、fit 與題目參數,讀者無法判斷差異來自方法還是資料。另一個失敗是手動改 CSV 卻仍稱 ENGAGE-v1。版本契約規定:題目、生成器或資料任何實質改動,都要升版並在 ledger 記錄,不覆寫 v1。
資料機制是合成潛在(latent)作答歷程(response process)與 ordinal cut(有序類別);目標是示範三面向分數與方法,不估計真實學生母體;假設由生成器明定,但分析時不把真值直接交給估計器;可觀察量是 12 題反應與 group;估計規則由各章決定;能保證的是相同 R 與 seed 可重生相同資料,不能保證外部效度、內容充分性或實際群體可比。
今天完成版本化資料字典、生成器與固定的 ENGAGE-v1。它讓後續每篇文章能把新方法加在同一案例上,也保留一個預先設計的局部失敗。發展閱讀是生成器與測量模型;研究閱讀才進入正式量表發展與 validation 程序。
下一篇不增加新方法,而是安排三條閱讀路徑。因為教師可能只有九十分鐘要理解一個判斷,也可能要完整備課或查研究來源;同一本書需要允許不同進入方式,又不能讓速成路徑跳過限制。