三因素 CFA(驗證性因素分析,把理論寫成可被資料反駁的模型)配適度良好,教師就能用分數判定誰「認知投入不足」嗎?Day 13 已提醒我們,信度不能替題目內容與用途背書;模型配適度也沒有補完這條推論。今天把「這份量表信效度良好」拆開,逐步檢查從反應、分數解釋到教學行動,究竟各有什麼證據。
本篇談的內部結構證據,來自這個模型:
| 因素 | 量測題目 | lavaan 語法 |
|---|---|---|
| BE | BE01–BE04 | BE =~ BE01 + BE02 + BE03 + BE04 |
| EE | EE01–EE04 | EE =~ EE01 + EE02 + EE03 + EE04 |
| CE | CE01–CE04 | CE =~ CE01 + CE02 + CE03 + CE04 |
依 2014 Standards(美國教育與心理測驗標準)與論證取向的效度觀,我們評估的是「指定用途下的測驗分數解釋」。換了用途,原有證據未必足夠;同一份題本移到另一母體、語言或決策情境時,也要重新檢查哪些推論仍成立。後文保留英文術語供查閱原文,但每次都要說清楚是在支持哪一段解釋。
我為 ENGAGE-v1 寫一條縮小的 interpretation(分數解釋)/use argument(論證):
12 題反應
→ 依三面向評分
→ 對指定課程情境可一般化
→ 解釋為有限範圍的學習投入面向
→ 班級層級提出教材調整假設
→ 以其他資料確認後行動
這張鏈的用途是定位證據缺口。它不是 validation(效度驗證)成功證明;每支箭頭都有假設,任一處失敗都會限制後續主張。
常見證據可以放回鏈上。題目內容與專家審查主要處理構念代表性(construct representation)。作答歷程證據處理學生如何理解題意。內部結構(internal structure)處理題目關聯是否符合預定 scoring(計分)。與外部變項關係檢查 convergent、discriminant 或 criterion patterns;使用後果與公平性則回到 action。這些不是彼此獨立的「效度種類貼紙」,而是支持或挑戰一個論證的來源。
| 層 | 效度論證中的角色 |
|---|---|
| 資料機制 | 題目內容、作答過程、施測情境與 scoring 共同產生分數 |
| 目標 | 班級層級三面向分數的解釋,以及低風險教材調整用途 |
| 假設 | 內容代表、作答符合設計、結構適切、外部關係可解釋、行動不造成不可接受後果 |
| 可觀察量 | 題目審查、訪談、covariance、fit、外部關聯、使用結果 |
| 評估規則 | 將多來源證據對應每個推論,尋找最弱與替代解釋 |
| 保證/限制 | 論證可被支持到特定程度;不存在由單一結果取得永久有效的保證 |
本篇的「估計」改為評估規則,因為 target 是一組推論的可辯護程度,不是一個效度(validity) parameter。
請 Claude 整理效度證據時,若只得到內容效度、構念效度、效標效度三欄,再各填一個數字,還不能回答數字支持什麼用途。這個表可以幫助辨認文獻用語,但作為本系列的寫作骨架,還需要把每個證據接回推論鏈。
更可用的格式是四欄:推論、假設、支持證據、競爭解釋。例如從三分量表分數走到三個投入面向,假設之一是題目共變主要由預定構念產生;CFA 可提供結構證據,競爭解釋則包括相似措辭、反應風格或高階共同因素。欄位填完後,仍要逐項查核來源與資料,不能把生成的表格當成已成立的論證。
假設 Day 17 的三因素 CFA 達到可接受的 fit(不證明模型正確),Day 13 各分量表信度(reliability)也足以做班級摘要;這兩篇都在後面,此處只是為了走完論證而設的假設,不依賴它們的實際結果。這支持 scoring 與部分內部結構,仍缺內容、作答過程及行動證據。若認知訪談發現學生把 EE 題目理解成「喜不喜歡老師」,那麼良好 fit 也可能是共同評價方法造成,情緒投入解釋被削弱。
所以讀 fit 指標時要記得每個指標各自摘要什麼、不證明什麼:
| 指標 | 它摘要什麼 | 它不能證明什麼 |
|---|---|---|
| CFI/TLI | 相對 baseline model 的改善 | 構念可區分 |
| RMSEA | 近似誤差與自由度 | 模型正確 |
| SRMR | 標準化殘差的平均大小 | 題目測到對的東西 |
再假設 CE 與一項深度學習行為指標呈正相關。它提供 external relation evidence(證據),但若兩者都由同一份自陳問卷取得,共同方法可能是 rival explanation(對立解釋)。加入學習歷程、作業內容或時間序列資料,才可能縮小替代解釋。validation 的工作是讓論證承受競爭故事,不是只累積顯著結果。
在使用端,教師看到班級 CE 偏低,先檢查作業是否提供比較假設的機會,再設計活動並觀察變化。若直接標記學生「認知投入不足」,就跨過班級用途與額外證據。結果數字沒有變,推論距離變遠。
想像 12 題全部都以相似正向句型詢問「我是一個認真的學生」。資料可能形成整齊單因素,fit 也很好;但內容沒有覆蓋我們定義的行為、情緒、認知投入。內部結構與構念代表性可以一好一壞。
另一個 failure case(失敗案例)是 known-groups difference:A 組平均顯著高於 B 組,作者稱為 criterion 效度。若群體 measurement invariance(測量恆等性)未處理,觀察到的差異未必是潛在平均數的差異。它可能來自題目在群體中的 intercept(截距)或 threshold(切點)。這時比較的就不是潛在平均數(latent mean)。Day 18 會把這個問題寫成可檢查限制。
Messick 強調分數意義(score meaning)的證據與後果,Kane 則把 interpretation/use claims(需來源支持的主張)寫成可評估的 argument。兩套論述不必在短文中被壓成同一套術語;本系列採 argument map 作為寫作工具,並用 Standards 控制專業責任。這是一種教學選擇,不宣稱終結效度理論爭論。
教師報告時,應先寫 intended interpretation/use,再說明目前取得哪些 evidence、哪些 assumptions 尚未受測、有哪些不利結果,以及用途改變時要新增什麼。validated 最好理解為持續工作,而不是量表名稱旁的勾號。
把開頭的個人標記帶回鏈上,就能看到缺口:班級摘要即使有可接受的結構證據,也沒有因此取得個人分類所需的精確度與後果證據。教師應先退回原定的教材調整用途,再決定是否值得另做研究來支持更遠的行動。
validation plan 要事先寫什麼結果會削弱主張。若只在資料出來後蒐集支持故事,任何結果都能被解釋為「另一種效度證據」。對 ENGAGE-v1,我先列三個停止條件:題目認知訪談顯示核心詞被系統性誤解;三面向結構在合理模型間極不穩定;教材調整用途造成標記或不公平負擔。出現時,行動是縮小解釋、修題或停止使用,不是再找一個漂亮係數抵銷。
證據也有適用範圍。A 課程中的內容審查與作答歷程,不能直接搬到另一語言或另一科目;即使題目翻譯正確,學習投入的情境意義可能改變。若把量表帶到新場域,舊證據是起點,不是免重新驗證的護照。
我把 argument map 做成版本化物件。每個 inference 有 owner、support、counterevidence、status 與 update trigger。Day 17 的 CFA 會更新 internal-structure(內部結構)節點;Day 18 更新 group comparison;Day 25 檢查是否有文章把局部 evidence 誇大成整體效度。這使效度論證能和教科書同步更新。
還有一個容易忽略的界線:效度證據可以支持解釋,不替決策者免除價值判斷。是否用分數改變教材、可接受什麼誤判與負擔,仍需教學與倫理理由。數據不能單獨決定行動。
原問題的答案是:效度是證據與理論對指定分數解釋/用途的支持程度,不能由單一係數代表。基礎閱讀是 Standards 2014;發展閱讀是 Messick(1995)與 Kane(2013);前沿閱讀可進 fairness(公平性)、consequences、作答歷程(response process)與效度論證(validity argument) evaluation。
本篇留下 ENGAGE-v1 的推論鏈,以及如何逐段列出競爭解釋的示範。讀者應能指出一項支持證據和一項仍未排除的解釋。下一篇接手內部結構:題目相關矩陣為何讓我們引入潛在因素,又為何因素不能直接等同於構念?