iT邦幫忙

2026 iThome 鐵人賽

DAY 18
0

A、B 兩群的 CFA(驗證性因素分析)都能接受,B 群的 BE04 平均又較高,就可以說 B 群行為投入較高嗎?ENGAGE-v1 刻意在 BE04 的生成設定中加入群體位移,正好讓我們檢查這個跳躍。Day 17 處理各模型與資料是否相容;今天要多問一步:同一題在兩群中,是否以可比較的方式反映同一構念?

測量恆等性要為特定比較設定哪些量測參數應相等,例如因素負荷量、截距或類別切點。它沒有要求兩群學生完全相同。先說要比較因素關係、潛在平均或觀察分數,再倒推所需限制,才知道每一層模型多檢查了什麼。

恆等性階梯

對連續 indicators(指標題目)的常見教學順序是:

層級 跨群固定 主要支援的比較
configural 相同 factor pattern 相同基本測量架構的起點
metric/weak 再固定 loadings factor 關係的比較
scalar/strong 再固定 intercepts latent mean 比較的必要基礎之一
strict 再固定 residual variances 更強的 observed-score 比較條件

ENGAGE-v1 是 ordinal 題目(有序類別),實作會涉及 thresholds(切點)與尺度設定,不能把連續指標的 intercept 表原封不動套上。表格的用途是理解「多加一組相等限制,換取哪種比較」;實際參數化要依 estimator(估計方法)與識別方法閱讀官方文件。

六層責任

層 群體模型責任
資料機制 A、B 群體對同一 12 題產生 ordinal responses,BE04 有設計的 group shift
目標 特定層級的 measurement parameter comparability 與可允許的群體比較
假設 各群模型適切、共同構念尺度可連結、抽樣與 group 定義有意義
可觀察量 各群 item statistics、model fit、parameter estimates 與 residuals
決策規則 逐層加限制,比較 fit change、參數差異、局部 misfit 與理論
保證/限制 在工作模型下評估可比性;不能證明群體公平、完全相同或差異因果

Claude 協作:從「通過」改成「哪裡壞掉」

請 Claude 起草多群組語法時,若附帶一張固定門檻表,將每層簡化成「ΔCFI(比較配適指標)小於某數字就過關」,要回來源核對適用條件。Chen(2007)研究配適度指標對不恆等的敏感度,涉及模型、樣本與違反型態;文獻建議不能脫離情境變成通用判定規則。

更有用的診斷表應並列整體配適變化、局部參數線索、標準化參數差異、題目內容解釋,以及放鬆限制後對目標比較的影響。Claude 可以整理欄位與候選解釋,教師則要判斷部分恆等性是否有實質理由;欄位填滿不表示比較已被支持。

完整例題:BE04 的局部 shift

生成器讓 B 群 BE04 在相同潛在(latent)作答反應(response)下略高。configural 模型(model)仍可能呈現相同三因素 pattern;因素負荷量(loading)也大致相近;當 thresholds/intercepts 被固定時,BE04 產生局部 misfit。這正是資料設計要保留的教學事件。

如果忽略它,B 群較高的 BE04 觀察到的作答反應(observed response)可能被誤讀成較高 behavioral engagement。若釋放 BE04 對應參數並有題意或作答機制理由,可以探索 partial invariance(部分恆等、測量恆等性);但潛在平均數(latent mean) identification 與其餘 invariant anchors 必須足夠,且結果要明示依賴哪些題目。

我不在合成例上宣稱 partial invariance 已為真實研究所接受。worked example(完整例題)只示範:局部 parameter difference 會如何污染群體比較,以及修正後的結論範圍要縮小。

反例:群體平均不同,所以量表有偏誤

觀察平均不同不等於題目偏誤;若構念真的不同,平均差是 target 的一部分。反過來,平均相同也不證明測量恆等。measurement invariance 問的是相同潛在 standing 下,measurement relationship 是否可比。

另一個 failure case(失敗案例)是兩群各自 fit 好就比較。separate-group fit 沒有直接測試 equality constraints;要把群體放進共同模型,明確固定與比較。即使 scalar 模型能接受,群體分類的科學意義、樣本代表性與用途後果仍需另外處理。

接受與否要回到指標本身的意義:

指標 它摘要什麼 它不能證明什麼
CFI/TLI 相對 baseline model 的改善 構念可區分
RMSEA 近似誤差與自由度 模型正確
SRMR 標準化殘差的平均大小 題目測到對的東西

Partial invariance 不是自動修模

若只依 MI 一條條釋放直到過關,和 Day 17 的 fit chasing 相同。每次釋放要有三項紀錄:哪個參數、題目內容或作答歷程(response process)的理由、對欲比較 target 的影響。若釋放太多或 anchors 不穩,最負責的結論可能是不做潛在平均數 comparison。

此外,group 不只性別或地區,也可能是時間、語言、施測模式。longitudinal invariance 涉及相同人的依賴,翻譯版本涉及語意與文化,線上/紙本涉及 mode effects。方法名稱相同,資料機制不同。

讀者可用 BE04 做一次報告練習:先寫要比較哪個平均,再指出 BE04 的哪個參數可能破壞比較,最後說釋放限制後還靠哪些題目連結兩群。若第三句說不清楚,就先不要報潛在平均差。這比只記下一個「通過」狀態更能暴露識別與用途的缺口。

尺度連結本身就是識別選擇

比較潛在平均數前,必須把群體因素(factor)放到共同尺度。常見參數化固定 reference group 的因素 mean/變異數(variance),再透過 invariant measurement parameters 連結其他群體。若 anchors 本身 noninvariant,平均差會依選哪幾題當尺而改變。這是為何「至少幾題 invariant 就夠」不能脫離模型與 target 回答。

Ordinal 題目還增加 threshold 與 scale-factor 的識別關係。不同軟體或參數化可能使用不同順序與名稱;教師應讀實際 estimator 文件,而不是把 continuous scalar invariance 的文字貼到輸出。文章保留連續表作概念梯子,執行卡則明列 ordered 題目、threshold constraints 與 reference scaling。

我用一個決策 probe(檢查題)收尾:若 BE04 noninvariant,釋放後 A/B 潛在平均數方向穩定,但大小改變,報告必須同時呈現 full 與 partial 模型、釋放理由與敏感度;若方向也翻轉,教材用途不應選擇較合意的版本,而應停止群體結論並回題目與作答歷程查核。

measurement invariance 也不是公平性的充分條件。參數相等仍可能有不公平的內容涵蓋、使用後果或群體分類;noninvariance 則需要理解來源,不能直接把群體或題目貼上偏誤標籤。它是公平性論證的一項證據,不是同義詞。

原問題的答案是:群體比較前,要檢查足以支援該比較的 measurement invariance;「同一把尺」是對參數限制與 target 的簡稱,不是群體完全相同。基礎閱讀是 lavaan multiple-groups tutorial(R 的結構方程式套件)。發展閱讀是 Meredith(1993)與 Chen(2007)。前沿閱讀可進 partial invariance 與 alignment(對齊法)。DIF(差異試題功能)與 fairness(公平性)也在這一層。

本篇留下恆等性階梯、BE04 局部差異的條件示範與部分恆等性的決策規則;沒有宣稱合成群體的比較已通過實證驗收。下一篇換到題目層級:IRT(試題反應理論)直接連結投入位置與反應機率,群體可比性的問題仍會跟著這把尺一起走。

來源與協作揭露


上一篇
CFA:把理論寫成一個可能被資料反駁的模型
下一篇
IRT:能力與題目如何放在同一把尺上
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材 共 22 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言