iT邦幫忙

2026 iThome 鐵人賽

DAY 13
0

ENGAGE-v1 的 12 題總 alpha(內部一致性信度係數,不證明單一構念)約 0.843,能據此宣布量表只有一個構念嗎?不能:這份合成資料原本就由三個相關構念生成。昨天用古典測驗理論定義了信度,今天要分清楚兩件事:係數如何算出來,以及它在什麼模型條件下能解釋為指定分數的信度。

alpha 算的是什麼

k 個題目,alpha 可寫為:

α = k/(k−1) × (1 − Σ_j σ_j² / σ_X²)

alpha 等於 k 除以 k 減 1,再乘上 1 減去各題變異數總和占總分變異數的比例。

其中 X 是題目加總分。它由題目變異數(variance)與共變異數(covariance)計算,因此總能得到一個數字。要把數字解釋為特定信度(reliability),需要題目分數模型與誤差條件;在常見論述中,essential tau-equivalence 是關鍵條件之一。alpha 也不是 unidimensionality test:多個高度相關但可區分的面向仍可能得到高值。

omega(以因素負荷估計的信度係數)不是單一不變的公式名稱。以單因素 congeneric 模型、因素變異數(factor variance)固定為 1、誤差(error)不相關的簡化 omega total 為例:

ω = (Σ_j λ_j)² / [(Σ_j λ_j)² + Σ_j θ_j]

omega 等於各題負荷量總和的平方,除以該平方加上各題殘差變異數 θ_j 的總和。

它容許因素負荷量(loading)不相等,但仍依賴因素模型(factor model)、誤差結構(error structure)與分數定義(score definition)。把 alpha 換成 omega 而不檢查模型,只是換了一個按鈕。

六層責任

本篇設定
資料機制 多題反應形成加總或加權分數
目標 指定分數在指定母體/程序中的 reliability
假設 alpha 與 omega 各自的題目、factor、error 條件;樣本對目標母體適用
可觀察量 item covariance matrix、score variance、估計的 loadings/error variances
估計規則 alpha covariance formula;omega 的 fitted factor model formula
保證/限制 模型成立時估計相應 reliability;不判定內容代表性、單維或效度

完整例題:用兩組獨立設定手算 alpha 與 omega

先看設定 A:四題變異數都是 1,六個不重複的共變異數都是 0.4。這是一個獨立手算例,並非從 ENGAGE-v1 抽出的四題。加總分的變異數是:

σ_X² = 4 + 2 × (6 × 0.4) = 8.8

總分變異數是四個題目變異數之和 4,加上兩倍的六個共變異數之和。

所以:

α = 4/3 × (1 − 4/8.8) ≈ 0.727

代入 k 等於 4、題目變異數總和 4、總分變異數 8.8,alpha 約 0.727。

這個手算確認軟體輸出如何由共變異數來,也顯示題目數與平均共變異數都會影響 alpha。它沒有告訴我們四題是否一個構念。

接著另建設定 B:單因素模型的因素負荷量是 0.8、0.7、0.6、0.5,因素變異固定為 1,題目殘差互不相關,殘差變異數分別為 0.36、0.51、0.64、0.75。這組負荷量隱含的題間共變異數並非全部 0.4,所以不能沿用設定 A 的 alpha 來做同資料比較。此設定的簡化 omega 為:

ω = 2.6² / (2.6² + 2.26) ≈ 0.749

負荷量總和 2.6 的平方,除以它加上殘差變異數總和 2.26,約 0.749。

上式的未四捨五入值約為 0.749446,保留三位小數是 0.749;原稿的約 0.750 在本輪代值核對後更正。0.727 與 0.749 來自兩組不同設定。這裡示範的是各自的計算步驟,差值不能解讀為 omega 比 alpha 改善了多少。要比較同一分數,需使用相同資料與分數定義,再檢查模型。若因素模型設錯或殘差存在相關,上面的簡化 omega 公式也不能直接套用。

ENGAGE-v1 上,12 題總 alpha 的 smoke test 約 0.843。這個值看似更好,卻正好是反例:資料由三個相關構念生成,把 12 題混成一個總分仍可得到高 alpha。它不能證明單一學習投入構念,也不能決定總分適合班級回饋。

Claude 協作:拒絕係數排行榜

請 Claude 比較 alpha 與 omega 時,避免接受「omega 通常更準確,所以應優先使用」這種未附條件的排序。可以要求它逐項列出估計目標、模型假設、可觀察量與失敗條件。教師再核對差異是否確實來自本質 tau 等值或同屬模型、負荷量不等及誤差相關,而非只用「較新」解釋選擇。

人工查核回到 Cronbach(1951)、Sijtsma(2009)以及 Revelle 與 Zinbarg(2009)。這些來源對 alpha 的歷史、限制與不同 coefficients 有更細緻討論。我的文章只保留足以做決策的工作模型,不把爭論壓成「alpha 壞、omega 好」。

反例:複製題目提高 alpha

假設原本四題涵蓋準備、參與、持續與進度。現在把「我準時交作業」改寫成六個近義句加入量表。題數增加,平均共變異數也可能維持偏高,alpha 因而上升;內容卻被準時交作業主導。係數改善與構念代表性(construct representation)惡化可以同時發生。

另一個 failure case(失敗案例)是跨母體比較係數。高度同質班級的真分數(true-score)變異數較小,信度可能低於異質大樣本;不能因此直接說量表在前者品質較差。要先看分數用途、母體與誤差來源。

若真的要做同資料比較,可以從設定 B 先算出六個共變異數:它們在本例中是兩個負荷量的乘積。把這組矩陣帶回 alpha 公式,才有共同的比較基礎;仍要說明兩個係數依賴的條件,不能只報相差幾個百分點。

教師該怎麼報

我不再寫「本量表信度良好(alpha=.84)」。較負責的報法是:定義分數、母體與施測;說明選擇 alpha 或 omega 對應的模型;報點估計與不確定性;檢查 dimensionality 與殘差結構(residual structure);最後說這個信度證據支援哪一種用途、沒有支援什麼。

Ordinal 題目與不確定性不能消失

ENGAGE-v1 是五類反應。直接用 Pearson 共變異數的 alpha,是把 1–5 當作數值間距。改用 polychoric 相關(相關係數)算 ordinal coefficient(有序類別),是另一種設定。它又加入潛在連續反應與 threshold(切點)模型。兩者不是「普通版」與「更高級版」,而是不同資料模型。我要報哪一個,必須說明作答量尺(response scale)、estimator(估計方法)與 target 分數,並做敏感度比較,而不是看到較高的數字就選它。

點估計也會隨樣本改變。若文章只報 .843,讀者容易把三位小數當確定性。較完整的重現卡會保留樣本、missing handling、估計公式與 bootstrap 或其他合適的不確定性評估。本文的 0.843 只來自固定合成資料的 base-R 共變異數 formula,沒有作為真實母體推論。

我再用刪題做 probe(檢查題)。軟體若顯示「刪除 BE03 後 alpha 上升」,教師先檢查變動幅度、題目內容與 scoring 模型(計分);不因上升就刪。若刪題改變構念範圍,新的係數估的是另一個分數。這條規則把 Day 11 的構念(construct) responsibility 接回信度。

最後,對班級平均或變化分數,信度 target 可能不是個人一次加總分的係數。只要分數定義改變,就要重寫分子、分母與誤差來源。報一個全量表 alpha,不能為所有衍生分數提供保證。

原問題的答案是:alpha 和 omega 都是依模型解釋的估計量,不是量表品質代名詞。基礎閱讀是 Day 12 的 CTT(古典測驗理論);發展閱讀是 Sijtsma、Revelle 與 Zinbarg;前沿閱讀可進 bifactor 信度、ordinal coefficients 與 conditional 信度。

今日產物是係數決策表、兩個手算與「三構念仍有高 alpha」反例。下一篇接手「可靠不等於有效」:效度不是再算一個係數,而是檢查從作答反應到分數解釋(score interpretation)/use 的整條論證。

來源與協作揭露


上一篇
觀察分數=真分數+誤差?古典測驗理論的工作模型
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材13
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言