假設信度是 0.64,一位學生拿到 20 分,可以把其中 12.8 分叫真分數嗎?這個算法很直覺,卻把「母體分數的變異比例」套到了個人的一次分數。Day 11 已分開構念與反應;今天從觀察分數出發,先釐清古典測驗理論(CTT)的分解:
X = T + E
觀察分數 X 等於真分數 T 加上誤差 E。
這個式子太短,容易被解釋成「眼前的分數由真正能力加上一團髒誤差」。若把 T 想成藏在學生身上的純能力,CTT(古典測驗理論)會顯得既直觀又神祕。更精確的起點是:先定義一個重複測量程序,某人在這個程序下的觀察分數(observed score)是隨機變數 X,真分數(true score) T 是其期望,誤差(error) E=X-T。
重複測量不是要求同一學生無限次重考同一題本而完全不學習。它是一個概念性分布:在我們視為等價的題目取樣、評分與施測條件下,可能得到哪些分數。哪些條件算等價,必須由研究者定義。若第二次施測已接受新教學,或題本測了不同內容,就不能把差異全叫測量誤差(measurement error)。
由定義可得 E(E)=0;在典型 CTT 架構下,母體層次會討論真分數(true-score)變異數(variance)與誤差變異數(error variance),並將信度(reliability)寫成:
ρ_XX' = σ_T² / σ_X² = 1 − σ_E² / σ_X²
信度 ρ 是真分數變異數占觀察分數變異數的比例,也等於 1 減去誤差變異數所占的比例。
公式說的是指定母體與測量程序中的變異比例,不是某位學生的分數有「80% 真、20% 假」。母體變異改變,信度也可能改變。
| 層 | CTT 工作模型 |
|---|---|
| 資料機制 | 同一測量程序下的可能 observed scores |
| 目標 | true-score variance、error variance 與指定分數的 reliability |
| 假設 | 重複程序被定義;誤差期望為零;估計方法另需平行式、tau-equivalence 或其他條件 |
| 可觀察量 | 一次或多次施測的分數、題目 covariance、forms 間關聯 |
| 估計規則 | 依設計使用平行測驗、重測、內部一致性或模型式估計 |
| 保證/限制 | 在模型下量化相對誤差;不能直接觀察個人的 T,也不能自動識別誤差來源 |
最後兩層常被混在一起。CTT 定義信度,不表示任何資料都能無假設地估出它。alpha(內部一致性信度係數,不證明單一構念)是其中一種估計路徑,Day 13 才處理它的題目模型條件。
先看它算出來是什麼樣子,明天再談條件:
| 步驟 | 數值(Day 13 四題例) |
|---|---|
| 題目變異數總和 | 4 |
| 總分變異數 | 8.8 |
| alpha | 4/3 × (1 − 4/8.8) ≈ .727 |
請 Claude 用初學者能懂的語言解釋 X=T+E 時,可以用「真分數是沒有測量誤差時應得的分數」作為待修句。它容易把 T 說成理想狀態下唯一會出現的分數。依期望定義,某次觀察分數不必剛好等於 T,T 也不必是實際可取得的整數;改寫必須保留指定程序與分布。
驗收解釋時,先找出程序、分布與期望的對應,再用「第二次測量前已接受新教學」測一次。若程序或欲測屬性改變,差異就不能全叫隨機誤差。這比檢查答案是否用了三個關鍵詞更實際:讀者要能用定義判斷一個案例,而不是背下符號的中文名稱。
假設在指定課程母體中,BE 分數的觀察變異數(observed variance)為 25;依一個合適的重複測量設計估得誤差變異數為 9。工作模型下:
σ_T² = 25 − 9 = 16,ρ = 16/25 = 0.64
真分數變異數是 25 減 9 得 16,信度是 16 除以 25 得 0.64。
若某學生觀察分數是 20,不能寫成「真分數 12.8、誤差 7.2」。0.64 是變異比例,不是把個人分數按比例切開。若採簡化的標準誤(standard error) of measurement,SD_X=5,則 SEM=SD_X\sqrt{1-\rho}=5\sqrt{0.36}=3。這描述指定模型下觀察分數周圍的不確定尺度;建立個人區間仍需額外分布與用途假設。
現在把母體換成程度很接近的研討班。假設誤差變異數仍約 9,但觀察變異數變成 12,信度會降到 0.25。題本沒有突然「變差」,是母體中的目標差異縮小。這也是為何不能把信度當量表永久屬性。
學生經過一週密集訓練後 BE 上升。若重測設計的目標是估計短期穩定性,真實改變會和測量誤差混在差異裡;若目標正是測量介入後變化,則把它叫誤差更不合理。誤差不是「研究者不喜歡的變動」,而是相對於指定目標與程序的偏離。
第二個 failure case(失敗案例)是把不同內容的兩個 forms 稱為平行測驗,只因平均數相近。平行條件還涉及真分數與誤差變異數;若內容取樣不同地覆蓋三個投入構念,forms 相關(相關係數)不能無條件估同一信度。
CTT 把誤差濃縮成 E,但教學決策仍要問來源。題目取樣、施測時間、評分者、裝置、語言理解與短期狀態,都可能讓觀察分數改變。只用一次內部一致性分析,主要利用同次施測題目間共變異數(covariance),無法辨識所有來源。若用途涉及跨時間追蹤,重測與時間變化就不能被題目內部相關代替;若用途涉及主觀評分,評分者誤差也需要設計。
再看一個容易混淆的數值設定:假設總誤差變異 9,分為題目取樣 4、時間 3、評分/輸入 2。題目取樣誤差若降到 1,總誤差便降到 6。若另外設定總變異仍為 25,信度會是 19/25=0.76;但這也表示真分數變異改成 19,不能說是原來的 16 完全不變。若固定真分數變異為 16,則總變異應為 22,信度是 16/22≈0.727。兩種算式回答不同設定,不能混用。
上述成分只是教學假設;今天的單一測量設計未必能把三種來源分別估出來。要判斷改善題目有多少幫助,必須先說哪些變異保持不變,再考慮能識別各成分的設計。只看到信度提高,無法倒推出究竟改善了哪個誤差來源。
對班級層級平均而言,個人誤差可能部分平均掉,但又會引入班級組成與群聚問題。這超出本章估計範圍,所以不能由個人分數信度直接宣布班級診斷可靠。用途層改變,target 與誤差結構也要重新定義。
我用三層方式驗算。符號層確認 X 是隨機變數而非 CSV(逗號分隔的資料檔)的一欄常數;邏輯層確認真分數依程序定義;數值層檢查 0≤rho≤1 與極端情況:誤差變異數為 0 時信度為 1,等於觀察變異數時為 0。若計算跑出負誤差變異數或信度大於 1,不能只截成合法範圍,應檢查模型、估計與樣本波動。
媒介中的公式可壓縮關係,不能證明假設在 ENGAGE-v1 或真實課程成立。合成資料的總 alpha 約 0.843,也不是今天例題中的 0.64;兩者來自不同估計設定,刻意不混用。
原問題的答案是:X=T+E 先是相對於指定程序的定義性分解,信度則在母體與模型下描述分數變異。它不揭露某次分數中的實際誤差,也不說誤差從何而來。
基礎閱讀是 Lord 與 Novick 的真分數定義;發展閱讀是不同信度 designs;前沿閱讀可進 Generalizability Theory 與 conditional SEM。今日產物是 CTT 六層表、變異分解 worked example(完整例題)與「個人分數不能按 reliability 切割」反例。
下一篇接手一個實務問題:只有一次施測與一組題目共變異數時,大家常算 alpha。它在什麼條件下連到信度?omega(以因素負荷估計的信度係數)又解決了什麼、沒有解決什麼?