學生在 BE03「遇到困難時我仍會完成學習任務」選 5,教師能直接說他行為投入很高嗎?這一句話已從單次反應跨到不可直接觀察的構念,還可能把當下作答當成穩定特質。昨天的工作區幫我們保存術語與案例;今天要用同一道題,釐清構念、題目與反應之間還缺哪些證據。
構念(construct)是理論上要理解的屬性;題目(item)是依理論設計、用來引發反應的刺激;反應(response)則是人在特定情境下產生的可觀察結果。題目文字不是構念,反應也不是構念的透明視窗。三者之間需要說明作答機制,再以測量模型連起來。
行為投入(construct)
↓ 影響,但不是唯一原因
BE03 的理解、回憶與判斷(response process)
↓ 再受情境、量尺使用、社會期許影響
選項 1–5(observed response)
圖的用途是提醒每條箭頭都有競爭解釋。它不能證明 BE03 的實際作答歷程(response process);那通常需要認知訪談、作答歷程或其他證據。
如果採反映式測量觀點,我們會把多個題目反應視為共同構念的 indicators(指標題目),並容許各題有特定誤差。若題目是形成一個指標的組成條件,例如投入時數、出席與作業次數合成行政指標,箭頭方向與刪題意義可能不同。不能因為軟體都能算相關,就略過測量觀點。
| 層 | 本篇的工作定義 |
|---|---|
| 作答機制 | 學生理解題意、回想一段期間、整合經驗並選 1–5 |
| 目標 | 課程情境中的行為投入面向,供班級診斷使用 |
| 假設 | 題意可理解、選項有序、反應與構念有系統關係、非全由方法因素造成 |
| 可觀察量 | BE01–BE04 的 ordinal responses 與其分布/關聯 |
| 估計規則 | 本篇尚不估構念分數;後續由 CTT、CFA、IRT 提供不同規則 |
| 保證/限制 | 可定義欲建模關係;不能由單題反應讀出穩定構念值 |
估計層明確標成待後文,而不是「不適用」。因為今天正是在建立後面估計要負責的對象。
可以把「BE03=5,所以此人高度投入」交給 Claude,要求標出省略的推論。若它只改成「BE03=5 提供與持續投入相容的反應證據」,仍要追問:題目內容與作答過程檢查了嗎?其他題目是否支持同一解釋?換成較保守的語氣,不等於補足了這些條件。這是一道改寫檢查題,不是本輪模型實測紀錄。
我最後改成:「在指定題意與作答情境下,BE03=5 是一個高類別反應;是否支持較高行為投入的解釋,取決於題目內容、反應機制與後續模型證據。」修正不是語氣保守,而是把缺少的推論條件寫出來。
學生甲確實遇到困難仍持續完成任務,因此選 5。學生乙認為好學生應該選 5,受社會期許影響。學生丙只想到最近一次成功經驗,忽略其餘學期。三人的觀察到的作答反應(observed response)相同,生成故事不同。
若 BE01–BE04 都呈現一致模式、訪談顯示題意理解符合設計、反應與相關行為資料相符,甲的解釋會得到更多支持。若所有正向題都選 5、反向或注意力題型卻矛盾,則需考慮作答反應 style。資料不會自己替我們選故事;模型只是把某些故事寫成可比較的限制。
假設 BE03 在 CFA 的因素負荷量(loading)較低,Claude 建議刪題以提高 fit(模型與資料摘要的相容程度)。若 BE03 是四題中唯一涉及「遇到困難仍持續」的題目,刪除會使行為投入更接近準時與服從,構念內容被縮窄。模型 fit 可能改善,欲解釋的東西卻變了。刪題決策必須同時看內容與模型,不能把低因素負荷量當自動刪除鍵。
另一個 failure case(失敗案例)是把五點反應直接當等距連續量,卻從未交代此近似對 estimator(估計方法)與推論的影響。後續程式篇會保留 ordinal 分支,避免資料型態在匯入 R 時被悄悄決定。
增加 indicators 可以讓模型利用共同變動,卻不能靠題數解決錯誤構念。若四題都只問準時交作業,內部一致性可能很高,內容仍只覆蓋行為投入的一小角。反過來,題目刻意覆蓋不同面向時,相關可能下降,這不必然代表題目「不好」。選題與刪題要同時回答內容代表性及預定 scoring 模型(計分)。
我也檢查時間範圍。BE03 若沒有指定「過去四週」或「這門課」,不同學生可能回想不同期間;同一反應就不再共享明確條件。正式量表要在題幹或 instructions 固定 referent。本合成案例把它限定為目前課程與近期學習任務,後面所有解釋沿用,不能在學生版改成一般人格傾向。
最後是缺失反應。空白不等於投入最低,也不一定是隨機遺漏。今天不選定 missing-data method,但先在作答機制層標記:若真實資料有缺失,分析要說明缺失如何產生、軟體如何處理。把 NA 自動轉成 0,會同時改變作答反應、分數(score)與構念(construct)解釋。
這個檢查也適用於學生版教材:把 BE03 的例句換成較口語的問法前,先核對時間範圍與持續完成的含義。若為了好懂而改成「我總是準時交作業」,便已改了題意,不能沿用原題的解釋。
我用資料字典逐題檢查構念範圍,也用 Standards(美國教育與心理測驗標準)的效度(validity)架構確認作答歷程與內部結構(internal structure)只是效度證據的不同部分。今天沒有宣稱 ENGAGE-v1 已具內容效度;它是固定教學案例。
回到開頭:直接觀察到的是選項 5,從這個反應走到行為投入的解釋,仍需模型與證據。讀者可先說出一種替代的作答原因,再說要用什麼資料區分它。發展閱讀進入作答過程及反映式模型;研究閱讀再比較形成式測量、反應風格與認知診斷。
今日產物是第一張六層責任表。下一篇接手觀察到的作答反應,先問一次觀察分數如何拆成穩定部分與隨機誤差:X=T+E 究竟是定義、模型,還是藏在學生身上的真實分數?