iT邦幫忙

2026 iThome 鐵人賽

DAY 11
0

學生在 BE03「遇到困難時我仍會完成學習任務」選 5,教師能直接說他行為投入很高嗎?這一句話已從單次反應跨到不可直接觀察的構念,還可能把當下作答當成穩定特質。昨天的工作區幫我們保存術語與案例;今天要用同一道題,釐清構念、題目與反應之間還缺哪些證據。

三個物件不能疊成一個

構念(construct)是理論上要理解的屬性;題目(item)是依理論設計、用來引發反應的刺激;反應(response)則是人在特定情境下產生的可觀察結果。題目文字不是構念,反應也不是構念的透明視窗。三者之間需要說明作答機制,再以測量模型連起來。

行為投入(construct)
      ↓ 影響,但不是唯一原因
BE03 的理解、回憶與判斷(response process)
      ↓ 再受情境、量尺使用、社會期許影響
選項 1–5(observed response)

圖的用途是提醒每條箭頭都有競爭解釋。它不能證明 BE03 的實際作答歷程(response process);那通常需要認知訪談、作答歷程或其他證據。

如果採反映式測量觀點,我們會把多個題目反應視為共同構念的 indicators(指標題目),並容許各題有特定誤差。若題目是形成一個指標的組成條件,例如投入時數、出席與作業次數合成行政指標,箭頭方向與刪題意義可能不同。不能因為軟體都能算相關,就略過測量觀點。

六層責任表

本篇的工作定義
作答機制 學生理解題意、回想一段期間、整合經驗並選 1–5
目標 課程情境中的行為投入面向,供班級診斷使用
假設 題意可理解、選項有序、反應與構念有系統關係、非全由方法因素造成
可觀察量 BE01–BE04 的 ordinal responses 與其分布/關聯
估計規則 本篇尚不估構念分數;後續由 CTT、CFA、IRT 提供不同規則
保證/限制 可定義欲建模關係;不能由單題反應讀出穩定構念值

估計層明確標成待後文,而不是「不適用」。因為今天正是在建立後面估計要負責的對象。

Claude 協作:找出被省略的動詞

可以把「BE03=5,所以此人高度投入」交給 Claude,要求標出省略的推論。若它只改成「BE03=5 提供與持續投入相容的反應證據」,仍要追問:題目內容與作答過程檢查了嗎?其他題目是否支持同一解釋?換成較保守的語氣,不等於補足了這些條件。這是一道改寫檢查題,不是本輪模型實測紀錄。

我最後改成:「在指定題意與作答情境下,BE03=5 是一個高類別反應;是否支持較高行為投入的解釋,取決於題目內容、反應機制與後續模型證據。」修正不是語氣保守,而是把缺少的推論條件寫出來。

完整例題:同一個 5,三種生成故事

學生甲確實遇到困難仍持續完成任務,因此選 5。學生乙認為好學生應該選 5,受社會期許影響。學生丙只想到最近一次成功經驗,忽略其餘學期。三人的觀察到的作答反應(observed response)相同,生成故事不同。

若 BE01–BE04 都呈現一致模式、訪談顯示題意理解符合設計、反應與相關行為資料相符,甲的解釋會得到更多支持。若所有正向題都選 5、反向或注意力題型卻矛盾,則需考慮作答反應 style。資料不會自己替我們選故事;模型只是把某些故事寫成可比較的限制。

反例:刪掉「麻煩題」反而改了構念

假設 BE03 在 CFA 的因素負荷量(loading)較低,Claude 建議刪題以提高 fit(模型與資料摘要的相容程度)。若 BE03 是四題中唯一涉及「遇到困難仍持續」的題目,刪除會使行為投入更接近準時與服從,構念內容被縮窄。模型 fit 可能改善,欲解釋的東西卻變了。刪題決策必須同時看內容與模型,不能把低因素負荷量當自動刪除鍵。

另一個 failure case(失敗案例)是把五點反應直接當等距連續量,卻從未交代此近似對 estimator(估計方法)與推論的影響。後續程式篇會保留 ordinal 分支,避免資料型態在匯入 R 時被悄悄決定。

多題不會自動變成測量

增加 indicators 可以讓模型利用共同變動,卻不能靠題數解決錯誤構念。若四題都只問準時交作業,內部一致性可能很高,內容仍只覆蓋行為投入的一小角。反過來,題目刻意覆蓋不同面向時,相關可能下降,這不必然代表題目「不好」。選題與刪題要同時回答內容代表性及預定 scoring 模型(計分)。

我也檢查時間範圍。BE03 若沒有指定「過去四週」或「這門課」,不同學生可能回想不同期間;同一反應就不再共享明確條件。正式量表要在題幹或 instructions 固定 referent。本合成案例把它限定為目前課程與近期學習任務,後面所有解釋沿用,不能在學生版改成一般人格傾向。

最後是缺失反應。空白不等於投入最低,也不一定是隨機遺漏。今天不選定 missing-data method,但先在作答機制層標記:若真實資料有缺失,分析要說明缺失如何產生、軟體如何處理。把 NA 自動轉成 0,會同時改變作答反應、分數(score)與構念(construct)解釋。

這個檢查也適用於學生版教材:把 BE03 的例句換成較口語的問法前,先核對時間範圍與持續完成的含義。若為了好懂而改成「我總是準時交作業」,便已改了題意,不能沿用原題的解釋。

教師查核與交接

我用資料字典逐題檢查構念範圍,也用 Standards(美國教育與心理測驗標準)的效度(validity)架構確認作答歷程與內部結構(internal structure)只是效度證據的不同部分。今天沒有宣稱 ENGAGE-v1 已具內容效度;它是固定教學案例。

回到開頭:直接觀察到的是選項 5,從這個反應走到行為投入的解釋,仍需模型與證據。讀者可先說出一種替代的作答原因,再說要用什麼資料區分它。發展閱讀進入作答過程及反映式模型;研究閱讀再比較形成式測量、反應風格與認知診斷。

今日產物是第一張六層責任表。下一篇接手觀察到的作答反應,先問一次觀察分數如何拆成穩定部分與隨機誤差:X=T+E 究竟是定義、模型,還是藏在學生身上的真實分數?

來源與協作揭露


上一篇
Claude 的教材工作區:來源庫、術語表與 claim ledger
下一篇
觀察分數=真分數+誤差?古典測驗理論的工作模型
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材13
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言