iT邦幫忙

2026 iThome 鐵人賽

DAY 8
0

後面第 13 天會用 BE03 算信度,第 19 天再用它談 IRT(試題反應理論)。如果中間換過題目文字,題號即使相同,兩篇也不再分析同一個指標。昨天已把用途限定在低風險的課程回饋與方法示範;今天要固定 ENGAGE-v1 的題本、資料與生成設定,讓後面的差異能追到方法,而不是未說明的換題。

最直覺的做法是讓 Claude 生成一份量表,再為每章微調題目。它很快,也能避免資料太髒。但只要第 13 天的 BE03 和第 19 天的 BE03 文字不同,信度、CFA(驗證性因素分析)與 IRT 就不再談同一個 indicator(指標題目)。教科書的案例一致性不能靠題號看起來相同。

ENGAGE-v1 的固定契約

案例有三個暫定構念,每個四題:

構念 題號 題意範圍 不代表什麼
行為投入 BE BE01–BE04 準備、參與、持續、依進度完成 服從、成績或人格
情緒投入 EE EE01–EE04 興趣、期待、好奇、享受理解 臨床情緒狀態
認知投入 CE CE01–CE04 連結、比較假設、自我檢查、找證據 一般智力

以下把十二題的題意逐字固定下來;後面各篇引用相同題號時,指的都是這段文字,不再另行改寫。

構念 題號 題意
行為投入 BE BE01 我會準時完成課前準備
行為投入 BE BE02 我會持續參與課堂活動
行為投入 BE BE03 遇到困難時我仍會完成學習任務
行為投入 BE BE04 我會依進度繳交課程作業
情緒投入 EE EE01 我對課程內容感到有興趣
情緒投入 EE EE02 我期待參與這門課
情緒投入 EE EE03 課堂活動會引起我的好奇
情緒投入 EE EE04 我享受理解課程概念的過程
認知投入 CE CE01 我會把新概念連回已知內容
認知投入 CE CE02 我會比較不同解法的假設
認知投入 CE CE03 我會檢查自己的理解是否有漏洞
認知投入 CE CE04 我會為困難概念尋找額外證據

所有題目使用 1–5 的 Likert 作答反應(李克特量尺)。資料共有 600 筆,A、B 兩組各 300 筆;群體只是示範 measurement invariance(測量恆等性)的教學標籤,不對應真實校系。生成器使用 seed(隨機種子) 20260901:先在 R 中抽出三個彼此相關的潛在構念(相關分別為 .55、.50、.60),再依各題的因素負荷量(loading)產生連續反應並以五個切點轉成 1–5,B 組的 BE04 額外加入 0.25 的位移;完整生成程式會在第 22 天整篇列出,讀者可自行重建同一份資料。這張表的用途是維持識別碼和內容範圍,不是內容效度證據;題目是否充分代表學習投入,需要更完整的理論與專家程序。

Claude 協助檢查,不能替題目背書

可請 Claude 先把每題對應到預定構念,再提出「它可能測到別的東西」的解釋。例如 BE01 與 BE04 都涉及按時完成,就值得追問是否過度集中在服從要求。這只是內容審查的起點;語言模型提出的疑點,不能代替專家判斷與目標族群的理解證據。

我保留四題,是因為後續需要一個穩定示例,並在 ledger(來源與主張帳本)中註明內容窄化。若這是真實量表開發,我會加入目標族群訪談、專家審查、認知訪談與試測;這裡不假裝完成那些程序。

若為了增加題目變化,把 BE03 改成反向題「遇到困難時我會放棄」,就要重新評估它帶來的方法效應。這個反例可用來討論疏忽作答,卻不應直接加入既有題本,讓後面的三因素模型多出未計畫的解釋。需要展示反向題問題時,應另建失敗案例並標明版本。

合成資料如何產生

本例先生成三個相關的潛在變項,再依固定因素負荷量加上殘差,形成連續反應,最後以切點分成五類。A、B 組設定大致相同,但 BE04 在 B 組加入小幅位移,供恆等性篇討論局部差異。讀者因此能同時看到模型符合生成設定的部分,以及刻意留下、不能靠換資料消除的問題。

生成器跑出的 smoke test 是 600 rows、12 題目(item),總量表 alpha(內部一致性信度係數)約 0.843。這個數字只確認資料具有預期的相關結構,不是量表品質結論。後面 Day 13 會說明,總 alpha 甚至可能掩蓋三構念。

把案例做成可檢查的資料產品

我為 CSV(逗號分隔的資料檔)加了最小 schema test(資料結構定義):必須正好 600 列、12 個題目欄、所有反應都在 1–5、id 唯一、group 只有 A/B。這些檢查抓得到欄名錯誤與遺漏,抓不到構念定義錯誤。因此 schema 與內容審查分開記錄:前者可由程式重跑,後者要回到資料字典與用途。

資料版本還要固定「已知缺陷」。BE04 的 group shift 是刻意設計的教學事件,不能在 Day 18 因 fit(模型與資料摘要的相容程度)不漂亮而修掉。若模型只在完美資料上教,讀者會把任何不合預期的結果視為程式錯誤;保留局部不恆等,才能示範限制、診斷與不應比較的結論。

我另外保留生成機制與分析資料的界線。教師知道潛在變項(latent variable)和因素負荷量,是因為我們建立了合成資料;分析文章卻只讀 CSV,不把真值餵給模型。這讓完整例題可以比較估計與生成設定,又不會把「知道答案」混進實際分析程序。

最後,題目中文是教材的一部分,不只是欄名旁的說明。任何改字都可能改變理解與作答機制,所以 data dictionary(資料字典)、文章例句、學生學習單和 AI 助教必須引用同一份題目文字。版本一致性在此比生成更多樣本更重要。

反例是重新執行生成器卻不固定 seed。每次文章截圖會有不同相關、fit 與題目參數,讀者無法判斷差異來自方法還是資料。另一個失敗是手動改 CSV 卻仍稱 ENGAGE-v1。版本契約規定:題目、生成器或資料任何實質改動,都要升版並在 ledger 記錄,不覆寫 v1。

六層案例責任

資料機制是合成潛在(latent)作答歷程(response process)與 ordinal cut(有序類別);目標是示範三面向分數與方法,不估計真實學生母體;假設由生成器明定,但分析時不把真值直接交給估計器;可觀察量是 12 題反應與 group;估計規則由各章決定;能保證的是相同 R 與 seed 可重生相同資料,不能保證外部效度、內容充分性或實際群體可比。

後面的文章都要回到這個版本

今天完成版本化資料字典、生成器與固定的 ENGAGE-v1。它讓後續每篇文章能把新方法加在同一案例上,也保留一個預先設計的局部失敗。發展閱讀是生成器與測量模型;研究閱讀才進入正式量表發展與 validation 程序。

下一篇不增加新方法,而是安排三條閱讀路徑。因為教師可能只有九十分鐘要理解一個判斷,也可能要完整備課或查研究來源;同一本書需要允許不同進入方式,又不能讓速成路徑跳過限制。

來源與協作揭露


上一篇
不是從信度開始背:先定義測量問題與分數用途
下一篇
同一本書三種走法:速成、主線與研究閱讀路徑
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材13
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言