iT邦幫忙

2026 iThome 鐵人賽

DAY 23
0

一個回答寫了「配適度不等於效度」,結尾卻又說「因此本量表構念效度良好」,算通過查核嗎?前面各篇已累積這類推論錯誤,今天將它們整理成失敗案例集(failure atlas):替每個案例固定輸入、預期診斷與修正方向。之後再遇到相似句子,就有具體的檢查題可用,不必只靠記憶搜尋正文。

每筆失敗案例要記什麼

欄位 問題
id 這個 failure 如何被穩定引用?
trigger 什麼最小輸入會重現?
naive-output 未受約束的 Claude/分析最可能產生什麼?
violated-layer 六層責任哪一層被跨過?
expected-diagnosis 合格回答必須指出什麼?
repair 如何縮小主張、改資料或改模型?
regression-probe 修正後如何確定錯誤沒有回來?
residual-risk probe 仍抓不到什麼?

表格的用途是把錯誤變成可執行教材。它不能窮舉所有心理計量風險;atlas 必須隨新錯誤增長。

六層責任

資料機制是刻意構造的最小失敗案例;目標是檢查系統能否辨認並縮小錯誤主張;假設是測試案例確實代表要攔截的錯誤;可觀察量是模型回答、程式狀態與帳本欄位;決策規則是回答是否指出具體缺口並拒絕禁止的結論;通過只能支持已測案例,未知錯誤與語意變形仍需內容審查。

六個核心檢查題

id trigger 必須出現的診斷
F01-alpha-dimension 12 題總 alpha=.843,資料由三 factors 生成 alpha 不證明單維或內容代表性
F02-fit-validity 三因素 CFA CFI 很高 fit 只支援部分 internal-structure 論證
F03-group-mean A/B observed mean 不同,BE04 noninvariant 不直接解釋 latent group difference
F04-irt-local 兩近義題 residual dependent、a 很高 information 可能被高估,回查 local dependence
F05-code-version 同欄名舊 CSV、不同 seed hash/version 不符即停止,不接受漂亮輸出
F06-source-claim 真 DOI 配上「omega 永遠較好」 來源存在不等於支持全稱主張

媒介讓六種 failure 可快速比較,但不能取代每個 record 的完整輸入與修復理由。

完整例題:F02 從一句錯話變成測試

trigger 是一張 CFA output card(把理論寫成可被資料反駁的模型),包含可接受的 global fit(整體配適)與合理因素負荷量(loading)。給 Claude 的問題故意簡短:「請判斷這份量表是否已具有良好構念效度。」naive output 往往直接肯定,再重述 fit indices。例如 CFI/TLI 摘要相對 baseline 模型(model)的改善、RMSEA(近似誤差均方根)摘要近似誤差與自由度、SRMR 摘要標準化殘差,三者都不證明模型正確。

這些檢查針對的模型是:

因素 量測題目 lavaan 語法
BE BE01–BE04 BE =~ BE01 + BE02 + BE03 + BE04
EE EE01–EE04 EE =~ EE01 + EE02 + EE03 + EE04
CE CE01–CE04 CE =~ CE01 + CE02 + CE03 + CE04

expected diagnosis 必須完成四步。第一,指出分數解釋(score interpretation)/use 尚未完整。第二,把 CFA 限在內部結構(internal structure) evidence(證據)。第三,列出未處理的內容、作答歷程(response process)、external relations 或 consequences。第四,拒絕由單一 fit 給整體效度(validity)結論。若回答只是加一句「仍需更多研究」,不算通過,因為沒有定位缺口。

repair 是把文章主張改為:「在指定三因素模型與合成資料下,結果與預定 internal structure 相容;這不單獨建立效度。」regression-probe 再換一組漂亮數字,確認模型不因數值更好就跨越相同邊界。

Claude 協作:讓模型攻擊自己的答案

可請 Claude 先寫幾種「看起來合理但推論越界」的答案,再以六層責任逐一檢查。例如「alpha(不證明單一構念)超過 .8,題目高度一致,因此都測量學習投入」,就要分開題目共變、維度與內容涵蓋。這是一種產生測試候選的流程,不是本輪已完成對抗測試的報告。

拿本系列的手算例來對照,數字本身長這樣:

步驟 數值(Day 13 四題例)
題目變異數總和 4
總分變異數 8.8
alpha 4/3 × (1 − 4/8.8) ≈ .727

設計時還要避免把答案洩漏在題目裡。若輸入直接標成「F01:高 alpha 不等於單維」,回答很可能只是重述標題。可以遮去錯誤 ID,以日常報告語氣呈現,再請受測系統判定可採用、需修正或禁止結論。教師應先確認題目沒有明示答案,執行後保存完整回覆與判定理由。

反例:只測關鍵字

如果 regression test(迴歸)只找「不等於」或「限制」兩個詞,Claude 可以寫「fit 不等於一切,但本量表構念效度良好」,形式通過、實質仍錯。probe 要檢查具體行為:有沒有縮小 claim(需來源支持的主張)、有沒有指出未測 inference、有沒有拒絕高風險用途。

第二個 failure case(失敗案例)是所有反例都靠極端數字,例如因素相關(相關係數)=1.2。真實錯誤通常較模糊:0.96 是高但未越界,仍需看可區分性與不確定性。atlas 同時保留 hard failure 與 judgment probe,前者可機械判定,後者由教師 rubric(評分準則)評分。

公式與程式 failures

F07-logistic-sign 固定 a=1.5,b=.5,θ=-.5/.5/1.5,要求 probability 單調增加且中心為 .5。F08-posterior-normalization 要求 weights 和為 1。F09-item-id-state 則讓計算正確但把作答反應(response)寫到錯題目(item),檢查 trace identity(執行軌跡)。F10-converged-heywood 提供收斂但 negative 殘差變異數(residual variance)的 CFA,合格系統不得報「模型成功」。

這些 probes 能放進 R test,也能放進 AI 助教測試。數學 tests 通過不代表教學回答自然;同一 failure 會有 machine assertion(程式內的前提檢查)和 human explanation 兩個層級。

目前文章列出的十項案例是測試規格;並沒有十項模型回覆、評分與重跑結果可供核對。實作時每次至少記錄案例版本、輸入、實際輸出、判定、理由與日期,數學檢查則另存計算結果。若沒有執行,狀態應停在待測,而不是因表格完整就標成通過。

同一個 F02 也可準備兩種回答供教師練習評分。一種只加上「仍需研究」,但保留整體效度結論;另一種明確將結果限於指定模型的內部結構,並指出未檢查的作答過程。兩者都有保守用語,判定卻應不同。寫下區別理由,才能讓測試檢查推論,而不是獎勵關鍵詞。

失敗案例如何進入寫作

每篇技術稿完成後,先依主張類型選至少一個既有 probe,再新增本篇特有的 counterexample(反例)。若新錯誤影響前文,例如 ordinal thresholds(有序類別、切點)的參數化被寫錯,需標記受影響 Day、修訂文章、更新 ledger(來源與主張帳本)與 regression probe。錯誤不刪除,狀態從 open 變 resolved,保留修復版本。

原問題的答案是:反例若有穩定 trigger、expected diagnosis 與 regression probe,就能成為可重用教材,而不只是提醒。發展閱讀是 software tests 與模型 diagnostics;前沿閱讀可進 adversarial evaluation、metamorphic testing 與 assessment 效度。

今日產物是十項 failure atlas(失敗案例集)初版。核心六項跨越信度(reliability)與效度,以及 data version 與 sources。它們也涵蓋 invariance(測量恆等性)與 IRT(試題反應理論)。下一篇接手 F06:如何讓每個主張回到作者、年份、版本與精確 locator(來源的精確位置),並清楚標示只是計算、簡化或待研究問題。

來源與協作揭露


上一篇
讓模型真的跑起來:用 R 重現 lavaan 與 mirt 分析
下一篇
每個主張都找得到來源嗎:建立來源—主張—定位表
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材 共 24 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言