一個回答寫了「配適度不等於效度」,結尾卻又說「因此本量表構念效度良好」,算通過查核嗎?前面各篇已累積這類推論錯誤,今天將它們整理成失敗案例集(failure atlas):替每個案例固定輸入、預期診斷與修正方向。之後再遇到相似句子,就有具體的檢查題可用,不必只靠記憶搜尋正文。
| 欄位 | 問題 |
|---|---|
| id | 這個 failure 如何被穩定引用? |
| trigger | 什麼最小輸入會重現? |
| naive-output | 未受約束的 Claude/分析最可能產生什麼? |
| violated-layer | 六層責任哪一層被跨過? |
| expected-diagnosis | 合格回答必須指出什麼? |
| repair | 如何縮小主張、改資料或改模型? |
| regression-probe | 修正後如何確定錯誤沒有回來? |
| residual-risk | probe 仍抓不到什麼? |
表格的用途是把錯誤變成可執行教材。它不能窮舉所有心理計量風險;atlas 必須隨新錯誤增長。
資料機制是刻意構造的最小失敗案例;目標是檢查系統能否辨認並縮小錯誤主張;假設是測試案例確實代表要攔截的錯誤;可觀察量是模型回答、程式狀態與帳本欄位;決策規則是回答是否指出具體缺口並拒絕禁止的結論;通過只能支持已測案例,未知錯誤與語意變形仍需內容審查。
| id | trigger | 必須出現的診斷 |
|---|---|---|
| F01-alpha-dimension | 12 題總 alpha=.843,資料由三 factors 生成 | alpha 不證明單維或內容代表性 |
| F02-fit-validity | 三因素 CFA CFI 很高 | fit 只支援部分 internal-structure 論證 |
| F03-group-mean | A/B observed mean 不同,BE04 noninvariant | 不直接解釋 latent group difference |
| F04-irt-local | 兩近義題 residual dependent、a 很高 | information 可能被高估,回查 local dependence |
| F05-code-version | 同欄名舊 CSV、不同 seed | hash/version 不符即停止,不接受漂亮輸出 |
| F06-source-claim | 真 DOI 配上「omega 永遠較好」 | 來源存在不等於支持全稱主張 |
媒介讓六種 failure 可快速比較,但不能取代每個 record 的完整輸入與修復理由。
trigger 是一張 CFA output card(把理論寫成可被資料反駁的模型),包含可接受的 global fit(整體配適)與合理因素負荷量(loading)。給 Claude 的問題故意簡短:「請判斷這份量表是否已具有良好構念效度。」naive output 往往直接肯定,再重述 fit indices。例如 CFI/TLI 摘要相對 baseline 模型(model)的改善、RMSEA(近似誤差均方根)摘要近似誤差與自由度、SRMR 摘要標準化殘差,三者都不證明模型正確。
這些檢查針對的模型是:
| 因素 | 量測題目 | lavaan 語法 |
|---|---|---|
| BE | BE01–BE04 | BE =~ BE01 + BE02 + BE03 + BE04 |
| EE | EE01–EE04 | EE =~ EE01 + EE02 + EE03 + EE04 |
| CE | CE01–CE04 | CE =~ CE01 + CE02 + CE03 + CE04 |
expected diagnosis 必須完成四步。第一,指出分數解釋(score interpretation)/use 尚未完整。第二,把 CFA 限在內部結構(internal structure) evidence(證據)。第三,列出未處理的內容、作答歷程(response process)、external relations 或 consequences。第四,拒絕由單一 fit 給整體效度(validity)結論。若回答只是加一句「仍需更多研究」,不算通過,因為沒有定位缺口。
repair 是把文章主張改為:「在指定三因素模型與合成資料下,結果與預定 internal structure 相容;這不單獨建立效度。」regression-probe 再換一組漂亮數字,確認模型不因數值更好就跨越相同邊界。
可請 Claude 先寫幾種「看起來合理但推論越界」的答案,再以六層責任逐一檢查。例如「alpha(不證明單一構念)超過 .8,題目高度一致,因此都測量學習投入」,就要分開題目共變、維度與內容涵蓋。這是一種產生測試候選的流程,不是本輪已完成對抗測試的報告。
拿本系列的手算例來對照,數字本身長這樣:
| 步驟 | 數值(Day 13 四題例) |
|---|---|
| 題目變異數總和 | 4 |
| 總分變異數 | 8.8 |
| alpha | 4/3 × (1 − 4/8.8) ≈ .727 |
設計時還要避免把答案洩漏在題目裡。若輸入直接標成「F01:高 alpha 不等於單維」,回答很可能只是重述標題。可以遮去錯誤 ID,以日常報告語氣呈現,再請受測系統判定可採用、需修正或禁止結論。教師應先確認題目沒有明示答案,執行後保存完整回覆與判定理由。
如果 regression test(迴歸)只找「不等於」或「限制」兩個詞,Claude 可以寫「fit 不等於一切,但本量表構念效度良好」,形式通過、實質仍錯。probe 要檢查具體行為:有沒有縮小 claim(需來源支持的主張)、有沒有指出未測 inference、有沒有拒絕高風險用途。
第二個 failure case(失敗案例)是所有反例都靠極端數字,例如因素相關(相關係數)=1.2。真實錯誤通常較模糊:0.96 是高但未越界,仍需看可區分性與不確定性。atlas 同時保留 hard failure 與 judgment probe,前者可機械判定,後者由教師 rubric(評分準則)評分。
F07-logistic-sign 固定 a=1.5,b=.5,θ=-.5/.5/1.5,要求 probability 單調增加且中心為 .5。F08-posterior-normalization 要求 weights 和為 1。F09-item-id-state 則讓計算正確但把作答反應(response)寫到錯題目(item),檢查 trace identity(執行軌跡)。F10-converged-heywood 提供收斂但 negative 殘差變異數(residual variance)的 CFA,合格系統不得報「模型成功」。
這些 probes 能放進 R test,也能放進 AI 助教測試。數學 tests 通過不代表教學回答自然;同一 failure 會有 machine assertion(程式內的前提檢查)和 human explanation 兩個層級。
目前文章列出的十項案例是測試規格;並沒有十項模型回覆、評分與重跑結果可供核對。實作時每次至少記錄案例版本、輸入、實際輸出、判定、理由與日期,數學檢查則另存計算結果。若沒有執行,狀態應停在待測,而不是因表格完整就標成通過。
同一個 F02 也可準備兩種回答供教師練習評分。一種只加上「仍需研究」,但保留整體效度結論;另一種明確將結果限於指定模型的內部結構,並指出未檢查的作答過程。兩者都有保守用語,判定卻應不同。寫下區別理由,才能讓測試檢查推論,而不是獎勵關鍵詞。
每篇技術稿完成後,先依主張類型選至少一個既有 probe,再新增本篇特有的 counterexample(反例)。若新錯誤影響前文,例如 ordinal thresholds(有序類別、切點)的參數化被寫錯,需標記受影響 Day、修訂文章、更新 ledger(來源與主張帳本)與 regression probe。錯誤不刪除,狀態從 open 變 resolved,保留修復版本。
原問題的答案是:反例若有穩定 trigger、expected diagnosis 與 regression probe,就能成為可重用教材,而不只是提醒。發展閱讀是 software tests 與模型 diagnostics;前沿閱讀可進 adversarial evaluation、metamorphic testing 與 assessment 效度。
今日產物是十項 failure atlas(失敗案例集)初版。核心六項跨越信度(reliability)與效度,以及 data version 與 sources。它們也涵蓋 invariance(測量恆等性)與 IRT(試題反應理論)。下一篇接手 F06:如何讓每個主張回到作者、年份、版本與精確 locator(來源的精確位置),並清楚標示只是計算、簡化或待研究問題。