iT邦幫忙

2026 iThome 鐵人賽

DAY 16
0

同一份 12 題資料,保留兩個、三個或四個因素,可能各有一張看起來合理的負荷量表。教師該選哪個?昨天已分開結構與命名,今天用 ENGAGE-v1 規劃探索性因素分析(EFA):先列可比較的方案,再決定估計方法、因素數、旋轉與解釋的依據。只請 Claude「幫我做 EFA(探索性因素分析)」,會把這些選擇一起交出去。

EFA 不是一個按鈕

先把決策與保留的比較寫在同一張紀錄表;表中的英文名稱方便對照軟體輸出,不能代替選擇理由:

決策 本系列工作選擇 要保留的比較
資料關聯 ordinal 題目優先檢查 polychoric;另看 Pearson 敏感度 兩種相關的結構差異
extraction common factor extraction 不以 PCA 代替共同因素模型
factor number parallel analysis、scree、解釋性與 residuals 合併判斷 2、3、4 factors
rotation 因構念預期相關,採 oblique factor correlation 與 pattern matrix
interpretation 先盲化看 pattern,再回題意命名 cross-loading 與內容缺口
score 本篇不產生高風險個人分數 factor score indeterminacy 留待用途判斷

表格的用途是讓選擇可重做,不代表這套設定適用所有資料。樣本大小、分布、題目數與模型複雜度改變時,估計表現也會改變。

六層責任

層 ENGAGE-v1 EFA
資料機制 12 題 ordinal responses,由相關的共同因素與 residuals 生成
目標 探索可解釋 correlation pattern 的 factor number 與 loadings structure
假設 選定相關模型、共同因素模型、樣本足以、rotation 與 missing handling 合理
可觀察量 item distributions、correlation matrix、eigenvalues、residuals
估計規則 factor extraction,加 oblique rotation;factor retention 用多項證據
保證/限制 產生結構候選;不確認理論、不自動提供唯一 factor solution

Parallel analysis 在比較什麼

Kaiser 的 eigenvalue>1 規則很方便,也容易在不同條件下保留過多或過少因素(factor)。Horn 的 parallel analysis 提出另一個基準:將 observed eigenvalues 與在相應隨機資料下會出現的 eigenvalues 比較,只保留明顯超過隨機基準的部分。它在處理 sampling variation,不是把因素數(factor number)變成無需判斷的真值。

對 ENGAGE-v1,生成設定是三個相關因素,所以三因素是有意義的驗證目標;但分析時我不直接告訴演算法答案。我會比較 2、3、4-factor solutions:2 因素是否把 EE/CE 合併而留下可解釋殘差(residual)?4 因素是否把 wording 或單一題群拆成不穩定因素?

Claude 協作:讓它解釋差異,不替我選 winner

準備好相關矩陣、平行分析圖與三種旋轉後的負荷量表,才適合請 Claude 比較方案。每個方案都要回答哪些題目共同負荷、哪些跨負荷、因素相關多大、內容被如何合併或切分,以及還有哪些競爭解釋。若要選「最佳模型」,先寫選擇規則,不能讓形容詞代替判斷。

一種待攔下的回答是只把負荷量大於 0.4 的題目歸類,忽略 CE02 在兩個因素上的跨負荷。這是示範情境,並非本輪取得的估計表。教師應同時看負荷量差距與題意:CE02「比較不同解法的假設」可能涉及認知投入,也帶有課堂行為要求。刪題會改變內容,保留則要在後續模型明說限制。

完整例題:三因素候選如何形成

假設 parallel analysis 的前三個 observed eigenvalues 高於隨機基準,第四個接近;scree 在第三後彎折。三因素 oblique solution 中,BE01–BE04、EE01–EE04、CE01–CE04 大致形成三群,因素相關(correlation)約 0.4–0.6;2-factor solution 把 EE 與 CE 擠在一起,出現系統殘差;4-factor solution 的第四因素只有兩個近義題。

我不因三項訊號一致就寫「證實三構念」。EFA 給出與三構念相容的候選,後續 CFA(驗證性因素分析,把理論寫成可被資料反駁的模型)用預先寫出的限制在另一個分析階段測試;內容與用途仍由效度論證管理。

預先寫出的限制在本系列就是這三行:

因素 量測題目 lavaan 語法
BE BE01–BE04 BE =~ BE01 + BE02 + BE03 + BE04
EE EE01–EE04 EE =~ EE01 + EE02 + EE03 + EE04
CE CE01–CE04 CE =~ CE01 + CE02 + CE03 + CE04

反例:漂亮 simple structure,錯誤問題

將所有負向或長句放在同一因素,rotation 可能產生很乾淨的 simple structure。若直接命名「低投入」,其實可能是 wording/閱讀負荷因素。這是為何因素命名必須回題目內容與作答歷程(response process)。

第二個 failure case(失敗案例)是為了讓因素負荷量(loading)乾淨,重複嘗試因素數、rotation、刪題,最後只報最漂亮一次。這把探索彈性藏起來。decision record 要保存試過的合理方案與拒絕理由,讓讀者知道 solution 如何被選出。

請先試著為兩因素方案寫一句拒絕理由。如果理由只有「三因素比較漂亮」,還不夠;應指出哪一組題目被合併、殘差出現什麼模式,以及該模式為何影響本系列的三面向解釋。這樣才能讓候選方案留下可檢查的決策痕跡。

可重現骨架

Day 22 會把這些步驟整理成可執行的程式骨架;完整套件分析仍需在執行環境保存輸出。此處先固定介面:讀取 12 題、記錄版本、建立有序反應的相關模型、以固定 seed(隨機種子)做平行分析,再保存 2/3/4 因素的負荷量表與殘差摘要。程式可以估計,因素命名與拒絕理由仍由教師填寫。

若資料量允許,可將探索與確認安排在不同資料上。本例的 A、B 組各 300 筆,不能直接拿前 300 筆做 EFA、後 300 筆做 CFA,讓分析階段與群體混在一起。若要示範切分,可先在每組內以固定 seed 隨機分成兩半,再各取 150 筆合成探索與確認樣本。這仍會降低每階段資訊,也不是普遍必用的規則;真正研究應依樣本、模型與重現設計決定。本文只提出設計,未執行這個切分。

教師還要保存被拒絕的方案。2-factor、3-factor、4-factor 的主要 pattern、fit(模型與資料摘要的相容程度)/殘差訊號與拒絕理由都進 decision record。這讓後續讀者可判斷結論是否只在一個 rotation 或一個 threshold(切點)下成立,也讓 Claude 不會在新對話中把舊候選當成從未考慮過。

原問題的答案是:EFA 可以讓資料暴露結構候選,但因素數與意義來自多項證據和明示裁決。發展閱讀是 Fabrigar 等人的決策討論與 Horn parallel analysis;前沿閱讀可進 simulation-based retention、ESEM 與 Bayesian EFA。

本篇留下 EFA 決策表、三方案的條件比較與跨負荷反例;尚未以實際估計結果選定優勝模型。下一篇將三構念候選寫成 CFA,讓理論限制清楚到足以被資料挑戰。

來源與協作揭露


上一篇
從相關矩陣到潛在變項:因素分析為何出現
下一篇
CFA:把理論寫成一個可能被資料反駁的模型
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材 共 22 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言