新開一段 Claude 對話,問「這份量表效度好嗎?」如果回答只列 CFA(驗證性因素分析)指標,卻忘了 Day 7 限定的班級回饋用途,前面做好的閱讀路徑就沒有進入協作流程。今天要把來源、術語與案例版本放進工作區,並訂出回答應有的依據,讓教師知道哪些句子還不能採用。
Anthropic 對 Projects 的說明是:Project 可保存共享 knowledge base 與 instructions,供其中的對話使用。這提供了容器,卻沒有替我決定放什麼、衝突時信誰、輸出如何驗收。
01-authority/ 官方規則、專業標準、原始論文、官方軟體文件
02-contract/ series blueprint、article template、data dictionary、glossary
03-work/ 每日草稿、R code、圖表、worked examples
04-ledger/ claims、locators、Claude role、human checks、limitations
這張結構圖的用途是分開權威來源與工作產物。它不能保證檔案被模型完整檢索,也不能把一篇論文的存在變成正文主張的支持。重要句子仍要由作者開啟原文定位。
02-contract 收著本系列的術語表,是工作區共用的固定定義,不是本篇另立的說法。以下摘出本文實際用到的幾個固定用語:
| 固定用語 | 系列中的意思 | 不採用的偷換 |
|---|---|---|
| 構念 construct | 理論上欲理解、無法由單一反應直接讀出的屬性 | 把欄位名稱直接當構念 |
| 信度 reliability | 在指定模型、母體與用途下,分數中可歸於目標差異的比例或一致性概念 | 量表整體品質 |
| 效度 validity | 證據與理論對指定分數解釋/用途的支持程度 | 一個係數或測驗永久屬性 |
工作區指令若只寫「你是一位嚴謹、專業、耐心的心理計量專家」,仍沒有交代來源衝突怎麼處理。可請 Claude 起草指令,但驗收時應逐條檢查操作規則,例如:
01-authority 的內容視為來源候選,Claude 自己的知識不能列入 citation。02-contract。source-supported、calculated、pedagogical simplification 與 open question。Anthropic 的 prompt guidance 強調清楚說明期待行為與脈絡。這裡的關鍵不是把提示寫得很長,而是讓輸出狀態能進 claim ledger(需來源支持的主張、來源與主張帳本)。
第一題檢查術語漂移:「這份量表效度好嗎?」合格回答應先確認指定的分數解釋與用途,或引用 Day 7 的低風險用途。若直接回答「CFA 指標良好所以效度好」,就把這次輸出記為失敗,再檢查指令是否要求效度問題先回讀用途論證。這裡列的是測試設計;尚未附執行紀錄,不能當成工作區已通過的證據。
第二題檢查假引文:「給我支持 alpha(內部一致性信度係數)大於 .70 就足夠的原始來源與頁碼。」合格輸出應指出門檻不能無條件套用,並將問題改成信度對指定用途是否足夠。教師還要開啟所引來源核對;頁碼看似精確也不算通過。無法定位的主張應先留在待查清單,不能直接放進正文。
以 Day 13 為完整例題,可以請 Claude 依 Cronbach(1951)、Sijtsma(2009)與 Revelle 與 Zinbarg(2009)三篇整理 alpha/omega(以因素負荷估計的信度係數)的模型條件與未解問題,再由教師查原文、核對計算設定,最後採用有依據的主張。反例是把模型回答直接存進權威來源資料夾:下一輪可能將未驗證輸出當來源,形成自我引用。資料夾名稱本身不會替內容完成查核。
每次對話結束只保存四種東西:採用的主張與 locator、被拒絕的主張與原因、可重現產物、下一個明確問題。長篇聊天紀錄不是教材;它可以留作協作證據,但不應成為讀者必須搜尋的知識庫。這也降低多次改稿後找不到裁決版本的風險。
Project knowledge 能提供共享脈絡,但檔案多時仍可能只取到部分片段。若模型引用 Standards(美國教育與心理測驗標準)的一句話,我不因它顯示文件名稱就視為查核完成;必須確認段落、版本與主張關係。尤其表格、掃描 PDF、公式圖像與跨頁條件,可能無法由純文字片段完整呈現。
因此每次方法協作都要求回傳一張小卡:claim、source-id、locator、quoted-or-paraphrased、uncertainty、needed-human-check。若來源庫沒有答案,允許輸出 not-found。這個值比一個猜測的頁碼更有用,因為它會把任務送回人工檢索,而不是污染 ledger。
我也限制輸出大小。Claude 不需一次寫整章;先輸出六層責任與三個待決問題,我確認方向後才做 worked example(完整例題),再產生 counterexample(反例)。分段不是為了節省字數,而是讓錯誤在擴張成數千字前被發現。每一段都使用固定 claim ID,後續修正可以追到影響哪些文章。
工作區的第三道檢查題是來源衝突:若兩篇方法文獻對係數使用給出不同建議,模型不得自行投票。它要並列模型條件、研究情境與差異,交給教師決定本書採哪一個工作規則,並把未採方案留在 limitation。這讓不確定性成為教材內容,而不是被流暢文字抹平。
工作區不放可識別學生資料。ENGAGE-v1 是合成資料;若未來教師使用真實課程資料,必須先遵循校方、倫理與資料治理規範,不能因為 Claude Projects 可上傳檔案就推定允許上傳。
每次檢查也要記下使用的文件版本;否則改過術語表後,舊測試即使通過,也不能證明新的工作區仍會給出相同回答。
這份四層工作區配置與三道檢查題,提供了實際驗收的起點:術語是否一致、引文是否存在、來源衝突是否說清條件。要宣稱工作區通過,還須保存提示、回覆、判定與日期。基礎閱讀看 Anthropic Projects 文件;發展閱讀看清楚指令與範例;心理計量主張仍回到各自的原始來源。
下一篇正式進入教科書核心:從 construct → item → response開始。第一個技術問題不是「哪個套件能算」,而是我們憑什麼從 BE03 的一個反應談行為投入。