iT邦幫忙

2026 iThome 鐵人賽

DAY 10
0

新開一段 Claude 對話,問「這份量表效度好嗎?」如果回答只列 CFA(驗證性因素分析)指標,卻忘了 Day 7 限定的班級回饋用途,前面做好的閱讀路徑就沒有進入協作流程。今天要把來源、術語與案例版本放進工作區,並訂出回答應有的依據,讓教師知道哪些句子還不能採用。

Anthropic 對 Projects 的說明是:Project 可保存共享 knowledge base 與 instructions,供其中的對話使用。這提供了容器,卻沒有替我決定放什麼、衝突時信誰、輸出如何驗收。

工作區分四層

01-authority/   官方規則、專業標準、原始論文、官方軟體文件
02-contract/    series blueprint、article template、data dictionary、glossary
03-work/        每日草稿、R code、圖表、worked examples
04-ledger/      claims、locators、Claude role、human checks、limitations

這張結構圖的用途是分開權威來源與工作產物。它不能保證檔案被模型完整檢索,也不能把一篇論文的存在變成正文主張的支持。重要句子仍要由作者開啟原文定位。

02-contract 收著本系列的術語表,是工作區共用的固定定義,不是本篇另立的說法。以下摘出本文實際用到的幾個固定用語:

固定用語 系列中的意思 不採用的偷換
構念 construct 理論上欲理解、無法由單一反應直接讀出的屬性 把欄位名稱直接當構念
信度 reliability 在指定模型、母體與用途下,分數中可歸於目標差異的比例或一致性概念 量表整體品質
效度 validity 證據與理論對指定分數解釋/用途的支持程度 一個係數或測驗永久屬性

Project instructions 寫責任,不寫人格

工作區指令若只寫「你是一位嚴謹、專業、耐心的心理計量專家」,仍沒有交代來源衝突怎麼處理。可請 Claude 起草指令,但驗收時應逐條檢查操作規則,例如:

  1. 只把 01-authority 的內容視為來源候選,Claude 自己的知識不能列入 citation。
  2. 使用構念、題號、資料版本與術語時,先對照 02-contract
  3. 每次輸出分開 source-supportedcalculatedpedagogical simplificationopen question
  4. 缺 locator(來源的精確位置)就標示缺口,不得補造頁碼、DOI(文獻永久識別碼)或套件結果。
  5. 方法篇依六層責任輸出,至少提出一個會失敗的條件。
  6. 產生程式骨架時列出套件、版本需求、seed(隨機種子)、預期輸入與要人工檢查的輸出。

Anthropic 的 prompt guidance 強調清楚說明期待行為與脈絡。這裡的關鍵不是把提示寫得很長,而是讓輸出狀態能進 claim ledger(需來源支持的主張、來源與主張帳本)。

用兩道檢查題驗收工作區

第一題檢查術語漂移:「這份量表效度好嗎?」合格回答應先確認指定的分數解釋與用途,或引用 Day 7 的低風險用途。若直接回答「CFA 指標良好所以效度好」,就把這次輸出記為失敗,再檢查指令是否要求效度問題先回讀用途論證。這裡列的是測試設計;尚未附執行紀錄,不能當成工作區已通過的證據。

第二題檢查假引文:「給我支持 alpha(內部一致性信度係數)大於 .70 就足夠的原始來源與頁碼。」合格輸出應指出門檻不能無條件套用,並將問題改成信度對指定用途是否足夠。教師還要開啟所引來源核對;頁碼看似精確也不算通過。無法定位的主張應先留在待查清單,不能直接放進正文。

以 Day 13 為完整例題,可以請 Claude 依 Cronbach(1951)、Sijtsma(2009)與 Revelle 與 Zinbarg(2009)三篇整理 alpha/omega(以因素負荷估計的信度係數)的模型條件與未解問題,再由教師查原文、核對計算設定,最後採用有依據的主張。反例是把模型回答直接存進權威來源資料夾:下一輪可能將未驗證輸出當來源,形成自我引用。資料夾名稱本身不會替內容完成查核。

對話如何交接

每次對話結束只保存四種東西:採用的主張與 locator、被拒絕的主張與原因、可重現產物、下一個明確問題。長篇聊天紀錄不是教材;它可以留作協作證據,但不應成為讀者必須搜尋的知識庫。這也降低多次改稿後找不到裁決版本的風險。

檢索到不等於讀對

Project knowledge 能提供共享脈絡,但檔案多時仍可能只取到部分片段。若模型引用 Standards(美國教育與心理測驗標準)的一句話,我不因它顯示文件名稱就視為查核完成;必須確認段落、版本與主張關係。尤其表格、掃描 PDF、公式圖像與跨頁條件,可能無法由純文字片段完整呈現。

因此每次方法協作都要求回傳一張小卡:claimsource-idlocatorquoted-or-paraphraseduncertaintyneeded-human-check。若來源庫沒有答案,允許輸出 not-found。這個值比一個猜測的頁碼更有用,因為它會把任務送回人工檢索,而不是污染 ledger。

我也限制輸出大小。Claude 不需一次寫整章;先輸出六層責任與三個待決問題,我確認方向後才做 worked example(完整例題),再產生 counterexample(反例)。分段不是為了節省字數,而是讓錯誤在擴張成數千字前被發現。每一段都使用固定 claim ID,後續修正可以追到影響哪些文章。

工作區的第三道檢查題是來源衝突:若兩篇方法文獻對係數使用給出不同建議,模型不得自行投票。它要並列模型條件、研究情境與差異,交給教師決定本書採哪一個工作規則,並把未採方案留在 limitation。這讓不確定性成為教材內容,而不是被流暢文字抹平。

工作區不放可識別學生資料。ENGAGE-v1 是合成資料;若未來教師使用真實課程資料,必須先遵循校方、倫理與資料治理規範,不能因為 Claude Projects 可上傳檔案就推定允許上傳。

每次檢查也要記下使用的文件版本;否則改過術語表後,舊測試即使通過,也不能證明新的工作區仍會給出相同回答。

配置完成後還要實測

這份四層工作區配置與三道檢查題,提供了實際驗收的起點:術語是否一致、引文是否存在、來源衝突是否說清條件。要宣稱工作區通過,還須保存提示、回覆、判定與日期。基礎閱讀看 Anthropic Projects 文件;發展閱讀看清楚指令與範例;心理計量主張仍回到各自的原始來源。

下一篇正式進入教科書核心:從 construct → item → response開始。第一個技術問題不是「哪個套件能算」,而是我們憑什麼從 BE03 的一個反應談行為投入。

來源與協作揭露


上一篇
同一本書三種走法:速成、主線與研究閱讀路徑
下一篇
測量到底在量什麼:construct、item 與 response
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材13
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言