小考解析正確,提示卻直接洩漏答案;互動模擬算得對,按鈕卻寫「提高效度」。這些素材能用平均分數決定發布嗎?前兩篇提供了範例與規格,今天用四個驗收面向示範如何判斷。真正的素材檔案、執行結果與審閱紀錄尚未齊全時,就先記下缺口,不能因設計表完整而說已通過。
| 驗收軸 | 教師要找的證據 | 阻擋發布的例子 |
|---|---|---|
| 誠信 integrity | assistance level、答案隔離、對抗測試紀錄 | 正式評量的提示可拼出答案 |
| 正確 correctness | claim 可回到 verified source 或可重現結果 | 把 CFI=.98 說成 98% 正確率 |
| 會教 pedagogy | objective、活動、回饋與完成證據對齊 | 目標是解釋 residual,活動只背名詞 |
| 像這門課 course fit | 用本課術語、案例、限制與教師判準 | 換掉課名仍可原封不動使用 |
每軸採三級判定:block、revise、ready。它不是把四個數字平均後,以 80 分掩蓋一個致命錯誤。誠信或正確性出現 block,整份素材就不能發布;pedagogy 與 course fit 的 revise 必須有負責人與下一次檢查日期。權重、門檻與例外由教師或課程團隊決定,Claude 只能協助整理證據。
以下依 Day 27 的小考與模擬設計、Day 28 的助教政策,示範如何使用驗收表。CFA-Q02 是示例 ID;目前沒有獨立素材、完整助教回覆或三份試評紀錄可供核對。因此下列 ready、revise、block 都是條件判斷,並非已執行的評分結果。
若小考答案明確說明「配適度只提供部分內部結構證據,不能單獨證明效度」,且解析與 Day 14、17 相符,正確性可具備判為 ready 的依據。但若提示直接洩漏這句話,誠信仍是 block。移除提示後須實際重跑洩漏檢查並存結果,才能更新該軸狀態;改過文字本身不是通過證據。
互動模擬讓學生調因素負荷量(loading)與殘差變異數(residual variance)。學生先寫預測,再觀察模型隱含相關(相關係數)。objective、操作與證據一致,pedagogy 可判 ready;但若介面把按鈕命名為「提高效度」,即使計算沒錯,也會把共變異數(covariance)變化誤說成效度(validity)。這是 correctness 的概念錯誤,不是文案小修。
即使未來 AI 助教通過 Day 28 的四類檢查,也仍要看它是否適合這門課。若只說「請參考課程材料」,沒有指向六層責任、ENGAGE-v1 的合成限制或當下練習階段,課程適切性仍可能是 revise。這是另一項待測條件;本文沒有紀錄可以宣稱四類檢查已通過。
我給 Claude rubric schema(評分準則、資料結構定義)、三份產物與 source/claim ledger(來源與主張帳本),請它逐格提出「支持 ready 的證據」和「可能推翻判定的反例」。這種雙欄輸出比單純問「教材好不好」有用,因為教師可以查每一項證據落在哪裡。
每一格對應的證據,形式如同帳本裡這列:
| 主張 | 狀態 | 支持來源 |
|---|---|---|
| alpha 不證明單維 | 第一手來源已支持 | Sijtsma(2009)§4.2,p. 115 |
若候選判定只因「有參考資料」就給正確性 ready,應退回核對支持關係:來源是否支持相鄰主張、程式結果是否對應固定資料與版本、課程判斷是否有在地依據。Claude 可以整理這些問題,不能用完整表格替代缺少的證據。最後的採用與發布仍由教師決定。
驗收紀錄至少保存 artifact(產出文件)/version 與 rubric 判定。也要記 evidence location(證據)、reviewer(審閱者)、日期與 disposition。改過題目後要建立新版本,不能覆蓋舊紀錄再沿用原本的 ready。
我另外加入一個「不可判定」狀態。若 reviewer 缺少教師版答案、無法執行程式,或來源頁已經失效,應先補證據,而不是因為沒看見錯誤便判 ready。這讓驗收表保留不知道的地方,也避免 AI 用完整語氣填平證據缺口。
假設一份小考版面、回饋與課程語氣都很好,三軸各得 100;但它在 HTML 的 alt text 裡藏了正確選項,誠信得 60。平均仍有 90,卻明顯不能進正式評量。這就是不用總分抵銷 critical gate 的理由。
另一個 failure case(失敗案例)是只讓生成者自己驗收。作者熟悉意圖,容易把「我知道它想表達什麼」當成學生也看得懂。至少抽一份產物交給未參與生成的人,請他沿 objective → activity → evidence → claim → source 走一次;走不回去的地方,就是發布前要修的接縫。
第三個反例是把學生喜歡當成唯一成功指標。可用性與參與感值得觀察,卻不能取代學習證據、效度論證與公平性檢查。本系列沒有真實學習成效資料,也沒有完整素材試評紀錄,因此目前能交付的是驗收規準與示範,不是教材已提升成績或已通過所有關卡的證明。
若未來真的蒐集學習資料,仍要先說明用途、取得適當同意並建立新的效度論證;不能把平台點擊率直接命名為「學習成效」。
原問題的答案是:教師驗收不是替 AI 文稿打風格分,而是守住四道不同的門。誠信與正確性是 critical gates;會教與像這門課讓素材從「沒有大錯」走到「值得放進這個學習脈絡」。
本篇留下四軸驗收表、三種條件判斷與應保存的紀錄欄位。實際試評要等素材、測試輸出與審閱者齊備再完成。下一篇把三十天的文章、案例、程式與設計要求接成更新流程,說明新問題進來時,應從哪個主張開始修。