iT邦幫忙

2026 iThome 鐵人賽

DAY 29
0

小考解析正確,提示卻直接洩漏答案;互動模擬算得對,按鈕卻寫「提高效度」。這些素材能用平均分數決定發布嗎?前兩篇提供了範例與規格,今天用四個驗收面向示範如何判斷。真正的素材檔案、執行結果與審閱紀錄尚未齊全時,就先記下缺口,不能因設計表完整而說已通過。

四個軸,不是一個平均分數

驗收軸 教師要找的證據 阻擋發布的例子
誠信 integrity assistance level、答案隔離、對抗測試紀錄 正式評量的提示可拼出答案
正確 correctness claim 可回到 verified source 或可重現結果 把 CFI=.98 說成 98% 正確率
會教 pedagogy objective、活動、回饋與完成證據對齊 目標是解釋 residual,活動只背名詞
像這門課 course fit 用本課術語、案例、限制與教師判準 換掉課名仍可原封不動使用

每軸採三級判定:block、revise、ready。它不是把四個數字平均後,以 80 分掩蓋一個致命錯誤。誠信或正確性出現 block,整份素材就不能發布;pedagogy 與 course fit 的 revise 必須有負責人與下一次檢查日期。權重、門檻與例外由教師或課程團隊決定,Claude 只能協助整理證據。

完整例題:三種素材的條件判斷

以下依 Day 27 的小考與模擬設計、Day 28 的助教政策,示範如何使用驗收表。CFA-Q02 是示例 ID;目前沒有獨立素材、完整助教回覆或三份試評紀錄可供核對。因此下列 ready、revise、block 都是條件判斷,並非已執行的評分結果。

若小考答案明確說明「配適度只提供部分內部結構證據,不能單獨證明效度」,且解析與 Day 14、17 相符,正確性可具備判為 ready 的依據。但若提示直接洩漏這句話,誠信仍是 block。移除提示後須實際重跑洩漏檢查並存結果,才能更新該軸狀態;改過文字本身不是通過證據。

互動模擬讓學生調因素負荷量(loading)與殘差變異數(residual variance)。學生先寫預測,再觀察模型隱含相關(相關係數)。objective、操作與證據一致,pedagogy 可判 ready;但若介面把按鈕命名為「提高效度」,即使計算沒錯,也會把共變異數(covariance)變化誤說成效度(validity)。這是 correctness 的概念錯誤,不是文案小修。

即使未來 AI 助教通過 Day 28 的四類檢查,也仍要看它是否適合這門課。若只說「請參考課程材料」,沒有指向六層責任、ENGAGE-v1 的合成限制或當下練習階段,課程適切性仍可能是 revise。這是另一項待測條件;本文沒有紀錄可以宣稱四類檢查已通過。

Claude 協作:找證據,不替教師蓋章

我給 Claude rubric schema(評分準則、資料結構定義)、三份產物與 source/claim ledger(來源與主張帳本),請它逐格提出「支持 ready 的證據」和「可能推翻判定的反例」。這種雙欄輸出比單純問「教材好不好」有用,因為教師可以查每一項證據落在哪裡。

每一格對應的證據,形式如同帳本裡這列:

主張 狀態 支持來源
alpha 不證明單維 第一手來源已支持 Sijtsma(2009)§4.2,p. 115

若候選判定只因「有參考資料」就給正確性 ready,應退回核對支持關係:來源是否支持相鄰主張、程式結果是否對應固定資料與版本、課程判斷是否有在地依據。Claude 可以整理這些問題,不能用完整表格替代缺少的證據。最後的採用與發布仍由教師決定。

驗收紀錄至少保存 artifact(產出文件)/version 與 rubric 判定。也要記 evidence location(證據)、reviewer(審閱者)、日期與 disposition。改過題目後要建立新版本,不能覆蓋舊紀錄再沿用原本的 ready。

我另外加入一個「不可判定」狀態。若 reviewer 缺少教師版答案、無法執行程式,或來源頁已經失效,應先補證據,而不是因為沒看見錯誤便判 ready。這讓驗收表保留不知道的地方,也避免 AI 用完整語氣填平證據缺口。

反例:平均 90 分仍然不能發布

假設一份小考版面、回饋與課程語氣都很好,三軸各得 100;但它在 HTML 的 alt text 裡藏了正確選項,誠信得 60。平均仍有 90,卻明顯不能進正式評量。這就是不用總分抵銷 critical gate 的理由。

另一個 failure case(失敗案例)是只讓生成者自己驗收。作者熟悉意圖,容易把「我知道它想表達什麼」當成學生也看得懂。至少抽一份產物交給未參與生成的人,請他沿 objective → activity → evidence → claim → source 走一次;走不回去的地方,就是發布前要修的接縫。

第三個反例是把學生喜歡當成唯一成功指標。可用性與參與感值得觀察,卻不能取代學習證據、效度論證與公平性檢查。本系列沒有真實學習成效資料,也沒有完整素材試評紀錄,因此目前能交付的是驗收規準與示範,不是教材已提升成績或已通過所有關卡的證明。

若未來真的蒐集學習資料,仍要先說明用途、取得適當同意並建立新的效度論證;不能把平台點擊率直接命名為「學習成效」。

驗收表也要保留不可判定

原問題的答案是:教師驗收不是替 AI 文稿打風格分,而是守住四道不同的門。誠信與正確性是 critical gates;會教與像這門課讓素材從「沒有大錯」走到「值得放進這個學習脈絡」。

本篇留下四軸驗收表、三種條件判斷與應保存的紀錄欄位。實際試評要等素材、測試輸出與審閱者齊備再完成。下一篇把三十天的文章、案例、程式與設計要求接成更新流程,說明新問題進來時,應從哪個主張開始修。

來源與協作揭露


上一篇
心理計量 AI 助教:會教、不代寫、不超綱
下一篇
三十天後留下的不是三十篇文章,而是一套學習系統
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材 共 30 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言