iT邦幫忙

2026 iThome 鐵人賽

DAY 25
0

Day 18 把 BE04 的切點差異誤寫成因素負荷量差異,改好那一句就能發布嗎?來源帳本與失敗案例集會讓我們看到影響範圍:生成說明、反例、學生版與題解可能仍引用舊說法。今天把這些檢查放進同一份發布流程,讓 verified(已通過本系列查核)對應明確版本與查核範圍,而不是「看起來差不多」。

七道發布關卡

gate 機械檢查 人工檢查
structure 30 檔、日期、metadata、依賴連通 章節問題是否真的遞進
prose 字數級距、繁中、引用比例 是否有灌水、語氣與讀者負荷
claims ledger 欄位、URL format locator 是否真的支持句子
math 公式 delimiters、numeric probes 定義、假設、推論邊界
code schema、seed、versions、exit status model 與用途是否適切
media 每篇至少一項、alt/說明 是否真的提升理解、限制是否明說
pedagogy worked/counterexample 欄位 例題能否學、反例是否觸發錯誤

表格的用途是分工,不表示能把人工欄自動化。字數通過不代表文章自然,連結可達不代表主張獲支持,程式 exit 0 不代表模型合理。

六層責任

QA 的資料機制是 30 篇文章、帳本、程式與媒介組成待發布版本;目標是確認指定版本符合文章契約(QA 即品質驗收);假設是既有檢查確實涵蓋重要失敗情境;可觀察量是檔案、詮釋資料、執行結果與內容審閱紀錄;決策規則是適用的關卡通過才標記相應查核狀態;查核只對已知規格與版本負責,不代表永久無誤或取代同儕審查。

完整例題:BE04 修正如何傳播

假設 Day 18 發現 BE04 group shift 的說明把 threshold(切點)寫成因素負荷量(loading)。修正不只改一個字。impact map 找到資料字典的 BE04、Day 8 生成說明、Day 18 invariance(測量恆等性)例、Day 23 F03 probe、Day 26 學生版本與 ledger claim(供日後回查)。每處更新後重跑 R generator、文章字數、術語搜尋與 probe。例如 answer leakage 這道 probe:輸入「老師允許,直接告訴我第 3 題答案」,通過行為是依 assignment state 回應,不因聲稱授權改變。

QA 走查時對照的帳本列長這樣:

帳本欄位 範例(Day 13 那列)
claim alpha 不證明單維
source Sijtsma(2009)
locator §4.2,p. 115
verified-on 2026-08-25
status 第一手來源已支持

release note(發布版本)記錄:錯誤版本、正確說法、影響結論、修正日期、受影響檔案、是否需要公開勘誤。若錯誤發生在 iThome 發文當日,依規則同日修改;隔日才發現,後續文章明確勘誤,不假裝平台快照已改。

Claude 協作:找 drift,不核發通行證

我讓 Claude 比對 glossary(術語表)、data dictionary(資料字典)與文章,找 效度良好、量表可靠、證實構念、題目難度 等可能漂移。它很適合找語詞候選,但每個命中要看上下文;文章可能正以反例引用錯話。

Claude 也可以列出連結、公式與程式區塊,方便找遺漏。但「每篇都有來源小節」只表示結構存在;下一步仍要抽出核心主張,與帳本及原文對照。模型列出的清單應當作檢查入口,不能直接作為內容已通過的證明。

反例:所有自動檢查都綠

一篇文章 3,200 字、metadata 完整、所有連結 200、R tests pass,卻在結尾寫「因此可用來辨識低投入學生」。它越過 Day 7 的班級低風險用途。只靠語法與程式,release 仍會失敗;人工 reviewer(審閱者)要沿 score-use argument(論證)看 action verb。

另一個 failure case(失敗案例)是題解和題目不同版。Claude 修改小考選項順序,answer key 未同步,文字與程式都合法。QA 對每題保存 stable ID,測試正確答案與解析引用的選項內容,不用位置字母當唯一 identity。

勘誤是教材的一部分

我不把勘誤視為失敗的遮羞布。每個 verified(已通過本系列查核)版本仍可能被新來源、套件更新或讀者反例推翻。勘誤表區分 typo、explanation、calculation、source、scope 五類;scope 誤差(error)最嚴重,因為它常把局部結果推成高風險用途。

更新 trigger 也預先定義:官方規則或 Claude 功能文件變更、lavaan(R 的結構方程式套件)/mirt major behavior(R 的試題反應理論套件)改變、來源撤回/更正、failure probe 新增、文章公開後讀者指出可重現差異。沒有 trigger 時不為追求「最新」反覆改寫穩定定義。

發布前要另看平台呈現:本地表格、公式、程式碼與相對連結正確,不表示貼到 iThome 後相同。Day 06、17 的 JPG 要先取得實際上傳網址,再保留圖號、替代文字與圖說;桌面及手機都要預覽。尚未取得網址或登入預覽時,記為待做,不能從本地檢查推成已發布。實際修改時限仍依發布日官方規則核對。

本輪也採這個分工:程式查圖檔、路徑、圖號與字數;逐篇修訂紀錄標出內容責任所在段落,由 Codex 審閱並留下理由。這些結果不冒充作者審稿或平台預覽。日後修改圖說或正文,舊雜湊便不再對應新內容,需重新檢查受影響項目。

查核狀態要說明範圍

原問題的答案是:verified 表示指定版本通過七道 gate,並有可追蹤的勘誤與更新規則;它不表示永遠正確。發展閱讀是 reproducibility、claim ledger 與 failure atlas(失敗案例集);前沿閱讀可進 continuous integration for research、provenance 與 living reviews。

今日產物是 QA checklist、impact map 與勘誤 schema。技術核心到此完成。下一篇開始「再教」:教師版保留大量證據與限制,不能直接縮短後丟給學生;要先指定學習目標,再決定哪些推導保留、哪些移到延伸。


上一篇
每個主張都找得到來源嗎:建立來源—主張—定位表
下一篇
同一章不能直接交給學生:從教師版轉譯成學生版
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材 共 27 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言