iT邦幫忙

2026 iThome 鐵人賽

DAY 8
0
Claude AI

Better than 情勒鳥!!Claude AI高中學測向英語家教Skill設計系列 第 8

Day 8 我好像把我自己疊代了 【完成全出題功能設計】

  • 分享至 

  • xImage
  •  

繼上篇,上次初步的自我審核 skill 設計已經確保了能夠審核出題 skill 的多個條件(符合學測題目標準、文章自然且有起承轉合、不違反我與他商談的使用者向設定、能自由安排錯題複習),在自我反覆審核與修改後再提出他認為的完全版給我確認。這份能力在後續達成共識後已經能產出具有水準的出題 skill 了,後續的篇章結構與閱讀題我都挑不出甚麼毛病。

但截至今天之前,他都尚未對非選題具有完整的規章制度,所以為了完善所有大題,將非選判斷標準也寫入自我審核 skill 是必須的。這篇文章首先詳細統整我這份 skill 兩天以來的設計細節,詳見以下。

方法論:把「AI出題品質保證」做成一套可重複使用的流程

前兩個大題(詞彙題、文意選填)是靠人工來回聊天+真人測試慢慢磨出規格的,成本不低。所以中途另外做了一個開發者專用的工具 skill——一個「考題擬真度審核員」:把目標大題的規格複製一份到沙盒,讓它自己在沙盒裡生成樣本題目、自己挑毛病、自己修,收斂到穩定之後才交給我做最後把關。

關鍵不是「有工具」,是這個工具的挑毛病邏輯有明確、不能打散的優先順序:

  1. 先確保真的抓到真實考題的出題手法(不單只比對格式、數字正確與否)。
  2. 再站在考生角度確認這樣設計是不是真的有教學價值——就算「很像真的考題」,如果對考生訓練沒幫助,一樣算不合格;反過來,就算「歷屆試題沒這樣做」,只要對訓練考生有效,也不用照抄。
  3. 最後才檢查有沒有跟既有規格衝突,衝突的地方留給人裁示,不自己選邊站。

今天綜合測驗、篇章結構、閱讀測驗三個全新大題,都是直接讓這套流程從歷屆試題(111~115學測,108課綱後五個年度)出發草擬初稿、自己跑幾輪 dry-run 疊代收斂,我只在關鍵地方確認方向。三個完全不同題型的大題都能套用同一套審核邏輯收斂出可用的結果,代表這是一套方法論,不是綁死在某個大題的一次性腳本。

一套「LLM 出選擇題」的系統性誘答設計檢查清單

跑 dry-run 的過程中,抓到的問題慢慢收斂成幾條有普遍性的規則,值得抽出來單獨講——這些不是「這一題出錯了」的個案修正,而是 LLM 生成選擇題時容易系統性犯的錯誤模式

  • 誘答項要驗證「在這個語境下確實說不通」,不能只驗證「跟正解不一樣」。容易踩雷的地方是選到「文法上也通、語意上也勉強合理,只是比正解弱一點」的選項(例如比較級 vs 最高級慣用語這種),這種「弱一點但不是明顯錯」的誘答會讓認真的使用者合理質疑答案不只一個。
  • 同一題的選項要固定同一種語法/結構框架,不能為了測不同邏輯關係就混用結構。例如想測「因果 vs 讓步」兩種邏輯,很容易不小心把正解設計成分詞片語、誘答卻混進介系詞片語——邏輯測試立意良好,但結構不一致會讓使用者能靠「這句子文法怪怪的」直接刪去,變成考文法結構而不是考邏輯判斷。
  • 連「正解」彼此之間也要驗證互斥性,不是只有誘答項需要——這條是做篇章結構大題時才浮現的:如果一組題目裡兩個正解句的邏輯功能太像,考生會合理主張兩句可以互換位置,等於答案不只一個。
  • 語意細微差異型的選項,句子裡要有具體文字線索決定性排除干擾項,不能只靠語感——如果正解跟誘答的差異只是「隱含漸進過程」跟「中性/瞬間變化」這種細膩語感差異,沒有明確的時間副詞、對比子句等線索硬性排除其他選項,就是線索密度不夠。

這套清單本質上是「AI 出題容易犯的系統性錯誤」的歸納,可以直接套用到任何用 LLM 生成測驗題目的場景,不限於這個專案。

用視覺能力讀懂手寫掃描卷,校準評分標準

過程中上傳了歷屆範文以供參考,但AI一度想讀取官方 PDF,卻發現環境裡的 PDF 渲染工具鏈預設是壞的,後來找到本機其實裝了完整的 poppler 工具,建起一套雙軌處理:

  • 機讀文字 PDF:用 pdftotext 直接抽取文字——靠這個拿到了官方逐字公布的評分原則(翻譯每個錯誤扣0.5分、混合題填空其實是三級給分不是二元對錯、作文四維度優可差劣評分表的完整文字)。
  • 掃描/手寫 PDF:用 pdftoppm 先轉成圖片,再直接用視覺能力「看」——靠這個讀懂了開發者提供的真實學測作文高分樣卷(手寫掃描檔)。

官方評分表文字本身偏抽象(例如「轉承語使用得當」「文句結構富變化」),照字面判斷很容易失準。讀完幾份真實拿高分的手寫作文後,反過來校準出具體、可操作的判斷依據——例如「轉承語使用得當」在真實高分作文裡具體是「連接詞密度很高、種類很豐富,貫穿全文每個轉折」,不是偶爾放一兩個 also 就算數;還有一條比較關鍵的糾正:「幾乎沒有錯誤」不等於「零錯誤」,真實拿高分的作文裡其實還留著一些小拼字/文法瑕疵,批改時不能因為抓到一兩個小瑕疵就把整體評等拉低一整級。

不只是讀文件,是真的用多模態能力做了一次文件分析,把「抽象評分表」跟「真實評分結果」對照起來反推判斷依據。

資料架構的前瞻決策:摘要/詳情分層

混合題型、翻譯、作文這三個新大題開放式作答,錯誤紀錄動輒一大段原始作答+逐項批改文字,如果直接塞進原本給單字類錯題設計的錯題本畫面,會讓整頁被文字塞爆。

解法是把「儲存的完整資料」跟「畫面預設呈現的內容」解耦:錯題本統一新增一個精簡的 summary 欄位(列表畫面只顯示這一行,跟原本單字類錯題一樣簡潔),完整的原始作答與批改內容收進 history,預設不顯示,使用者要看才展開。這對應到網頁 UI 常見的「列表+展開詳情」模式——刻意先把資料層設計對,以後如果要把這套系統搬上網頁介面,資料結構不用重新來過。

目前狀態

八個大題(詞彙題、文意選填、綜合測驗、篇章結構、閱讀測驗、混合題型、翻譯、作文)全部接上主選單,可以直接選擇練習。但目前為止都只驗證到工具自我 dry-run 的程度,還沒有真人在實際對話裡完整測過——這是接下來最優先要做的事。剩下規劃中的項目還有:跨大題的完整模擬考、大考模式怎麼整合非選擇題大題、以及一個獨立的「字詞講堂」深度講解單元。


上一篇
Day 7 我的Skill憑什麼要我自己改 【題目自我審核與疊代Skill開發】
系列文
Better than 情勒鳥!!Claude AI高中學測向英語家教Skill設計8
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言