今天完成規則調整的後半部分,詳細調整出題/解析格式與內容,採用跟當初測試skill一樣的聊天室測試方法,要求AI在產出題目時:1.直接隨機填入答案2.照規則產出解析3.給出該題標籤與level4.給出為何選擇這篇文章作為主題的原因及思考。除了檢討現有規格是否滿足使用者需求,我還會根據他的思考流程修改未來他與後台管理員功能的合作方法。
由於後續收集回饋和提交報表生成題目的職責會由後台管理員負責,我提前模擬了幾項規則來測試他的出題思考能力:
-模擬使用者回饋:
比如使用者可能想看與虛擬實況主、奧德賽電影等主題相關的題目,描述較模糊,主題較窄,除了可能不符現有主題,需要動用到添加標籤(見後續)的能力外,也可能因為對主題不了解,需要動用之前「退而求其次」的思考方法
-模擬題庫分配情形:
平均分配主題、level與各大題數量是重要的事,未來的報表會顯示目前各分類題目的數量,批量出題系統會因為結果去選擇調整自己的出題傾向,補充缺失的空隙。
-模擬新聞議題
有鑑於大考與時事強相關,我預計後續後台管理員將包含定時整理新聞的能力,將整理出來的新聞再製作成文章就能確保能不斷產出有效題目的基礎,也確保不會因為真的沒人用我的玩意出題系統就掛機。
當然很多時候這三件事並非一定強相關,我親自測試了幾題,比如使用者想看奧德賽、文明史主題題庫缺乏,這兩件事可以支持他出一篇關於奧德賽電影考究的文章,但我在模擬新聞議題寫了:「川普增加關稅」這件事,明顯與前述無關,這時他就要做出取捨,優先傾向用前兩個條例生題。
不過正式情況要生的題不只一題,主題候補不只一個,所以要再調配好管理員的題事能力和出題系統的理解能力。
這是測試期間發生的BUG,我也不確定他究竟存在多久了。
測試綜合測驗期間,我發現兩個我催過的格式BUG-段落相連和敘事扁平。同時,字數也神奇與現實有點落差。
我抽查了歷屆綜合測驗,發現字數普遍超過200字,跟之前改寫的規則對不上,要求重新查證。他在第一輪重新讀取試題純文字轉檔修正了四大題的字數,順手也「查證」了分段數,給出以下結果:
綜合測驗 184-235字 2-4段 6/10篇有弧線,4/10扁平——常見但非必要
文意選填 250-320字 2-4段 只有2/5年有完整弧線,2/5年純扁平條列——常見但非必要
篇章結構 290-370字 1-3段 0/5年有弧線——原本「不需要」的規則反而是對的
閱讀測驗 292-371字 2-5段 12/15篇至少有時序脈絡,3/15典型敘事弧,只2/15純扁平
但以他的舉例:113年篇章結構完全不符。那篇明明有4段、還有完整的起承轉合,跟查證結果「單一段落、無敘事弧」完全矛盾。
追查後發現根本問題,純文字轉檔資料夾的5份PDF轉檔案完全沒有保留任何換行符號(整份檔案是一整行,wc -l=0),代表分段數從來就不是真數據,只是某種不可靠的猜測。改讀原始.docx檔案的真實段落標記(Word的<w:p>),重新查證全部4大題的分段數跟113年的敘事結構,這次才真的對得上——113年開頭一段本身就是一個完整的個人軼事敘事弧,後面3段才轉為說明文,是一種真實存在的「用微型故事當開頭鉤子」寫法。
主題標籤正式引入自行添加標籤的機制,用以應對為來的多樣化題目,同時附帶點明標籤可混用,讓生成時可以附帶符合文章的所有標籤。
主題標籤驗證選擇了程式碼+對照表的折衷方案——新建一張allowed_topic_tags表,新增標籤是一筆insert,不是一次migration,符合標籤清單還在快速擴增的現實。
另外分類編號格式改為SSLNNNNN(大題代碼+難度+流水號)舉例如level5的詞彙題首個題目就會是:01500001。該功能可以作為身分代碼讓程式精準查詢目標題目。定案將直接取代bank_items.id原本的UUID主鍵。
接下來就是對齊UI,將新版本更新到APP上了。