我或許已經在超過十篇文提到這玩意的存在了,本質上是一個方便檢索和協助出題系統有效分配題目的東西,至於他的規則到底為甚麼這麼難改,就要從今天的第一項調整說起。
為了讓出題系統不會依某些流行事物或沒察覺到的傾向不斷朝一個方向生題導致比例不均衡,我要求制定比現有26主要標籤更精細的標籤來具體判斷哪些題目不該再繼續生下去。
然而,這件事實際帶有幾個隱患,首先是我必須先確定好他標籤到底會設的多細,才能判斷限制到底會過度影響導致惡性卡主題,還是會毫無作用根本觸發不了。
-極度細緻:
比如「科技」底下的「AI」可以再分成「應用AI」而後再變成「醫療輔助AI」、「聊天AI」、「開發輔助AI」,總之他可以因不同的例子分化出無數分支,最後全在講AI,而其他歷史、文化之類的題目就直接被忽視,限制效果直接變無能的丈夫,完全起不到限制作用。
-相對廣泛:
相反,比如今天「科技」只到「AI」就停下,限制系統確實能夠有效遏止某個傾向的無限膨脹,但也同樣遏止了很多可能性,首先,標籤的附加功能就是讓想要做某一類型主題的人找到文章,比如一個人想找跟claude code有關的文章好了,那麼過於廣泛的定義就會導致他要在茫茫題海裡找到那唯一的幾題,或者就得想辦法找到他的唯一分類編號。其次,廣泛定義導致的遏止,也可能讓某些子分支喪失登場機會,同樣舉例「AI」,比如有些人可能想看Neuro-Sama-一個可愛的AI Vtuber,然而由於AI題目太氾濫導致AI標籤底下的題目全被Ban了,這類型與標籤主流比較沒關係的題目也可能被限制出題,反而降低了多元性。
「人腦需要多細的資料來推理出唯一的答案?」這是標籤細製程度要回答的問題。
一方面,我開發的不是搜尋引擎,疊加一大堆母子標籤從科技詳細講到GPT4.5發布會上提到的某一個產品,過多標籤壘在一題裡不但複雜,還對搜索沒用。舉個例子,今天有幾份標籤,母子標籤有:「科技」->「醫學」->「疫苗」->「mRNA疫苗」,平行標籤有:「COVID-19」。透過這樣你或許就已經能知道這一篇在說的是跟COVID-19有關的哪個疫苗研究了(至少有意查的應該知道),而非我真的要細緻到說出這是:「BioNTech-Pfizer」疫苗並由哪家公司生產的,尤其哪家公司生產跟這篇文的主旨也沒什麼關係。
所以,判斷的標準應是:「這幾個標籤組合起來,能不能已經唯一、直觀地指向這題在講什麼」往下多拆一層,如果只是把其他標籤已經能推論出的資訊換句話說重講一次,就該停;如果能帶來這題真正獨有、其他同標籤題目不會有的區別,才值得繼續拆。
比如剛才的疫苗就是該停的案例,而另一個範例:SpaceX的星艦計畫因為要提及具體計畫名,就不能停在SpaceX,也許題庫未來會有Starlink、Falcon 9回收等完全不同主題的報導也掛SpaceX,不拆開防重複機制會誤判成同一件事反覆出題。
一個子標題會需要同時提起幾個母標籤?假設我們設定一個最細致的子標籤出現時,其母標籤必然出現,比如一篇說明Chat GPT的應用的文章好了,「科技」這個大標籤是一定要有的,這樣要找科技的人才會碰到他,而他也確實是科技的子分支,再更細一點「AI」、「大語言模型」都與他有相連關係,按理也該出現,那麼「Open AI」呢?他確實與Chat GPT有關,但這篇文可能從未提及Open AI,那我們要怎麼讓AI知道哪種母標籤應該出現,哪種則不必?
我們將母子關係分成兩種判斷方式:
必然型:掛上最細標籤,母標籤定義上必然成立,不需要每次判斷(例如一個人物夠格被單獨標成一個人,「是偉人/傳記人物」就是必然的,則在搜尋偉人標籤時,他也應該作為相關子標籤出現)
或有型:是否要掛,取決於這篇文章實際強調了什麼、以及一般人會不會真的用這個詞搜尋,判準是搜尋關聯性,不是技術上有沒有被提及。比如COVID-19這種只作為文章背景的,也可能作為搜尋並產生興趣的具體事件,優先度反而高於製造商公司這種低搜尋關聯性的細節。
透過垂直與平行的標籤分配,一道題目可以在明確表示主旨的前提下,保留透果母標籤找到他的機會,確保他不會被當成題目孤兒。
現在讓我們繞回最初的目的:限制出題條件,顯然,照淺層標籤限制=容易限制分類,照深層標籤限制=容易沒限制效果,所以限制機制我們就可以改寫成這兩條規則:
-防隱性重複:
只盯每條母子鏈「最深的那一個」標籤,在同大題內最近有沒有被重複用到,中間層/大類標籤重複使用完全正常、不受限。機制是軟性自我檢查:查到疑似重複,Claude要在出題思路裡明講「換角度」或說明為什麼刻意重複合理,沒有強制否決權,開發者/未來的AI後台管理員才是最終決定者。
-大類佔比失衡:
從大類往下走同一棵樹逐層檢查,先看大類整體佔比有沒有超標,超標的話才往下看是不是集中在某個特定子分支,只鎖定真正失衡的那一支,不冤枉同大類底下其他沒問題的子主題。(存在具體限制,避免他真的鑽到底)
防重複盯「同一件具體真實的事有沒有被反覆包裝出題」;佔比盯「就算每次都是真的不同的事,某個天生角度多的方向(例如AI)會不會不成比例吃掉題庫」。兩個機制共同作用就可以避免某些題目反覆出現的可能。
接下來就是再將該機制套回批量生題系統,在此之前我已經用新規則跑一次測試同時修掉部分BUG和UI不適配的問題,若批量生題結果通過,下一步就是將我這個給命令的人也取代掉了。