Qrels 是 query 與 document 之間的相關性標註,也是 Retrieval 評測的答案基準。若標註規則不穩定,MRR、NDCG 或 Hit@K 算得再精確,也只是精確地重現一套模糊判斷。
兩位標註者出現不同答案並不罕見。真正的品質問題不是「有人不同意」,而是團隊是否能辨識分歧來源、修正規範,並留下可追溯的裁決結果。
企業知識檢索常見的 graded relevance 可以使用 0 到 3 分:
3:文件能直接且完整回答 query,適合支撐最終答案。2:文件提供重要但不完整的資訊,需要搭配其他內容。1:主題相關或提到關鍵字,但不足以回答問題。0:無關、矛盾,或只有表面詞彙重疊。分數名稱只是起點。Guideline 還要說明文件過期、權限不足、答案散落在多個 chunk、表格缺少欄名、同義詞與否定語句等邊界案例。
「看起來相關」不是可重複的規則。每個分數都應搭配正例、反例與容易混淆的案例,並說明判斷依據是能否回答 query,而不是單純出現相同詞彙。
要衡量一致性,兩位標註者必須在互不影響的情況下判斷同一批 query-document pairs。若先討論答案再填表,最後得到的高一致率沒有診斷價值。
實務上可以先選一小批校準集:
完成校準後,再進入大批量標註。正式資料仍應保留一部分雙人重疊樣本,持續監控 drift。
Raw agreement 是兩位標註者給出相同答案的比例,直觀但沒有排除偶然一致。
Cohen's kappa 會用觀察到的一致程度,扣除依兩人標註分布推算的偶然一致:
kappa = (observed agreement - expected agreement)
/ (1 - expected agreement)
數值 1 代表完全一致,0 表示和偶然一致相近,負值表示一致程度低於偶然預期。若使用 0、1、2、3 等有順序的等級,可以考慮 weighted kappa,讓相差一級與相差三級承擔不同權重。
Kappa 不能單獨決定標註品質。當大多數樣本都屬於同一類時,即使 raw agreement 很高,kappa 仍可能偏低;反過來說,一個看似可接受的總分也可能掩蓋特定 query 類型的嚴重分歧。報告時應同時提供樣本數、類別分布、raw agreement、kappa 與混淆矩陣。
把所有 disagreement 當成同一種錯誤,會錯過最重要的改善線索。常見分類包括:
若分歧集中在單一類型,優先修正系統性原因,比要求標註者「更仔細」有效。
對 graded relevance 取平均會製造一個沒有人真正選擇的答案。例如一人標 0、一人標 2,平均成 1,無法說明文件究竟只是提到主題,還是規範本身有漏洞。
較完整的裁決流程是:
裁決者不一定只是「第三票」。若前兩份標註都建立在錯誤理解上,第三票的多數決仍會得到錯誤答案。裁決的責任是做出有依據的最終判斷,並改善後續標註規則。
標註者不應看到候選文件來自 BM25、Vector 或哪個實驗版本,否則可能不自覺偏向某套方法。文件順序也應隨機化,避免把排名當成相關性暗示。
Query 與文件若含敏感內容,標註介面只應呈現完成判斷所需的最少資訊,並保留存取權限與稽核紀錄。對外公開資料集前,還要另外進行去識別與授權檢查。
沒有一個 kappa 門檻適用所有任務。正式放行前,至少要確認:
若一致性仍低,先暫停擴大標註。增加更多帶有相同模糊規則的資料,只會放大返工成本。
標註者不同意不是應被掩蓋的雜訊,而是任務定義、文件品質與領域邊界的診斷訊號。雙人獨立標註負責揭露分歧,raw agreement 與 kappa 協助量化,分歧分類與裁決則把問題轉成可修正的規則。
穩定的 qrels 不是靠多數決產生,而是靠明確 guideline、保留原始判斷、可追溯裁決與持續校準建立。下一篇將使用這套標註基準,解讀 MRR、NDCG、Hit@K 與 Macro-F1@K 分別衡量什麼。