iT邦幫忙

2026 iThome 鐵人賽

DAY 6
0
AI Engineering

企業知識檢索與 RAG 工程:標註、微調、混合檢索、Rerank 與可重現評測系列 第 6 篇

Day 06|兩個標註者不同意怎麼辦:一致性與裁決

  • 分享至 

  • xImage
  •  

Qrels 是 query 與 document 之間的相關性標註,也是 Retrieval 評測的答案基準。若標註規則不穩定,MRR、NDCG 或 Hit@K 算得再精確,也只是精確地重現一套模糊判斷。

兩位標註者出現不同答案並不罕見。真正的品質問題不是「有人不同意」,而是團隊是否能辨識分歧來源、修正規範,並留下可追溯的裁決結果。

先定義相關性,不要直接開始打分

企業知識檢索常見的 graded relevance 可以使用 0 到 3 分:

  • 3:文件能直接且完整回答 query,適合支撐最終答案。
  • 2:文件提供重要但不完整的資訊,需要搭配其他內容。
  • 1:主題相關或提到關鍵字,但不足以回答問題。
  • 0:無關、矛盾,或只有表面詞彙重疊。

分數名稱只是起點。Guideline 還要說明文件過期、權限不足、答案散落在多個 chunk、表格缺少欄名、同義詞與否定語句等邊界案例。

「看起來相關」不是可重複的規則。每個分數都應搭配正例、反例與容易混淆的案例,並說明判斷依據是能否回答 query,而不是單純出現相同詞彙。

雙人獨立標註

要衡量一致性,兩位標註者必須在互不影響的情況下判斷同一批 query-document pairs。若先討論答案再填表,最後得到的高一致率沒有診斷價值。

實務上可以先選一小批校準集:

  1. 兩人依相同 guideline 獨立標註。
  2. 比較分數,但暫時不直接改成一致。
  3. 將分歧依原因分類。
  4. 修訂 guideline 並補充範例。
  5. 重新標註新的校準集,確認規則是否更穩定。

完成校準後,再進入大批量標註。正式資料仍應保留一部分雙人重疊樣本,持續監控 drift。

Raw agreement 與 Cohen's kappa

Raw agreement 是兩位標註者給出相同答案的比例,直觀但沒有排除偶然一致。

Cohen's kappa 會用觀察到的一致程度,扣除依兩人標註分布推算的偶然一致:

kappa = (observed agreement - expected agreement)
        / (1 - expected agreement)

數值 1 代表完全一致,0 表示和偶然一致相近,負值表示一致程度低於偶然預期。若使用 0、1、2、3 等有順序的等級,可以考慮 weighted kappa,讓相差一級與相差三級承擔不同權重。

Kappa 不能單獨決定標註品質。當大多數樣本都屬於同一類時,即使 raw agreement 很高,kappa 仍可能偏低;反過來說,一個看似可接受的總分也可能掩蓋特定 query 類型的嚴重分歧。報告時應同時提供樣本數、類別分布、raw agreement、kappa 與混淆矩陣。

分歧要先分類

把所有 disagreement 當成同一種錯誤,會錯過最重要的改善線索。常見分類包括:

  • 規範模糊:兩個分數的界線沒有寫清楚。
  • Query 模糊:缺少時間、產品、角色或其他必要上下文。
  • 文件切分問題:關鍵資訊跨 chunk,單一片段無法獨立判斷。
  • 領域知識差異:需要專業背景才能辨識同義詞、例外或適用條件。
  • 時效或版本衝突:不同文件各自正確,但適用時點不同。
  • 操作失誤:看錯列、漏讀、誤按或沒有載入完整內容。

若分歧集中在單一類型,優先修正系統性原因,比要求標註者「更仔細」有效。

裁決不是簡單取平均

對 graded relevance 取平均會製造一個沒有人真正選擇的答案。例如一人標 0、一人標 2,平均成 1,無法說明文件究竟只是提到主題,還是規範本身有漏洞。

較完整的裁決流程是:

  1. 保留兩份原始標註與理由。
  2. 由裁決者閱讀 query、文件與 guideline。
  3. 判斷分歧屬於個案錯誤,還是規則需要更新。
  4. 寫入最終標籤、裁決理由與 guideline 版本。
  5. 規則若有修改,回頭檢查受影響的既有樣本。

裁決者不一定只是「第三票」。若前兩份標註都建立在錯誤理解上,第三票的多數決仍會得到錯誤答案。裁決的責任是做出有依據的最終判斷,並改善後續標註規則。

避免資料洩漏與偏見

標註者不應看到候選文件來自 BM25、Vector 或哪個實驗版本,否則可能不自覺偏向某套方法。文件順序也應隨機化,避免把排名當成相關性暗示。

Query 與文件若含敏感內容,標註介面只應呈現完成判斷所需的最少資訊,並保留存取權限與稽核紀錄。對外公開資料集前,還要另外進行去識別與授權檢查。

何時可以進入正式評測

沒有一個 kappa 門檻適用所有任務。正式放行前,至少要確認:

  • 關鍵 query 類型都有足夠樣本。
  • 高風險類別的分歧已經個別檢查。
  • 指標在連續幾批校準集中趨於穩定。
  • Guideline 版本固定,變更能追溯。
  • 裁決後的 qrels 不會混入評測系統的排名資訊。

若一致性仍低,先暫停擴大標註。增加更多帶有相同模糊規則的資料,只會放大返工成本。

結論

標註者不同意不是應被掩蓋的雜訊,而是任務定義、文件品質與領域邊界的診斷訊號。雙人獨立標註負責揭露分歧,raw agreement 與 kappa 協助量化,分歧分類與裁決則把問題轉成可修正的規則。

穩定的 qrels 不是靠多數決產生,而是靠明確 guideline、保留原始判斷、可追溯裁決與持續校準建立。下一篇將使用這套標註基準,解讀 MRR、NDCG、Hit@K 與 Macro-F1@K 分別衡量什麼。


參考資料


上一篇
Day 05|Qrels:沒有相關性標註,就沒有真正的 Retrieval 評測
下一篇
Day 07|MRR、NDCG、Hit@K、Macro-F1@K 到底各在量什麼
系列文
企業知識檢索與 RAG 工程:標註、微調、混合檢索、Rerank 與可重現評測 共 13 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言