iT邦幫忙

2026 iThome 鐵人賽

DAY 8
0
AI Engineering

《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》系列 第 8

Day8 人工標註的陷阱:Reward Model 訓練實戰與資料品質探討

  • 分享至 

  • xImage
  •  

今天會詳細討論Preference Data 的品質問題
所有「偏好標籤不可靠」的原因,可以分成兩大類:

第一大類:規格/設計層面的問題

就算標註員都很認真、很專業,問題還是會發生,因為是任務本身設計不良。

問題 白話說明
任務規格不明確 「哪個比較好」沒定義清楚,每人腦補一套標準
風格覆蓋內容 把「不同風格」誤判為「品質較差」,長期壓縮多元判斷
低訊息量比較對 兩個答案幾乎一樣,只差標點或用字,這種比較本身就很難產生有意義的標籤
位置/呈現偏誤 介面把答案 A 放左邊、B 放右邊,標註員可能有不自覺的位置偏好

解法:
寫清楚且具體的標註規範 → 把單一模糊問題拆成多軸評分 → 讓標註員對著同一批「邊界案例(edge case)」討論,對齊彼此的判斷標準

第二大類:執行層面的問題(標註過程中產生)—— Label Noise

就算任務規格設計得很清楚,人在執行標註的當下還是會出錯或不穩定。

問題 白話說明
標註員狀態波動 同一個人早上跟晚上標,標準可能不一樣(疲勞、專注力)
真正的隨機失誤 手滑按錯、看錯
難以分辨的比較 兩個答案真的實力接近,連專業標註員都很難篤定選誰
標註員間低一致率 在真實世界收集到的偏好資料裡,標錯或有爭議的標籤,佔的比例其實相當高

解法:

  1. 多重標註 + 多數決或加權聚合
  2. 在標註流程中穿插已知正確答案的題目,可以有效監控與激勵標註員產出高品質標註
  3. 過濾雜訊樣本、套用標籤平滑化以及設計對雜訊更穩健的損失函數

Takeaway

  • 從兩大方面看 Preference Data 品質問題
  • 關鍵在於先正確診斷問題屬於「規格層」還是「執行層」(或兩者皆有),再對症下藥——規格層用「拆軸 + 規範 + 校準」,執行層用「多重標註 + 品管 + 穩健訓練演算法」,同時保留一份「這是有效多元分歧」的例外名單

有了乾淨的偏好資料之後,下一個問題就是:怎麼把這批資料變成真正能訓練模型的訊號?明天我們就從 DPO vs PPO 開始拆解~


上一篇
Day7 拆解 RLHF 全流程:SFT、Reward Model 到 PPO 的 Pipeline
下一篇
Day9 DPO vs PPO:為什麼 DPO 不需要 Reward Model 且更適合微調?
系列文
《30天打造 Tool-Calling Agent:從 MDP 理論到 DPOTrainer 實戰訓練》16
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言