今天會詳細討論Preference Data 的品質問題
所有「偏好標籤不可靠」的原因,可以分成兩大類:
就算標註員都很認真、很專業,問題還是會發生,因為是任務本身設計不良。
| 問題 | 白話說明 |
|---|---|
| 任務規格不明確 | 「哪個比較好」沒定義清楚,每人腦補一套標準 |
| 風格覆蓋內容 | 把「不同風格」誤判為「品質較差」,長期壓縮多元判斷 |
| 低訊息量比較對 | 兩個答案幾乎一樣,只差標點或用字,這種比較本身就很難產生有意義的標籤 |
| 位置/呈現偏誤 | 介面把答案 A 放左邊、B 放右邊,標註員可能有不自覺的位置偏好 |
解法:
寫清楚且具體的標註規範 → 把單一模糊問題拆成多軸評分 → 讓標註員對著同一批「邊界案例(edge case)」討論,對齊彼此的判斷標準
就算任務規格設計得很清楚,人在執行標註的當下還是會出錯或不穩定。
| 問題 | 白話說明 |
|---|---|
| 標註員狀態波動 | 同一個人早上跟晚上標,標準可能不一樣(疲勞、專注力) |
| 真正的隨機失誤 | 手滑按錯、看錯 |
| 難以分辨的比較 | 兩個答案真的實力接近,連專業標註員都很難篤定選誰 |
| 標註員間低一致率 | 在真實世界收集到的偏好資料裡,標錯或有爭議的標籤,佔的比例其實相當高 |
解法:
有了乾淨的偏好資料之後,下一個問題就是:怎麼把這批資料變成真正能訓練模型的訊號?明天我們就從 DPO vs PPO 開始拆解~