iT邦幫忙

2026 iThome 鐵人賽

DAY 18
0
自我挑戰組

踏入品質保證工程之路:QA 新手如何善用 AI 與開發者工具系列 第 18 篇

在信任 LLM 評審之前,先測試這位評審:它有多「像人」?

  • 分享至 

  • xImage
  •  

人工審閱是評估 AI 回覆時有用的參考基準,但它的成本很快就會失控。幾位審閱者可以仔細檢查幾十、上百段對話;要他們評一萬段,就完全是另一回事了。用另一個 LLM 當評審是個有吸引力的解法,因為它可以反覆、大規模地套用同一份評分規準——但產出一個分數,並不等於證明這個分數的意義,就是人類審閱者以為的那個意義。

所以在把模型評審放進評測管線之前,我會先把這位評審本身當成一個需要 QA 的對象。流程從一份人工標註的基準開始:先讓人類用既有的評分規準打出基準,然後要求模型在同樣的規準之下,評判完全相同的這些案例。接著,我就能量測一致性、調查歧見、辨識系統性偏誤,並判斷這個模型究竟適不適合擔任這項特定的評估任務。

1. 先建立人類基準,再來討論模型

基準應該是一批具代表性的案例樣本,由人類以既有的評分規準來評分。它必須有足夠的變異,才能充分鍛練到評審之後要評估的那些維度:簡單與困難的案例、不同的意圖、不同的分數等級,以及落在評分邊界附近的例子。當某個案例真的語義兩可時,多位人類審閱者就有用處,因為基準反映的應該是經過斟酌的人類判斷,而不是把某一個人的意見當成不容質疑的基準事實(ground truth)。

這份基準也會在模型進場之前,先揭示一個重要的天花板。如果人類審閱者反覆對「同一段回覆該得 3 分還是 4 分」意見分歧,卻期待自動化評審每次都重現那個所謂「正確」的標籤,並不切實際。這種分歧可能表示規準需要更強的錨點、案例欠缺脈絡,或這個區分本身太過主觀。因此,人類之間的一致程度,告訴我們這項量測任務在合理範圍內能支援多高的穩定性。

唯有在基準穩定之後,才讓模型評審接手同一批案例。它的歧見此時才能被檢視,而不只是被計數。也許它持續性地給較長的回覆高分、偏愛風格與自己相似的答案,或隨著哪段回覆排在前面而改變偏好。這些模式會成為 QA 可以命名並調查的偏誤類型。有些偏誤可以靠更好的提示詞或錨點來降低;另一些可能嚴重到根本不該讓模型評審那個維度。

2. 如何計算一致性,以及它什麼時候能用

最簡單的量測是一致率:數出模型標籤與人類基準標籤完全相符的案例數,再除以被評估的案例總數。如果模型在 100 個案例中有 80 個和人類標註相符,它的完全一致率就是 80%。分子和分母應該永遠跟著百分比一起走,因為「80% 的一致率」——出自 10 例中的 8 例,與出自 1,000 例中的 800 例——提供的證據份量完全不同。

那些不一致的案例,往往比最終的百分比更有資訊量。QA 應該看方向與集中度:模型是否反覆給「不完整但修飾漂亮」的答案過高分?是否懲罰簡潔的答案?歧見是否集中在某一個維度、某種意圖、某種語言,或某一條評分邊界上?一個整體一致率體面的模型,仍然可能是位糟糕的評審——如果它大多數的錯誤,恰恰發生在評測最在乎的那個類別。因此,一致性應該同時從整體和從測試集中有意義的切面來檢視。

這樣的一致性是否可用,取決於交給評審的任務。一個模型可能適合大規模初篩或低風險的品質量測——不確定的案例送去人工判斷——卻仍不適合需要精確或安全關鍵判斷的決策。校準的目的,不是找出某個 LLM 從此就值得信任的通用百分比,而是累積足夠的證據,去決定自動化在哪裡有幫助、人工審閱在哪裡仍然必要,以及校準與監控這位評審的成本,是否真的低於直接用人。

評審校準紀錄

案例編號 人類標籤 模型標籤 一致? 偏誤類型 處置
AS-ORD-001 4 4 是 — 保留
AS-RET-004 5 2 否 長度偏誤 增補錨點、重新評分
AS-PAY-007 3 5 否 自我偏好 降低權重、送人工複查
AS-SHP-011 4 4 是 位置偏誤 交換順序後重跑
總計 — — 4 例中的 3 例(範例,屬演練資料) — —

上面的評審校準紀錄,把這種比對變成可追溯的東西,而不是只留下一個一致率百分比。每一個案例都把人類標籤與模型標籤並列保存,記錄兩者是否一致;不一致時,指名一個可疑的偏誤;並指定一項處置:長度偏誤造成的不一致,可以導向增補一個更明確的錨點並重新評分;疑似自我偏好可以觸發人工複查,或降低對那項判斷的依賴;位置偏誤則可以透過交換回覆順序、重跑比對來檢驗。即使是一致的案例,在已知偏誤可能存在的時候,也值得調查。最重要的是,這份紀錄把分子與分母——例如 4 例中的 3 例——與結果並列保存,讓後續的校準跑批不會被拿去當成剝除了樣本數的百分比來互相比較。

校準是有有效期限的授權

校準只是時間上的一次快照:一旦更換模型、評審提示詞或評分規準,校準就必須重新建立。在某一個評測集上的高一致性,也證明不了評審在新的案例分布上仍然可靠;它也不會自動讓模型取得評判安全敏感維度的資格——在後果不堪設想的地方,測試與驗證仍然需要人類判斷。目標不是證明 LLM 可以取代審閱者,而是界定它的判斷在哪裡已經累積了足夠的證據、足以派上用場。手裡握著校準紀錄,模型評審才能帶著某種紀律進入管線——而不是淪為省人事成本時按下去的一顆按鈕。


上一篇
兩個人都給 4 分,不代表同一件事
系列文
踏入品質保證工程之路:QA 新手如何善用 AI 與開發者工具 共 18 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言