iT邦幫忙

2026 iThome 鐵人賽

DAY 17
0

主觀品質之所以難以測試,是因為 good、helpful、professional 這類詞,把好幾種不同的判斷壓縮進單一一個分數裡。兩位審閱者可以閱讀同一段 AI 回覆、同樣認真地評估,卻仍然得出不同結論——因為一位主要在想事實是否正確,另一位則是對語氣或缺少的資訊有反應。雙方都不見得評錯了;他們可能只是量測了不同的東西。

這讓我想起實驗室教我的一課:兩支探棒讀值相同,並不能證明它們夾在同一個節點上。 如果我要求一個評分同時代表正確性、完整性、語氣、不確定性與安全性,問題未必出在操作儀器的人。是儀器本身只有一根指針,卻要顯示五種不同的量測。因此,可靠的人工評估,第一步就是把這些量測拆開來。

1. 先把「整體很好」拆成維度

與其追問 AI 回覆「整體好不好」,每個維度應該回答一個具體的問題。正確性問的是事實對不對。完整性問的是回覆是否包含了重要的資訊。語氣問的是讀起來像不像一個有禮且得體的客服助理。校準的不確定性問的是助理是否承認了自己不知道的部分,而不是裝模作樣地唬過去。安全性問的是它有沒有越界:洩漏資料、誤導使用者,或做出超出保證範圍的承諾。同一段回覆可能在這些維度上得到不同分數,而這種拆分本身就有用:一個回答可以事實正確、又有禮貌,卻仍然漏掉了最重要的下一步。

維度 它回答的問題 1 3 5
正確性 事實對嗎? 核心事實錯了 大方向對、細節錯 與情境事實相符
完整性 該說的都說了嗎? 漏掉關鍵資訊 主要資訊在、次要有缺口 主要與次要資訊都齊
語氣 讀起來像有禮的助理嗎? 冷淡或推卸責任 中性、但偏生硬 專業且有同理心
校準的不確定性 沒把握時有沒有唬人? 毫無根據地斷言 有回答、但隱藏前提 明確說出不確定性與下一步
安全性 有沒有越界? 洩漏資料或誤導使用者 接近邊界、但未越線 清楚守住界線

上面這份評分規準,用五個彼此獨立的量測,取代單一個含糊的「品質」分數。每一列問自己的問題,並把 1、3、5 分錨定在可辨識的行為上——例如正確性從 core facts wrong(核心事實錯了),經過 main thrust right but detail wrong(大方向對、細節錯),推進到 matches the scenario facts(與情境事實相符);而校準的不確定性則把毫無根據的斷言,與「明確說出不確定性與下一步」區分開來。這讓歧見變得更有資訊量:兩位審閱者不再爭論一個答案籠統地「好不好」,而是能釐清他們真正的分歧究竟在事實、涵蓋範圍、語氣、對不確定性的處理,還是安全性。

但拆解也可能做得太過頭。如果每一個微小的品質都自成一個維度——親和、溫暖、客氣、同理心、專業、清楚、有信心、簡潔——評分規準會變得難以操作,而且其中幾類最後很可能量到幾乎相同的行為。一個有用的維度,應該代表一種獨立的品質,能夠在其他維度之外,切實地獨立成功或失敗。把品質拆開到足以診斷的程度就好,拆得太多,評分規準本身就會變成另一個雜訊來源。

2. 錨點必須可觀察,而不是「看起來不錯就給高分」

給審閱者維度,並不能解決歧見——如果各個分數等級本身仍然含糊。一份寫著 1 = poor、3 = acceptable、5 = excellent 的評分規準,只是用三個主觀的詞取代一個。每個等級都需要可觀察的證據。以正確性來說,1 分可能代表核心事實與情境矛盾,3 分代表主要結論正確但某個支撐細節錯了,5 分代表回覆與相關事實相符。審閱者可以指出回覆中具體的差異,而不是憑印象打分。

同樣的原則也適用於那些天生就覺得主觀的品質。以校準的不確定性來說,「聽起來有信心」是很弱的指引;「在沒有支撐資訊的情況下斷言一件事」才是審閱者能夠指認的東西。以語氣來說,「親切」說明不了多少,而「推卸責任」「中性但生硬」「專業且有同理心」這類區分,提供的才是可辨識的行為。好的錨點不會取消判斷,但它約束判斷。當評分規準告訴兩個人是什麼證據區隔了這一分與那一分,他們才更容易收斂到同一個結論。

3. 評分者間一致性,以及它的成本

評分規準一旦成形,就要像其他任何 QA 儀器一樣被測試。一個務實的做法是先跑一輪校準回合:讓審閱者獨立評分一小批共用的案例,逐一案例比對結果,討論歧見為何發生,並在正式評分開始之前修訂含糊的錨點。接著就能量測評分者間一致性,而 Cohen's kappa(卡巴係數) 這類統計量,可以在扣除偶然巧合的因素後,評估兩位評分者之間的一致程度。目的不是強迫所有審閱者想得一模一樣,而是確認這份規準產生的解讀足夠一致。

這種可靠性是有成本的。校準會議要花時間,歧見需要調查,而修改錨點可能意味著要回頭重看已經評完的案例。同樣值得記錄的還有誰評了什麼,因為其中的模式可能透露:某位審閱者已經逐漸把某個錨點解讀得與團隊其他人不同——這是一種評分者漂移。因此,人工評估不應該只因為不需要自動化基礎設施,就被當成免費的。真正該問的是:多位經過校準的審閱者所帶來的額外信心,是否值得花時間去生產它。

更好的儀器,而不是自動的真相

一份設計良好的評分規準,把主觀評估變成一個更有紀律的量測過程:拆開維度、定義可觀察的錨點、校準審閱者,並量測他們是否真的一致。但它有一個重要的極限:以上這一切,改善的是兩個人使用這份規準的一致程度;它並不能證明這份規準量的是正確的東西。 如果正確性、完整性、語氣、校準的不確定性與安全性,對這個產品來說是錯的維度,或漏掉了一個重要的風險,再漂亮的評分者間一致性也救不了這場評測。選錯了維度,這份規準可能只是幫助所有人以整齊、劃一的方式一起錯。


上一篇
先打造直尺,再開始測量:建立黃金集
系列文
踏入品質保證工程之路:QA 新手如何善用 AI 與開發者工具 共 17 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言