iT邦幫忙

2026 iThome 鐵人賽

DAY 21
0
AI Engineering

從零搞懂 RAG 評測之旅系列 第 21 篇

DAY21. 回答品質評測總回顧

  • 分享至 

  • xImage
  •  

Day17 到 Day20,我們分別從四個角度檢查了 RAG 系統的回答。今天要把這四個指標放在一起看,它們如何互補、怎麼組合判讀,以及分數不好的時候該往哪裡找問題。

前三個指標檢查的是單輪問答中的回答本身,Answer Relevancy(答案相關性)看回答有沒有對準問題,Faithfulness(忠實度)看回答有沒有超出 Context,Factual Correctness(事實正確性)看回答和標準答案吻合多少;而 Topic Adherence(主題連貫性)檢查的是整段多輪對話中,AI 有沒有守在預先定義的主題範圍內。

指標 對照對象 它在問什麼 分數異常時,先檢查
Answer Relevancy(答案相關性) 原始問題 回答有沒有對準問題 Prompt 是否限制回答範圍、Context 雜訊、問題是否模糊
Faithfulness(忠實度) 檢索到的 Context 回答有沒有超出 Context Prompt 是否要求只根據 Context、Context 是否缺少關鍵資訊
Factual Correctness(事實正確性) 標準答案 回答和標準答案吻合多少 檢索是否漏資訊、知識庫是否過時、標準答案是否過期
Topic Adherence(主題連貫性) 參考主題 多輪對話有沒有守住主題 System Prompt 的主題邊界、Guardrail(護欄)、是否過度保守

用同一個例子串起四個指標

還是那個問題:「特休一天需要提前幾天申請?」

  • Answer Relevancy 檢查的是,回答有沒有對準「提前幾天」。如果回答一堆年資與假別的規定,卻沒提到天數,分數就會偏低。
  • Faithfulness 檢查的是,回答說出的每一句話,Context 裡有沒有寫。如果回答多說了「逾期者一律不核准」,但 Context 根本沒有,分數就會偏低。
  • Factual Correctness 檢查的是,回答和標準答案差了多少。如果漏掉「緊急時可事後補單」,又多說了「可以隨時取消」,分數就會偏低。
  • Topic Adherence 檢查的是,整段對話有沒有守在主題內。如果使用者問「今天午餐吃什麼」,機器人還認真回答,分數就會偏低。

四個指標問的是回答的四個不同層次,切不切題、有沒有根據、對不對、守不守主題。它們對照的對象各不相同,分別是原始問題、Context、標準答案與參考主題,所以抓到的毛病也不一樣。另外,前三個指標看的是單輪問答,只有 Topic Adherence 看的是整段多輪對話。

組合起來看,才能定位問題

單看一個分數,只能知道好或不好;組合起來看,才能知道問題出在哪。

  • Answer Relevancy 高、Faithfulness 低:回答很切題,但混進了 Context 沒有的內容,要先檢查 Prompt 有沒有要求只能根據 Context 回答,也要確認 Context 是否缺少關鍵資訊。
  • Faithfulness 高、Factual Correctness 低:模型很老實地照著 Context 寫,但答案和標準答案不一致,問題很可能出在 Context 本身不完整、過時或有誤,要回頭檢查檢索與知識庫。
  • Faithfulness 低、Factual Correctness 高:可能是模型憑自己的知識蒙對了,這樣的答案並不穩定,換個問題就未必還會對。
  • Topic Adherence 的 Precision 低:機器人不該答的也答了,要檢查主題邊界與 Guardrail;Recall 低:該答的沒答,要檢查模型是不是過度保守。

這也是評測真正的價值。看到回答不理想,不該只說「模型答錯了」,而是要透過這些分數回頭問:是沒切題、沒根據、跟標準答案不符,還是跑出了主題範圍?分數的作用不只是打分,而是幫我們縮小排查的範圍。

回答不好,往往從檢索就開始了

回答品質的問題,有一部分其實是在檢索階段就埋下的。Context Recall 偏低,關鍵資訊沒有被找回來,模型在資訊不足時就容易自己補洞,Faithfulness 與 Factual Correctness 就會跟著下降;Noise Sensitivity 偏高,Context 裡的雜訊會把模型帶偏,Answer Relevancy 也會受到影響。所以實務上比較有效率的排查順序,是先看檢索的四個指標,確認資料有沒有找對、找全;再看 Faithfulness,確認模型有沒有照著資料回答;接著看 Factual Correctness,確認最終答案對不對;最後用 Answer Relevancy 與 Topic Adherence,確認回答有沒有切題、有沒有守住主題。

到這裡,八個指標已經完整地串了起來,檢索品質的四個指標檢查「有沒有找到對的資料」,回答品質的四個指標檢查「找到之後有沒有用對」。評測的價值,不在於跑出一個漂亮的分數,而是當系統表現不如預期時,能順著分數找到是哪一個環節出了問題。


上一篇
DAY20. RAG 評測 (8) Topic Adherence
下一篇
DAY22. 環境準備
系列文
從零搞懂 RAG 評測之旅 共 25 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言