iT邦幫忙

2026 iThome 鐵人賽

DAY 21
0
Claude AI

從 AI 助理到營運中台:金融 PM 的 30 天 Claude Code 治理實戰系列 第 21 篇

為 AI 打造「誠實協議」:為什麼我們不該讓模型評估自己的信心?

  • 分享至 

  • xImage
  •  

https://ithelp.ithome.com.tw/upload/images/20261005/20144604bsEdbgOe5h.jpg

當 AI 說它「很有把握」時,你敢信嗎?

在檢索增強生成(RAG)系統的開發實務中,我們經常遇到一個棘手的課題:當使用者問了一個艱澀的專業問題,AI 吐出了一個看起來非常完美的答案,我們該如何確認它的可信度?
傳統的思維是讓 AI 給自己打分,這就是所謂的「信心分數」(Confidence Score)。然而,身為架構師,我們必須直面一個殘酷的現實:如果 AI 的信心本身就是一種「幻覺」的延伸,那麼這種自我評估將成為系統中最危險的單點故障。為了打破這種虛假的信任,我們需要一套「誠實協議」——將 AI 從「決定正確與否的法官」降格為「提供證據的證人」。


https://ithelp.ithome.com.tw/upload/images/20261005/20144604L5AIRDLjbB.jpg

可追溯性的「六大金律」:一個合格的答案該長什麼樣子?

為了讓 RAG 從「裝飾性的追溯」進化為「規格化的追溯」,我們在「可追溯回答格式 v1.0」中定義了六個必要元件。這不僅是為了美觀,更是為了將 AI 治理的精神硬性植入系統架構中:

  • 答案本文:由 AI 模型生成的回答核心。
  • 依據清單:這是一份絕對的「地面實況」(Ground Truth),必須包含檔案名稱、段落摘要、文件版本、生效日期。
  • 強度標記:透過程式邏輯(非模型自評)計算出的關聯強度。
  • 產生方式標示:明確註明「本內容係由 AI 協作產生」。
  • 僅供建議聲明:定義專業分工,劃清系統與決策者的邊界。
  • 留痕參照:系統內部的追蹤編號,確保即使是「拒答」也必須具備可追溯性,用於事後稽核。

這六項缺一不可,是為了確保系統在任何情況下,都能提供一致且透明的證據鏈。

最震撼的設計決策:絕不讓模型「自報信心」

在規格定版的最關鍵時刻,我否決了第一版設計:嚴禁模型在 JSON 輸出中包含 confidence 欄位。
這個決定或許聽起來違背直覺,但在架構治理上,這是對「關注點分離」(Separation of Concerns)的堅持。讓模型自評信心的風險在於:

  1. 設計誘導的誤讀:欄位名叫 confidence,數字又是 0 到 1 之間的浮動值,使用者必然會將其誤解為統計學上的「機率」,但模型給出的 0.9 僅僅是它的「感覺」。
  2. 自信的幻覺:實務經驗告訴我們,AI 最危險的錯答,往往伴隨著它最高的信心值。
  3. 架構一致性:這是專案中「原則落地」的第三次實踐。延續 Day 8(推論標籤由程式蓋)與 Day 20(引用行由程式產生)的邏輯:模型不應為自己的產出貼標籤。 信心標記必須是硬性的工程約束,而非模型自覺。

> 「信心是感覺,依據強度是證據——我們的格式裡只放證據。」


https://ithelp.ithome.com.tw/upload/images/20261005/20144604f7oASvidw4.jpg

數據勝過直覺:用「檢索分數」取代「感覺」

既然不准模型自評,我們該如何衡量答案的品質?我們選擇用程式計算出的「依據強度」來取代。這些數值並非憑空而來,而是透過 34 塊初始樣張校正後得出的動態門檻。
系統實施了嚴格的三級規則判定:

  • 依據明確:當檢索塊的最高分數 ≥ 0.15。
  • 依據薄弱:當檢索分數介於 0.10 至 0.15 之間。此時系統會強制觸發安全機制,在答案下方附上警語:「採用前請人工確認依據是否切題」。這是在模型自律失守時,由系統工程架設的第二道防護網。
  • 標準拒答:當分數低於門檻或引用無效時,系統啟動拒答流程,但仍須附上留痕參照供工程師檢視。

在測試過程中,我們特別設定了一個「雜訊陷阱」(Noise Trap)情境:若模型引用了僅有 0.077 分的弱相關區塊,系統會立即偵測到強度不足並標示「薄弱」。這證明了「數據驅動」的約束力遠比「模型自覺」可靠。

誠實的邊界:AI 提供證據,人類提供判斷

我們必須釐清一個架構本質:「依據強度」測量的是切題度(Relevance),而非正確性(Truthfulness)。檢索分數反應的是字面上的關聯,而答案是否絕對正確,最後一哩路始終屬於人類。
格式中的「僅供建議」聲明並非客套的法律免責條款,而是一種專業分工的宣告。當我們把 AI 定位為「證人」時,它的義務是誠實地交出它參考了哪些證據、這些證據有多切題;至於最後的判決,必須交由具備專業知識的人類法官來裁定。

結語:通往透明 AI 的下一步

隨著「可追溯回答格式 v1.0」定版,我們完成了 TASK-004 的規格驗收。這次驗收不僅包含了 8 項針對新格式(含三級強度、警語觸發、六要件完整性斷言)的深度測試,累計更已通過 179 項測試案例。

驗收項目 結果
六要件完整性(逐項斷言,缺一不可) 通過 ✅
強度三級規則(明確/薄弱/拒答) 通過 ✅
薄弱區塊強制人工複核警語 通過 ✅
雜訊陷阱防護(0.077 弱塊偵測) 通過 ✅
TASK-004 全套 179 項測試 全數通過 ✅

這套「誠實協議」的定版,象徵著我們不再盲目依賴 AI 的「自覺」,而是將其置於系統工程的硬性約束之下。在追求 AI 效能的賽道上,有時「誠實地承認無知」比「自信地吐出謊言」更具技術價值。
下集預告: 答案格式對了,但如果「依據」本身過期了怎麼辦?下一篇我們將解決「知識過期」與「無主知識」的攔截問題,並償還 Day 18 欠下的債——正式建立「候選知識佇列」。


上一篇
RAG 實戰筆記:敢說「找不到答案」,才是 AI 系統成功的關鍵
系列文
從 AI 助理到營運中台:金融 PM 的 30 天 Claude Code 治理實戰 共 21 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言