iT邦幫忙

2026 iThome 鐵人賽

DAY 29
0
AI Security

新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記系列 第 29

為什麼 AI 也會重男輕女?AI 偏見的六大類型與可解釋性 AI 技術

  • 分享至 

  • xImage
  •  

大家好,前幾天我們聊了各種 AI 治理的法律、框架與國際標準。
今天,我們要來探討一個非常核心、也是近年來不論在資安審計、GRC 還是法律合規上都被高度檢視的議題:AI 偏見(AI Bias)可解釋性 AI(Explainable AI, XAI)

你可能在新聞上看過類似的荒謬案子:
2018 年,亞馬遜(Amazon)悄悄廢棄了一套幫忙篩選履歷的 AI 系統。
因為這套 AI 居然會「自動扣女性候選人的分數」。
只要履歷上出現「女子(如女子籃球社)」之類的字眼,AI 就會直接把這份履歷排到後面。
為什麼會這樣?難道 AI 也會重男輕女?
當然不會,AI 沒有性別偏好。問題是出在我們餵給它的「歷史資料」裡,過去十年被錄取的工程師大多是男性,AI 就自作聰明地學會了這個特徵,以為:「男性 = 優秀工程師的必備條件」,進而重現並放大了這個偏見。

今天,我們就來拆解 AI 偏見的六大類型,以及我們如何利用可解釋性 AI(XAI)工具來拆開大模型的黑盒子,落實法規要求的透明度。


一、 必須認識的 AI 偏見六大類型

AI 會學壞,往往是因為資料或演算法在各個階段出了問題。在進行合規審計時,通常需要識別這六種常見的偏見來源:

1. 歷史偏見(Historical Bias)

  • 定義:訓練資料百分之百真實反映了歷史,但歷史本身就充滿了不平等、歧視或偏見
  • 例子:上述亞馬遜的履歷篩選器。即使收集到的歷史數據是真實的,AI 一樣會把歷史偏見完美學起來,並在未來做判定時放大。

2. 抽樣偏見(Sampling Bias)

  • 定義:收集來的訓練資料「偏食」,沒辦法代表真實世界中的所有群體
  • 例子:某款皮膚癌診斷 AI,訓練資料裡 95% 都是白人的照片。當它被拿來診斷膚色較深的人種時,準確率直接暴跌。

3. 標籤偏見(Label Bias)

  • 定義:資料在人工標記(Labelling)的階段,就已經被標記人員的主觀偏見給污染了。
  • 例子:在標記情緒分析資料時,標記人員因為隱性歧視,把特定群體的正常發言標記為「憤怒」,而把主流群體的同樣發言標記為「挫折」。

4. 演算法偏見(Algorithmic Bias)

  • 定義:資料本身很公平,但因為我們設定的「優化目標(Loss Function)」有問題,導致少數群體受害。
  • 例子:模型在設計時只追求「整體準確率達到 98%」。結果模型在佔了 98% 的主流群體上判定極準,但在只佔 2% 的少數群體上判定全錯。整體分數看起來很漂亮,但少數群體卻被系統性犧牲了。

5. 測量偏見(Measurement Bias)

  • 定義:用來測量的工具、指標或特徵收集本身就帶有偏見(例如:用「打字速度」來評估一個寫程式的工程師是否優秀,測量指標本身就產生了偏差)。

6. 聚合偏見(Aggregation Bias)

  • 定義:硬要把所有不同特徵的群體套在同一個模型裡,導致模型對特定子群體(Sub-groups)的表現很差。
  • 例子:不同人種的糖尿病臨床指標其實有差異,如果硬用同一個統一模型來診斷,對亞裔人群的準確率就會非常低。

二、 緩解偏見的三大防禦層次與技術極限

要怎麼幫 AI「去偏見(Debiasing)」呢?我們可以在 AI 生命週期的三個階段動手腳:

  • 前處理(Pre-processing):在資料餵給 AI 訓練之前就先調整。
    • 重新採樣(Resampling):如果某個少數群體的樣本太少,我們就故意複製、增加該群體的樣本(過採樣)。
    • 重新加權(Reweighting):提高少數群體樣本在訓練時的損失權重。
  • 處理中(In-processing):在 AI 訓練時,在損失函數裡加上「處罰項」。如果 AI 做出偏心、不公平的判定,就直接扣它分。
  • 後處理(Post-processing):在 AI 輸出結果之後,手動微調它的門檻值。
    • 閾值調整(Threshold Adjustment):為不同群體設置不同的決策門檻,強迫達到同等的通過機率。

💡 自學筆記:不可能同時完美的公平性(Impossibility Theorem of Fairness)
這是在準備 GRC 時,我覺得在實務上對我們做系統分析、跟客戶談需求的人來說,最重要的一個觀念:在數學上,你不可能同時滿足所有的公平指標(Impossibility Theorem of Fairness)!

這在系統開發上,就像在玩一個「拆東牆補西牆」的平衡遊戲:
你調高了少數群體的錄取率,強行達成「人口統計平等(Demographic Parity)」,就一定會對那些成績更好的主流族群產生不公平,破壞了「機會均等(Equal Opportunity)」。

在實務上,要調到多公平,從來都不是一個單純的技術問題,而是合規、公關、甚至法律與道德的多方綜合博弈。
所以,身為系統分析師,在幫客戶客製化 AI 去偏見系統時,絕對要白紙黑字把「我們要採取的公平性指標與判定門檻(Threshold)」列入系統需求說明書(SRS)並由客戶高階主管簽核。不然到時候系統上線,不管 AI 怎麼判,你都會面臨某一邊群體的抗議或法律訴訟,這是開發 AI 應用時極其關鍵的防坑實務!


三、 拆開 AI 黑盒子:可解釋 AI(XAI)的兩大神兵

大語言模型和神經網路通常是一個複雜的「黑盒子」,我們很難知道它是怎麼算出結論的。
這會帶來法律與稽核上的大麻煩 —— 比如在 GDPR 第 22 條 中,當涉及「自動化個人決策(如拒絕貸款)」時,法律賦予了個人 「獲得解釋的權利(Right to Explanation)」。同時,這也直接對應了我們昨天在 ISO 42001 裡學到的「可審計性(Auditability)」與「可問責性(Accountability)」。

為此,我們需要 XAI(可解釋性 AI) 系統。在實務上,最常用的兩個分析工具是:

1. LIME(區域可解釋性、與模型無關之說明)

  • 核心特色局部解釋(Local Explanation)
  • 它是怎麼辦到的?:它不看整個模型的複雜架構。它只針對「單一次的預測結果」,在該樣本周圍故意加一點點干擾(擾動),看 AI 的回答會怎麼變。藉此推導出在「這一次預測」中,哪些特徵對最終決策的貢獻度最大。
  • 例子:解釋「為什麼這次拒絕了王小明的貸款?」,LIME 會回覆:「因為在王小明的情況下,『負債比過高(影響力 65%)』和『信用紀錄不足(影響力 25%)』是扣分的主要關鍵。」

2. SHAP(沙普利值解釋)

  • 核心特色全局與局部皆可解釋,基於博弈論(Game Theory)的數學模型。
  • 它是怎麼辦到的?:它把每個特徵當成是「博弈賽局中的合作玩家」,去計算如果加入或移除該特徵,對最終預測結果造成的「平均邊際貢獻」。
  • 優點:數學邏輯最嚴密,可以幫我們畫出整隻模型的「特徵重要性分布圖(Global Interpretation)」,讓我們知道整隻模型在做判斷時,最依賴哪些核心指標。

🔑 模擬題解析

Q: 一家金融機構正在稽核自家的 AI 房屋貸款審查系統,以確保該系統在決定拒絕特定客戶的貸款申請時,其決策理由是透明且能被稽核人員理解的。安全團隊希望為這『單次的理賠拒絕決策』,生成局部的解釋說明,以便向申請人進行合規說明。請問安全團隊應該採用哪種技術?

A. 差分隱私
B. 對抗性去偏見訓練
C. LIME
D. 拜占庭容錯聚合

【正確答案】C

【解析】

  • 抓解題關鍵字單次的理賠拒絕決策生成局部的解釋說明
  • 分析:在 GRC 審查與 XAI 技術中,最常拿來做「局部(Local)、單次、個別決策解釋」且與底層模型結構無關(Model-agnostic)的工具,就是 LIME(區域可解釋性說明)。
  • 選項 A 差分隱私是防範隱私外洩的;選項 B 是用在訓練中減少偏見的;選項 D 是在聯邦學習中防範髒數據更新的,都與「生成單次決策的局部解釋」無關。所以正確答案選 C

🎯 今日學習筆記重點

  • 歷史偏見:資料反映了有偏見的歷史,AI 照單全收(Amazon 案例)。
  • 抽樣偏見:訓練資料「偏食」,少數群體樣本不足。
  • 去偏見三階段:前處理(重新採樣)、處理中(損失處罰)、後處理(閾值調整)。
  • 公平性的數學衝突(Impossibility Theorem):在數學上無法同時滿足所有的公平性定義。去偏見不是單純的技術問題,而是 GRC 中的「治理與需求決策」,需要落實在 SRS 規格書中。
  • 解釋權(Right to Explanation):如 GDPR 第 22 條,自動化決策必須可解釋。
  • LIME:黑盒子的解密工具,專攻局部、單次決策的特徵影響力解釋。
  • SHAP:基於博弈論,能做全局與局部的決策特徵重要性分析,數學邏輯最嚴密。

明天是我們的最後一天!我們要來為這 30 天進行終極的大總結。

我們明天見啦!


上一篇
AI 的 ISO 認證:ISO/IEC 42001 國際標準與三大 AI 治理框架對比
系列文
新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記29
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言