iT邦幫忙

2026 iThome 鐵人賽

DAY 13
0
AI Security

新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記系列 第 13

AI 腦袋裡的隱私小偷:模型反轉與成員推斷攻擊

  • 分享至 

  • xImage
  •  

大家好,今天我們要來看看,另外兩種針對隱私資料的推論期攻擊:模型反轉攻擊成員推斷攻擊

你可能在公司做專案時會想:「我們上傳了幾千筆病患的基因資料來訓練 AI,但模型上線後,我們只讓它回傳診斷結果,絕對不會外洩任何病患名字。這樣病患個資總該安全了吧?」
但實際情況是,即便你的 AI 守口如瓶,駭客一樣有辦法透過它的診斷行為,把當初用來訓練它的「隱私資料」給偷偷還原出來!

今天我們就來聊聊,駭客是怎麼用這兩招當「讀心術」,把 AI 腦袋裡的隱私個資給挖出來的。


一、 讀心術一:模型反轉攻擊(Model Inversion Attack)

這招的目標是:就算我沒看過你的訓練資料,我也能想辦法「畫」出那些訓練資料長怎樣

1. 為什麼可能辦得到?

因為 AI 在學習的時候,會把訓練資料的特徵深深記在腦袋裡(它的參數權重)。
駭客就利用這點:他先給 AI 一張完全是亂數雜訊的圖片,然後去問 AI。
AI 當然會回傳說:「信心分數 0%,不知道這是什麼。」
接著,駭客用數學梯度優化的方法,每次只稍微調整這張圖片的一點點像素,只要看到 AI 的「信心分數」變高,他就繼續往那個方向去調整。

重複幾萬次之後,當 AI 的信心分數飆到 99% 時,這張原本全是雜訊的圖片,居然就會慢慢浮現出一個清晰的人臉!
而這個人臉,就是你當初餵給 AI 訓練的病患典型樣貌。這招在資安上簡直就像是「照妖鏡」。

2. 我們該怎麼防?

  • 差分隱私(Differential Privacy)
    這是一種在數學上保護隱私的神器。在訓練模型時,我們故意在資料裡加入一些「統計噪音」。
    這能保證不論駭客怎麼反推,都只能推出一個模糊的群體統計特徵,絕對無法還原出任何特定個人的隱私資料。
  • 限制 API 的回傳細節
    跟昨天一樣,API 不要回傳精準的信心分數(如貓 98.425%),只給 Top-1 類別(貓)。沒有了分數起伏,駭客就沒辦法算梯度來還原資料了。

二、 讀心術二:成員推斷攻擊(Membership Inference Attack)

這招的目標更具體、也更危險:我想知道「某筆特定的個人資料」有沒有被拿來訓練你的 AI

1. 這為什麼是嚴重的個資洩漏?

想像一下:

某家醫院用一組「愛滋病患者」的個資訓練了一個診斷 AI。
駭客手上拿到了李小明的個人資料。
駭客發動成員推斷攻擊,發現:「李小明的個資確實有在訓練集裡!」
這就等於直接確認:李小明是該醫院的愛滋病患者。這在個資和法律上是非常嚴重的隱私風暴!

2. 它是怎麼辦到的?利用「過擬合」

AI 在訓練時,對於「看過好幾次」的訓練資料,通常判斷的信心分數會「特別高」(比如 99.9%)。
而對於「一輩子沒看過」的新資料,即便長得很像,判定分數可能就只有 85%。

駭客就利用這個「信心分數差」來抓出嫌疑人。
他把李小明的個資丟給 API,如果 API 回傳了 99.999% 這種高到誇張的信心分數,駭客就知道:李小明肯定被當成訓練資料讀過了!

3. 我們該怎麼防?(三大具體防禦手段)

既然成員推斷攻擊是利用「看過 vs 沒看過」的信心分數落差來抓人,防守方就有三種實質的技術手段來堵上這個漏洞:

1) 抑制模型過擬合(Overfitting Prevention)

成員推斷之所以會成功,根本原因就是模型「過擬合(Overfitting)」了——它對訓練資料死記硬背,所以一看到老客戶,反應就特別激烈(信心分數極高)。

  • 具體作法
    • L2 正則化(Weight Decay)與 Dropout:在訓練時,故意丟棄或減少一些神經網路權重。這會強迫模型「不要死記」單一資料的細節,只學大規律。
    • 早停法(Early Stopping):在模型剛學會基本規律、還沒開始鑽牛角尖記個別客戶個資前,就提早結束訓練。這樣一來,新舊資料的信心分數落差就會縮小,駭客就沒辦法做比較了。
2) 實施差分隱私(Differential Privacy)

這是在數學上最完美的防線。

  • 具體作法:在訓練時使用 DP-SGD 演算法,進行梯度裁剪加入校準噪音
  • 防禦原理:差分隱私的核心公式,能從數學上保證「資料集裡有你的資料」和「沒你的資料」,訓練出來的模型在表現上幾乎完全沒有差別。既然有沒有你都一樣,駭客上網去查你的個資,得到的信心分數也跟其他人一模一樣,成員推斷自然就直接破功。
3) 降低 API 回傳的信心分數精度(Reducing Precision of Confidence Scores)

這是最簡單、也最推薦在 API 部署階段實施的補償性控制。
成員推斷高度依賴 API 回傳極為精細的小數點(例如:99.98125%)。如果駭客拿不到這些精細的分數,他就沒辦法做統計分析。

  • 具體作法
    • 對分數取整(Rounding):把信心分數進行四捨五入(比如:99.98125% 直接變成 100%),抹去微小的特徵波動。
    • 只返回最高機率的類別(Top-1):API 乾脆不回傳任何百分比分數,只回傳最終結果(例如只回答:「李小明,診斷為陰性」)。沒有了信心分數,駭客直接集體失明,根本無從推算。

三、 兩大隱私攻擊快速對比

面向 模型反轉(Model Inversion) 成員推斷(Membership Inference)
駭客的目標 還原出訓練資料的長相 確認特定人是否在訓練集裡
回傳的成果 近似的人臉圖像、特徵或基因資料 是/否(二元答案)
利用的漏洞 模型信心分數反映了訓練資料的特徵 模型對訓練資料有「過擬合」的偏心分數
主要防禦 差分隱私、限制 API 回傳信心分數 差分隱私、做好模型正則化(防過擬合)

考試會怎麼考?

我們來看一題 SecAI+ 模擬題:

「一個攻擊者利用已知目標對象的個人特徵資料查詢某個醫療預測模型,並利用模型回傳的高信心分數,成功推斷出該對象的資料確實出現在該模型的訓練資料集中。請問這屬於哪種隱私攻擊?」

A. 模型反轉
B. 成員推斷攻擊(Membership Inference Attack)
C. 模型竊取
D. 提示詞注入

答案是 B
解題關鍵字:「推斷該對象的資料是否出現在訓練集中」,這就是標準的成員推斷攻擊。如果是要「還原/重建」資料庫裡的特徵,那才是模型反轉。


今天的重點總結:

  • 模型反轉:透過梯度優化把資料「畫出來」,防守要靠差分隱私
  • 成員推斷:利用過擬合的分數差距,抓出特定人是不是訓練集成員。
  • 共同解法差分隱私(Differential Privacy) 可以在數學上,完美解決這兩種推論期的隱私洩漏。

明天我們要進入大語言模型(LLM)防禦的重頭戲了:提示詞注入(Prompt Injection)攻擊。我們要來看看駭客是怎麼用一兩句話,就把 AI 給教唆變壞的。
我們明天見啦!


上一篇
免費拷貝你的 AI:模型竊取攻擊與事後追查的浮水印技術
下一篇
大語言模型版的 SQL Injection:直接提示詞注入攻擊
系列文
新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記22
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言