大家好,今天我們要來看看,另外兩種針對隱私資料的推論期攻擊:模型反轉攻擊與成員推斷攻擊。
你可能在公司做專案時會想:「我們上傳了幾千筆病患的基因資料來訓練 AI,但模型上線後,我們只讓它回傳診斷結果,絕對不會外洩任何病患名字。這樣病患個資總該安全了吧?」
但實際情況是,即便你的 AI 守口如瓶,駭客一樣有辦法透過它的診斷行為,把當初用來訓練它的「隱私資料」給偷偷還原出來!
今天我們就來聊聊,駭客是怎麼用這兩招當「讀心術」,把 AI 腦袋裡的隱私個資給挖出來的。
這招的目標是:就算我沒看過你的訓練資料,我也能想辦法「畫」出那些訓練資料長怎樣。
因為 AI 在學習的時候,會把訓練資料的特徵深深記在腦袋裡(它的參數權重)。
駭客就利用這點:他先給 AI 一張完全是亂數雜訊的圖片,然後去問 AI。
AI 當然會回傳說:「信心分數 0%,不知道這是什麼。」
接著,駭客用數學梯度優化的方法,每次只稍微調整這張圖片的一點點像素,只要看到 AI 的「信心分數」變高,他就繼續往那個方向去調整。
重複幾萬次之後,當 AI 的信心分數飆到 99% 時,這張原本全是雜訊的圖片,居然就會慢慢浮現出一個清晰的人臉!
而這個人臉,就是你當初餵給 AI 訓練的病患典型樣貌。這招在資安上簡直就像是「照妖鏡」。
這招的目標更具體、也更危險:我想知道「某筆特定的個人資料」有沒有被拿來訓練你的 AI。
想像一下:
某家醫院用一組「愛滋病患者」的個資訓練了一個診斷 AI。
駭客手上拿到了李小明的個人資料。
駭客發動成員推斷攻擊,發現:「李小明的個資確實有在訓練集裡!」
這就等於直接確認:李小明是該醫院的愛滋病患者。這在個資和法律上是非常嚴重的隱私風暴!
AI 在訓練時,對於「看過好幾次」的訓練資料,通常判斷的信心分數會「特別高」(比如 99.9%)。
而對於「一輩子沒看過」的新資料,即便長得很像,判定分數可能就只有 85%。
駭客就利用這個「信心分數差」來抓出嫌疑人。
他把李小明的個資丟給 API,如果 API 回傳了 99.999% 這種高到誇張的信心分數,駭客就知道:李小明肯定被當成訓練資料讀過了!
既然成員推斷攻擊是利用「看過 vs 沒看過」的信心分數落差來抓人,防守方就有三種實質的技術手段來堵上這個漏洞:
成員推斷之所以會成功,根本原因就是模型「過擬合(Overfitting)」了——它對訓練資料死記硬背,所以一看到老客戶,反應就特別激烈(信心分數極高)。
這是在數學上最完美的防線。
這是最簡單、也最推薦在 API 部署階段實施的補償性控制。
成員推斷高度依賴 API 回傳極為精細的小數點(例如:99.98125%)。如果駭客拿不到這些精細的分數,他就沒辦法做統計分析。
99.98125% 直接變成 100%),抹去微小的特徵波動。| 面向 | 模型反轉(Model Inversion) | 成員推斷(Membership Inference) |
|---|---|---|
| 駭客的目標 | 還原出訓練資料的長相 | 確認特定人是否在訓練集裡 |
| 回傳的成果 | 近似的人臉圖像、特徵或基因資料 | 是/否(二元答案) |
| 利用的漏洞 | 模型信心分數反映了訓練資料的特徵 | 模型對訓練資料有「過擬合」的偏心分數 |
| 主要防禦 | 差分隱私、限制 API 回傳信心分數 | 差分隱私、做好模型正則化(防過擬合) |
我們來看一題 SecAI+ 模擬題:
「一個攻擊者利用已知目標對象的個人特徵資料查詢某個醫療預測模型,並利用模型回傳的高信心分數,成功推斷出該對象的資料確實出現在該模型的訓練資料集中。請問這屬於哪種隱私攻擊?」
A. 模型反轉
B. 成員推斷攻擊(Membership Inference Attack)
C. 模型竊取
D. 提示詞注入
答案是 B。
解題關鍵字:「推斷該對象的資料是否出現在訓練集中」,這就是標準的成員推斷攻擊。如果是要「還原/重建」資料庫裡的特徵,那才是模型反轉。
今天的重點總結:
明天我們要進入大語言模型(LLM)防禦的重頭戲了:提示詞注入(Prompt Injection)攻擊。我們要來看看駭客是怎麼用一兩句話,就把 AI 給教唆變壞的。
我們明天見啦!