iT邦幫忙

2026 iThome 鐵人賽

DAY 12
0
AI Security

新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記系列 第 12

免費拷貝你的 AI:模型竊取攻擊與事後追查的浮水印技術

  • 分享至 

  • xImage
  •  

大家好,今天我們要來看看推論期的一種非常精打細算的攻擊:模型竊取攻擊(Model Extraction Attack)

在業界,要開發出一個商用等級的 AI 模型,成本非常驚人:需要買幾億筆資料、燒幾百萬台幣的算力,還要請一堆年薪百萬的工程師寫演算法。
但是,模型竊取攻擊卻可以讓對手「不花這些研發成本」,只要去拼命呼叫你的 API,就能把你的 AI 「免費拷貝」走!

這在資安上就像是:對手不去廚房偷你的秘方,而是每天去你的餐廳點 100 盤菜,一邊吃一邊寫下味道特徵,最後反推出你的祖傳食譜。

今天我們就來聊聊這個精打細算的攻擊是怎麼玩的,以及我們防守方該怎麼抓小偷。


一、 什麼是模型竊取?

模型竊取攻擊的目標,就是複製出一個跟目標模型功能幾乎一模一樣的「替代模型(Surrogate Model)」

駭客完全不需要:

  • 偷看你的原始碼或模型檔案(不用入侵伺服器)。
  • 拿到你的原始訓練資料集。
  • 擁有任何內部管理權限。

他只需要:

  1. 可以正常呼叫你對外開放的 API(只要付點小錢,甚至利用免費額度)。
  2. 自己準備一台電腦來訓練替代模型。
  3. 利用大量查詢把你的模型答案「套」出來。

二、 駭客套答案的三大招

駭客是怎麼呼叫 API 來偷特徵的呢?主要有三種方法:

1. 資料無關提取(Data-Free Extraction)

駭客完全不準備任何有意義的資料,就是隨機亂產生一堆垃圾輸入丟給你的 API,然後記錄你的 API 回傳了什麼。
雖然要呼叫成百上千次,但只要次數夠多,也能慢慢拼湊出你模型的樣子。

2. 替代資料提取(Surrogate Data-Based Extraction)

這是比較聰明的做法。
比如你的模型是「人臉辨識」,駭客就去網路上隨便找一個公開的人臉資料集(這叫替代資料),丟給你的 API。
這時他會記錄你 API 回傳的「信心分數」(比如:95% 是 A、3% 是 B、2% 是 C)。
這種信心分數包含非常多的決策線索,會讓他的替代模型學習效率大幅提升。

3. 自適應查詢提取(Adaptive Query-Based Extraction)★ 最有效率

這是最厲害的套話方式。
AI 模型在判定是非對錯時,會有一條「決策邊界」(Boundary)。
駭客會根據前一次呼叫的結果,動態調整下一次要問的問題。
他會把問題集中在模型「似是而非、最難下決定」的邊界附近。
因為邊界樣本含有的模型決策資訊最多,用這招,駭客只要呼叫極少的 API 次數,就能偷走模型。


三、 我們該怎麼防?

保護自己的智慧財產權,防守方有幾招可以防範:

  • 速率限制(Rate Limiting)★ 實務最常用
    限制每個帳號、每個 IP 每分鐘或每天能查詢的上限。你想瘋狂呼叫 API 套資料?直接把你鎖帳號。
  • 只返回最高機率(Top-1)
    API 不要回傳完整的信心分數分布(如貓 90%、狗 10%),只回傳最高的一個類別(貓)。這能大幅降低駭客每次能偷到的資訊量。
  • 輸出加入噪音
    故意在回傳的信心分數上加一點點微小的亂數干擾,讓駭客拿到的答案是髒的,這樣他學出來的替代模型精度就會變差。

四、 抓小偷的神兵:模型浮水印(Model Watermarking)

如果模型真的被偷走了,而且對手把它部署在自己的服務上賺錢,我們該怎麼事後證明它是偷來的?
這時候我們就需要模型浮水印技術

它是怎麼運作的?

  1. 植入暗號
    我們在訓練模型時,故意設計一個很不合邏輯的「觸發配對」。
    比如:只要輸入一段無意義的字串 [MY-WM-999],模型就一定要輸出 [MY-CONFIRM-OK]
  2. 事後驗證
    當你懷疑對手的 AI 是偷你的。你不用去偷看他的程式碼,你只要去呼叫他的 API,輸入 [MY-WM-999]
    如果他的 AI 真的乖乖回傳了 [MY-CONFIRM-OK],這在法庭上就是百分之百的偷竊鐵證!因為正常的 AI 根本不可能這樣回答。

考試會怎麼考?

我們來看這題 SecAI+ 模擬題:

「某家 AI 創創公司懷疑競爭對手透過大量的 API 查詢,複製了自家的核心分類模型。為了在法庭上舉證對手確實竊取了模型,這家創創公司應該在部署模型前採用哪種技術?」

A. 對抗性訓練
B. 速率限制(Rate Limiting)
C. 模型浮水印(Model Watermarking)
D. 輸出擾動

答案是 C
解題關鍵字:「事後在法庭上舉證偷竊」。
速率限制和輸出擾動是「防禦(不讓對方偷)」,而能在事後用來證明對方偷竊的技術,只有模型浮水印


今天的重點總結:

  • 模型竊取:駭客不用檔案、不用資料,光靠大量查詢 API 就能拷貝模型。
  • 自適應查詢:鎖定「決策邊界」來套話,是最高效率的偷法。
  • 防守手段
    • 預防:API 限速(Rate Limiting)、只給最高類別(Top-1)、加噪音。
    • 抓小偷模型浮水印(Model Watermarking)

明天我們要講 AI 隱私攻擊的兩姐妹:模型反轉與成員推斷。看看駭客是怎麼用這兩招來偷出你訓練集裡的個人隱私資料。
我們明天見啦!


上一篇
AI 界的無色無味毒藥:0.1% 的惡意樣本就能植入模型後門
下一篇
AI 腦袋裡的隱私小偷:模型反轉與成員推斷攻擊
系列文
新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記22
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言