iT邦幫忙

2026 iThome 鐵人賽

DAY 6
0
AI Security

AI 黑魔法:30 天拆解 AI 系統攻擊面系列 第 6

AI 黑魔法(06):站在巨人肩膀上,AI 安全框架怎麼選?

  • 分享至 

  • xImage
  •  

上一篇我們把 AI 的攻擊面拆成資料、模型、應用、系統與供應鏈五塊,畫了一張關聯圖。

這篇我們要來認識 AI 安全框架,你可以把框架想成是別人整理好的懶人包,但框架這麼多,我們到底該怎麼選?先問自己想要解決什麼問題就好,例如:

  • 想知道 AI 有哪些常見漏洞?
  • 想了解攻擊者通常會怎麼下手?
  • 想建立公司內部的 AI 治理流程?

每個不同的問題,就會對應到不同的框架,先知道自己要找什麼是選擇框架首要工作。

OWASP LLM Top 10:想知道有哪些常見風險

如果你做過網頁滲透,OWASP Top 10 對你來說應該不陌生,它把 Web 安全裡常見、值得優先注意的問題整理成一份清單。

OWASP LLM Top 10 做的事情差不多,只是換成大型語言模型,不過它看的不只有模型本身,還包括模型會碰到的資料、輸出、工具、權限以及供應鏈,目前最新的是 2026 年 8 月發布的 2026 版:

  • LLM01 Prompt Injection(提示注入)
  • LLM02 Sensitive Information Disclosure(敏感資訊洩漏)
  • LLM03 Excessive Agency(過大的行動權限)
  • LLM04 Supply Chain(供應鏈)
  • LLM05 Data and Model Poisoning(資料與模型投毒)
  • LLM06 Unbounded Consumption(無節制的資源消耗)
  • LLM07 Misinformation(錯誤資訊)
  • LLM08 Hidden Context Exposure(隱藏上下文外洩)
  • LLM09 Vector and Embedding Weaknesses(向量與嵌入弱點)
  • LLM10 Improper Output Handling(不安全的輸出處理)

如果你看過 2025 版,會發現 10 個項目沒有增減,只是重新排過,唯一改名的是原本的 LLM07 System Prompt Leakage,2026 版擴大成 LLM08 Hidden Context Exposure,除了系統提示,也涵蓋開發者指令、從 RAG 取回的政策文字,以及應用程式開放給模型的工具 schema。

圖片來源:OWASP LLM Top 10

你可以把它想成一張「測試 todo list」,第一次走進陌生的 AI 檢測領域,不知道從哪裡開始時,就沿著清單逐項看

  • 外部內容能不能改變模型原本的提示詞?
  • 模型回答會不會沒經過處理,就直接交給瀏覽器或後端?
  • 它能接觸哪些敏感資料?
  • 呼叫工具時,拿到的權限是不是太大?

這種懶人包很適合拿來入門、做教育訓練,或快速盤點 AI 系統可能有哪些問題,但它也有一個問題,Top 10 是風險分類,不是完整攻擊流程,它告訴你房子常在哪裡出問題,卻不一定告訴你小偷怎麼進來、進來之後怎麼移動、怎麼找到有價值的東西,怎麼把高價值物品帶走,因此當你要看的是整條攻擊鏈,就需要另一個懶人包。

順帶一提,維護它的 OWASP GenAI Security Project 在 2025 年 12 月也發布了 Top 10 for Agentic Applications 2026,專門整理會自己規劃、自己行動的 Agent 風險。

兩份清單可以簡單這樣分:

  • 模型只是應用裡的一個元件時,先看 LLM Top 10。
  • 模型可以呼叫工具、保留跨對話記憶,甚至直接影響其他系統時,要把 Agentic Top 10 一起拿進來看。

AI 這個領域變化很快,所以看懶人包時要先記得確認版本。

MITRE ATLAS:想理解攻擊者怎麼思考

資安人對 MITRE ATT&CK 應該並不陌生,它把攻擊者的行為拆成「戰術」和「技術」:

  • 戰術:在說攻擊者為什麼做這件事,例如取得初始存取、建立持久化或蒐集資料。
  • 技術:則在說怎麼做到的。

MITRE ATLAS 沿用了類似的思考方式,只是把焦點放在 AI 與機器學習系統,它會收錄攻擊者如何蒐集目標模型資訊、取得模型或資料存取權、準備攻擊資源、操縱模型行為、規避偵測、竊取模型與資料,以及對 AI 系統造成影響。

圖片來源:MITRE ATLAS

如果 OWASP LLM Top 10 像是旅遊待去清單,列出想去的景點與餐廳;ATLAS 就像行程規劃表,串起可能的路線完成整趟旅程。

這種結構很適合威脅建模與 Red Team,假設你要測試一個影像辨識服務,只列出「可能遭受對抗輸入」還不夠,你還需要思考攻擊者是否先蒐集模型輸出、推測模型種類,再建立替代模型,最後才能做出有效的對抗輸入。

ATLAS 對藍隊也很有用,當你知道攻擊鏈有哪些階段,就能反過來問目前在哪一段有紀錄?哪一段完全看不見?即使無法阻止所有攻擊,是否能在模型被大量探測或敏感資料被存取時提早發現?

SAIF:把安全放進 AI 開發流程

SAIF 是 Secure AI Framework 的縮寫,Google 在 2023 年 6 月提出這個框架,它關注的是 AI 從開發、訓練、部署到實際使用的整條生命週期,應該如何納入既有資安能力,它把 AI 系統拆成資料、基礎設施、模型與應用四塊,在每一塊上標出風險與對應的控制措施,後來的 SAIF 2.0 又補上一張專門給 Agent 的風險圖,如果你上一篇看完攻擊面覺得眼熟,那是因為兩者切分系統的方式很接近。

AI 安全不是另起爐灶,身分驗證、最小權限、資產管理、供應鏈安全、偵測與應變,這些傳統控制仍然需要存在,只是當系統多了模型、訓練資料、Prompt、Agent 與工具之後,原本的控制必須跟著延伸,例如:

  • 以前你會管理正式環境使用了哪些程式套件,現在也要知道模型與資料集從哪裡來。
  • 以前會監控異常登入,現在也要注意模型是不是被大量探測。
  • 以前會限制服務帳號權限,現在要控制 Agent 可以呼叫哪些工具。

NIST AI RMF:建立治理流程

如果今天的重點不是滲透測試,而是企業準備導入 AI 治理,就要看 NIST AI RMF(AI Risk Management Framework)

它是一個 AI 風險管理框架,1.0 版在 2023 年 1 月發布,性質是自願採用而非強制稽核,核心是四個功能:治理(Govern)、掌握情境(Map)、量測(Measure)、管理(Manage),你可以把它當成 AI 版的風險管理循環。

圖片來源:NIST AI RMF Playbook

另外 NIST 在 2024 年 7 月補了一份專門給生成式 AI 的 Generative AI Profile(NIST AI 600-1),前面 AI 黑魔法(04) 所引用的 AI red-teaming 定義就是出自於這裡,所以如果你要談的是企業怎麼導入 AI 治理,這兩份會一起用到。

AISVS:AI 系統的檢核清單

除了上述的框架外,OWASP AISVS(AI Security Verification Standard)也值得了解一下,它是針對 AI 系統的安全驗證要求,比較接近檢查清單,適合確認系統在模型、資料、應用與營運上,是否落實應有的控制。

AISVS 1.0 版分成 12 個章節,從訓練資料完整性、輸入驗證、模型生命週期、存取控制、供應鏈,一路到記憶體與向量資料庫、Agent 編排、MCP 安全、對抗強健性與監控記錄,每條要求都標了 Level 1 到 3,讓你依系統的重要程度決定要驗到哪一層。

框架怎麼選?找最適合處理現在問題的

公開框架最大的好處,就是讓你不必從空白頁開始,直接套用就有一個起點,但這麼多的選擇裡面,到底哪一種框架好?答案是看你現在要解決什麼問題。

  • 想快速了解生成式 AI 常見風險,就先看 OWASP LLM Top 10。
  • 想理解攻擊者可能採取哪些路徑,就搭配 MITRE ATLAS。
  • 要設計 AI 系統,就參考 SAIF。
  • 建立企業 AI 治理流程,就看 NIST AI RMF。
  • 如果要一條一條確認安全需求是不是達成了,就翻 AISVS。

但框架也可能讓人產生一種錯覺,以為只要把清單全部勾完,系統就安全了,但 AI 系統的實際風險,還是要取決於它使用什麼資料、接上哪些工具、擁有多少權限,以及失敗後會造成什麼影響,同樣是 Prompt Injection,發生在只能回答公開資訊的 FAQ 機器人,和發生在能讀取郵件、建立帳號的 Agent,嚴重程度完全不同。

這篇的小總結

到這裡我們已經了解 AI 系統的攻擊面,也知道有哪些公開框架可以協助我們,下一篇開始,我們要正式進入第一個核心攻擊主題:Prompt Injection,一段看起來很普通的句子,為什麼能讓模型違背原本的指示?問題不一定只是防護做得不夠,而是大型語言模型結構上的問題。


上一篇
AI 黑魔法(05):AI 的攻擊面有哪些?從資料到供應鏈
下一篇
AI 黑魔法(07):Prompt Injection 是什麼?為什麼 LLM 天生擋不住這道咒語
系列文
AI 黑魔法:30 天拆解 AI 系統攻擊面10
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言