上一篇我們把 AI 的攻擊面拆成資料、模型、應用、系統與供應鏈五塊,畫了一張關聯圖。
這篇我們要來認識 AI 安全框架,你可以把框架想成是別人整理好的懶人包,但框架這麼多,我們到底該怎麼選?先問自己想要解決什麼問題就好,例如:
每個不同的問題,就會對應到不同的框架,先知道自己要找什麼是選擇框架首要工作。
如果你做過網頁滲透,OWASP Top 10 對你來說應該不陌生,它把 Web 安全裡常見、值得優先注意的問題整理成一份清單。
而 OWASP LLM Top 10 做的事情差不多,只是換成大型語言模型,不過它看的不只有模型本身,還包括模型會碰到的資料、輸出、工具、權限以及供應鏈,目前最新的是 2026 年 8 月發布的 2026 版:
如果你看過 2025 版,會發現 10 個項目沒有增減,只是重新排過,唯一改名的是原本的 LLM07 System Prompt Leakage,2026 版擴大成 LLM08 Hidden Context Exposure,除了系統提示,也涵蓋開發者指令、從 RAG 取回的政策文字,以及應用程式開放給模型的工具 schema。
圖片來源:OWASP LLM Top 10
你可以把它想成一張「測試 todo list」,第一次走進陌生的 AI 檢測領域,不知道從哪裡開始時,就沿著清單逐項看
這種懶人包很適合拿來入門、做教育訓練,或快速盤點 AI 系統可能有哪些問題,但它也有一個問題,Top 10 是風險分類,不是完整攻擊流程,它告訴你房子常在哪裡出問題,卻不一定告訴你小偷怎麼進來、進來之後怎麼移動、怎麼找到有價值的東西,怎麼把高價值物品帶走,因此當你要看的是整條攻擊鏈,就需要另一個懶人包。
順帶一提,維護它的 OWASP GenAI Security Project 在 2025 年 12 月也發布了 Top 10 for Agentic Applications 2026,專門整理會自己規劃、自己行動的 Agent 風險。
兩份清單可以簡單這樣分:
- 模型只是應用裡的一個元件時,先看 LLM Top 10。
- 模型可以呼叫工具、保留跨對話記憶,甚至直接影響其他系統時,要把 Agentic Top 10 一起拿進來看。
AI 這個領域變化很快,所以看懶人包時要先記得確認版本。
資安人對 MITRE ATT&CK 應該並不陌生,它把攻擊者的行為拆成「戰術」和「技術」:
MITRE ATLAS 沿用了類似的思考方式,只是把焦點放在 AI 與機器學習系統,它會收錄攻擊者如何蒐集目標模型資訊、取得模型或資料存取權、準備攻擊資源、操縱模型行為、規避偵測、竊取模型與資料,以及對 AI 系統造成影響。
圖片來源:MITRE ATLAS
如果 OWASP LLM Top 10 像是旅遊待去清單,列出想去的景點與餐廳;ATLAS 就像行程規劃表,串起可能的路線完成整趟旅程。
這種結構很適合威脅建模與 Red Team,假設你要測試一個影像辨識服務,只列出「可能遭受對抗輸入」還不夠,你還需要思考攻擊者是否先蒐集模型輸出、推測模型種類,再建立替代模型,最後才能做出有效的對抗輸入。
ATLAS 對藍隊也很有用,當你知道攻擊鏈有哪些階段,就能反過來問目前在哪一段有紀錄?哪一段完全看不見?即使無法阻止所有攻擊,是否能在模型被大量探測或敏感資料被存取時提早發現?
SAIF 是 Secure AI Framework 的縮寫,Google 在 2023 年 6 月提出這個框架,它關注的是 AI 從開發、訓練、部署到實際使用的整條生命週期,應該如何納入既有資安能力,它把 AI 系統拆成資料、基礎設施、模型與應用四塊,在每一塊上標出風險與對應的控制措施,後來的 SAIF 2.0 又補上一張專門給 Agent 的風險圖,如果你上一篇看完攻擊面覺得眼熟,那是因為兩者切分系統的方式很接近。
AI 安全不是另起爐灶,身分驗證、最小權限、資產管理、供應鏈安全、偵測與應變,這些傳統控制仍然需要存在,只是當系統多了模型、訓練資料、Prompt、Agent 與工具之後,原本的控制必須跟著延伸,例如:
如果今天的重點不是滲透測試,而是企業準備導入 AI 治理,就要看 NIST AI RMF(AI Risk Management Framework)。
它是一個 AI 風險管理框架,1.0 版在 2023 年 1 月發布,性質是自願採用而非強制稽核,核心是四個功能:治理(Govern)、掌握情境(Map)、量測(Measure)、管理(Manage),你可以把它當成 AI 版的風險管理循環。
圖片來源:NIST AI RMF Playbook
另外 NIST 在 2024 年 7 月補了一份專門給生成式 AI 的 Generative AI Profile(NIST AI 600-1),前面 AI 黑魔法(04) 所引用的 AI red-teaming 定義就是出自於這裡,所以如果你要談的是企業怎麼導入 AI 治理,這兩份會一起用到。
除了上述的框架外,OWASP AISVS(AI Security Verification Standard)也值得了解一下,它是針對 AI 系統的安全驗證要求,比較接近檢查清單,適合確認系統在模型、資料、應用與營運上,是否落實應有的控制。
AISVS 1.0 版分成 12 個章節,從訓練資料完整性、輸入驗證、模型生命週期、存取控制、供應鏈,一路到記憶體與向量資料庫、Agent 編排、MCP 安全、對抗強健性與監控記錄,每條要求都標了 Level 1 到 3,讓你依系統的重要程度決定要驗到哪一層。
公開框架最大的好處,就是讓你不必從空白頁開始,直接套用就有一個起點,但這麼多的選擇裡面,到底哪一種框架好?答案是看你現在要解決什麼問題。
但框架也可能讓人產生一種錯覺,以為只要把清單全部勾完,系統就安全了,但 AI 系統的實際風險,還是要取決於它使用什麼資料、接上哪些工具、擁有多少權限,以及失敗後會造成什麼影響,同樣是 Prompt Injection,發生在只能回答公開資訊的 FAQ 機器人,和發生在能讀取郵件、建立帳號的 Agent,嚴重程度完全不同。
到這裡我們已經了解 AI 系統的攻擊面,也知道有哪些公開框架可以協助我們,下一篇開始,我們要正式進入第一個核心攻擊主題:Prompt Injection,一段看起來很普通的句子,為什麼能讓模型違背原本的指示?問題不一定只是防護做得不夠,而是大型語言模型結構上的問題。