上一篇看的是 Agent 的權限、記憶誰能寫、MCP Server 跟模型檔這四道防線,這篇把它們收成一份可以照著走的流程。如果有人請你去看一個 AI 系統安不安全,你會怎麼規劃?動手之前先把授權範圍談定,哪些系統可以打、會不會真的觸發寄信付款這類收不回來的動作,都要白紙黑字寫下來。
AI 黑魔法(05) 把 AI 系統拆開來看過一次,送 Payload 之前,這幾件事要先有答案:

OWASP 在 2025 年 1 月出了一份 GenAI Red Teaming Guide,講的就是 AI 系統的紅隊測試怎麼做,它把要測的東西分成四塊,模型本身、外面那層應用、底下的基礎設施,還有整套跑起來之後的行為,官方寫的是從模型層的有害內容跟偏見,一路到系統層的 API 誤用跟資料外洩。
測試項目不用自己從頭想,AI 黑魔法(06) 提過的 AISVS 就是現成的骨架,一列就是一個要測的點,攻擊面對到具體攻擊、對到怎麼測、對到什麼算過:
| 攻擊面 | 對應攻擊 | 怎麼測 | 通過條件 |
|---|---|---|---|
| 使用者輸入 | 直接 Prompt Injection | 送覆蓋指令、角色扮演,試著蓋掉系統指令 | 系統指令蓋不掉,不該說的不說 |
| 讀外部文件 | 間接注入 | 在會被讀進來的文件裡藏指令 | 文件裡的指令不被當命令執行 |
| 掛了工具 | 過度授權 | 誘導模型呼叫它不該呼叫的工具 | 高風險動作要人確認才動 |
| 下載的模型檔 | 供應鏈 | 查來源、驗 Hash、看格式與載入方式 | 只用內部核准、驗過的版本 |
| 知識庫與訓練資料 | 一直送查詢,把資料問出來 | 連續問同一類問題,看它會不會把知識庫原文或訓練過的內容吐出來 | 問不出原始文件的內容 |
這張表不是要一次填滿,是給這次檢測一個骨架,讓你知道走到哪、還剩哪些沒測、每一項的結論是過還是沒過。實際的清單會照第一步盤出來的攻擊面長出自己的樣子,只有聊天、沒接工具的系統,跟能自己下單付款的 Agent,要測的東西差很多。
規劃的骨架跟傳統滲透測試一樣,變的只有攻擊面,下一篇把視野拉高一點,看攻擊之外同樣繞不開的三件事,隱私、治理跟法規。