iT邦幫忙

2026 iThome 鐵人賽

DAY 27
0
AI Security

AI 黑魔法:30 天拆解 AI 系統攻擊面(重啟)系列 第 27

AI 黑魔法(27):怎麼規劃一次 AI 安全檢測?從 Attack Surface 到 Checklist

  • 分享至 

  • xImage
  •  

上一篇看的是 Agent 的權限、記憶誰能寫、MCP Server 跟模型檔這四道防線,這篇把它們收成一份可以照著走的流程。如果有人請你去看一個 AI 系統安不安全,你會怎麼規劃?動手之前先把授權範圍談定,哪些系統可以打、會不會真的觸發寄信付款這類收不回來的動作,都要白紙黑字寫下來。

這個 AI 收得到什麼,又碰得到什麼

AI 黑魔法(05) 把 AI 系統拆開來看過一次,送 Payload 之前,這幾件事要先有答案:

  • 哪些東西送得進去,只有使用者打的字,還是文件、網頁、圖片、工具回傳的內容也會一起送進模型?每多一種,就多一個注入的入口。
  • 它接得到什麼,有沒有掛工具、能不能呼叫 API、能不能改資料庫、能不能把東西送到外面去?
  • 它的模型從哪裡來,是接雲端服務,還是自己下載別人訓練好的模型檔?
  • 它存了什麼,訓練資料、知識庫、對話紀錄裡有沒有敏感的東西?

GenAI Red Teaming Guide

OWASP 在 2025 年 1 月出了一份 GenAI Red Teaming Guide,講的就是 AI 系統的紅隊測試怎麼做,它把要測的東西分成四塊,模型本身、外面那層應用、底下的基礎設施,還有整套跑起來之後的行為,官方寫的是從模型層的有害內容跟偏見,一路到系統層的 API 誤用跟資料外洩。

Checklist 長什麼樣

測試項目不用自己從頭想,AI 黑魔法(06) 提過的 AISVS 就是現成的骨架,一列就是一個要測的點,攻擊面對到具體攻擊、對到怎麼測、對到什麼算過:

攻擊面 對應攻擊 怎麼測 通過條件
使用者輸入 直接 Prompt Injection 送覆蓋指令、角色扮演,試著蓋掉系統指令 系統指令蓋不掉,不該說的不說
讀外部文件 間接注入 在會被讀進來的文件裡藏指令 文件裡的指令不被當命令執行
掛了工具 過度授權 誘導模型呼叫它不該呼叫的工具 高風險動作要人確認才動
下載的模型檔 供應鏈 查來源、驗 Hash、看格式與載入方式 只用內部核准、驗過的版本
知識庫與訓練資料 一直送查詢,把資料問出來 連續問同一類問題,看它會不會把知識庫原文或訓練過的內容吐出來 問不出原始文件的內容

這張表不是要一次填滿,是給這次檢測一個骨架,讓你知道走到哪、還剩哪些沒測、每一項的結論是過還是沒過。實際的清單會照第一步盤出來的攻擊面長出自己的樣子,只有聊天、沒接工具的系統,跟能自己下單付款的 Agent,要測的東西差很多。

這篇的小總結

規劃的骨架跟傳統滲透測試一樣,變的只有攻擊面,下一篇把視野拉高一點,看攻擊之外同樣繞不開的三件事,隱私、治理跟法規。


上一篇
AI 黑魔法(26):縱深防禦(二),Agent、MCP 跟模型檔的防線
系列文
AI 黑魔法:30 天拆解 AI 系統攻擊面(重啟)27
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言