當 AI Agent 具備工具呼叫權限時,現有的外部防禦多半是「逐一檢查每個動作」。
但若攻擊者先污染 Agent 的記憶,誘導它執行一連串拆開看皆合法、湊起來卻會外洩資料的動作,單步驟的防範手法就會產生無效的問題。本系列文章專注於建立第一份針對「授權範圍內攻擊」的對抗式評估。
在這 30 天中,讀者將能學到:
看懂攻擊鏈的拼裝:掌握攻擊者如何利用合法工具堆疊攻擊。
理解相關能力與概念:了解相關防禦、攻擊、評測的基礎知識。
學會客觀的評測方法:掌握如何使用基準環境來評測。
前言 大家好,我是Ray。 在接下來的三十天,我會根據主題去探討一系列的核心問題:AI agent 只要有執行任務,就會多出許多傳統軟體沒有的漏洞——因為一般的...
前言 2023 年 2 月,微軟剛把 GPT-4 接進 Bing 的聊天功能沒多久,一個史丹佛的學生 Kevin Liu 對它打了一句話:「Ignore the...