當 AI Agent 具備工具呼叫權限時,現有的外部防禦多半是「逐一檢查每個動作」。
但若攻擊者先污染 Agent 的記憶,誘導它執行一連串拆開看皆合法、湊起來卻會外洩資料的動作,單步驟的防範手法就會產生無效的問題。本系列文章專注於建立第一份針對「授權範圍內攻擊」的對抗式評估。
在這 30 天中,讀者將能學到:
看懂攻擊鏈的拼裝:掌握攻擊者如何利用合法工具堆疊攻擊。
理解相關能力與概念:了解相關防禦、攻擊、評測的基礎知識。
學會客觀的評測方法:掌握如何使用基準環境來評測。
前言 大家好,我是Ray。 在接下來的三十天,我會根據主題去探討一系列的核心問題:AI agent 只要有執行任務,就會多出許多傳統軟體沒有的漏洞——因為一般的...
前言 2023 年 2 月,微軟剛把 GPT-4 接進 Bing 的聊天功能沒多久,一個史丹佛的學生 Kevin Liu 對它打了一句話:「Ignore the...
前言 Day 1 列過四種防禦:偵測過濾、邊界標記、限制權限、架構分離。你可能會留下對這些名詞的印象。 但這四種防禦名詞的細節與差異是甚麼呢?答案是它們總在不同...
前言 要看懂「每一步都被允許執行但串連後卻是惡意行為」的動作鏈,得先看懂 agent 執行任務時的內部運作。 今天就來看看一個真的會連網、會自己決定下一步動作的...
前言 Day 4 我們學會了看一個 agent 的 trace,不過那太簡單了,只是我們自己在 Colab 的小練習。雖然末尾是說想要進階一點的加入惡意內容形成...
前言 昨天我們扮演攻擊者,直接對著購物網站的客服 bot 下指令。這段攻擊其實藏著一個很明顯的限制:我得自己坐在對話框前面,親手把惡意的 SQL 指令寫進輸入框...
前言 今天要討論的主題是 Agent 對於使用者的記憶能力,以及攻擊者除了昨天提到的IPI(間接提示詞注入攻擊)外,如何利用 Agent 的記憶機制進行更隱蔽的...
前言 今天我們來延伸討論 PoisonedRAG 和 AgentPoison 怎麼實作的。 研究一:PoisonedRAG 目標是讓某個問題被檢索到攻擊者寫的...
前言 第一代的防禦方式,主要是在內容送進主要模型之前,先判斷輸入內容是否可能包含攻擊,或先對外部資料進行處理。這類方法的共同點,是試圖從「內容本身」降低 Pro...
前言 工具權限只能讓我們得知: 這個工具能不能呼叫? 它不一定知道: 這筆資料能不能被傳遞到這個接收位址? 例如: read_private_data(...