當 AI Agent 具備工具呼叫權限時,現有的外部防禦多半是「逐一檢查每個動作」。
但若攻擊者先污染 Agent 的記憶,誘導它執行一連串拆開看皆合法、湊起來卻會外洩資料的動作,單步驟的防範手法就會產生無效的問題。本系列文章專注於建立第一份針對「授權範圍內攻擊」的對抗式評估。
在這 30 天中,讀者將能學到:
看懂攻擊鏈的拼裝:掌握攻擊者如何利用合法工具堆疊攻擊。
理解相關能力與概念:了解相關防禦、攻擊、評測的基礎知識。
學會客觀的評測方法:掌握如何使用基準環境來評測。
前言 跑完 AgentDojo 的 workspace 套件後,命令列最後會看到: Results for suite workspace Passed inj...
前言 前一批實驗留下了一個異常一致的結果。我把同一個設定重複跑了十次——同一個工具型使用者任務、同一批 14 個注入目標、同一種把指令藏進資料裡的注入手法、同一...