iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

合法呼叫湊出的攻擊鏈:AI Agent 防禦的 30 天觀念養成 系列

當 AI Agent 具備工具呼叫權限時,現有的外部防禦多半是「逐一檢查每個動作」。
但若攻擊者先污染 Agent 的記憶,誘導它執行一連串拆開看皆合法、湊起來卻會外洩資料的動作,單步驟的防範手法就會產生無效的問題。本系列文章專注於建立第一份針對「授權範圍內攻擊」的對抗式評估。

在這 30 天中,讀者將能學到:
看懂攻擊鏈的拼裝:掌握攻擊者如何利用合法工具堆疊攻擊。
理解相關能力與概念:了解相關防禦、攻擊、評測的基礎知識。
學會客觀的評測方法:掌握如何使用基準環境來評測。

參賽天數 22 天 | 共 22 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文 團隊四點還吃牛肉man
DAY 11

Day 11|如何安全交付自動化的審查任務給Agent?

前言 如果把「客戶資料審查」交給 Agent,它可能會先讀資料,再整理結果,最後把摘要寄出去。 從 Agent 的角度看,這幾步都只是工具呼叫: read_cu...

2026-09-04 ‧ 由 tdoh_ray 分享
DAY 12

Day 12|argument 被改寫之後,runtime 還追得到它的來源嗎

前言 Day 11 的工具呼叫不再直接由模型觸發,中間插了一層 CapabilityManager,runtime 先確認 agent 有沒有使用某個工具的能力...

2026-09-05 ‧ 由 tdoh_ray 分享
DAY 13

Day 13|在 Agent 執行期間,它是怎麼去確認授權依據的?

前言 過往的授權只驗證一件事:這個 Agent 當下有沒有權限執行該動作。一旦把「執行脈絡」放進來,問題的本質就變了——即便該動作完全合規,放在目前的任務目標與...

2026-09-06 ‧ 由 tdoh_ray 分享
DAY 14

Day 14|Agent 的執行環境要根據什麼標準來判斷執行路徑是否符合要求?

前言 Day 13 讓我多注意到關於legitimacy_reference的可討論問題。 執行環境要判斷一個工具呼叫能不能執行的時候,手上除了使用者、工具、參...

2026-09-07 ‧ 由 tdoh_ray 分享
DAY 15

Day 15|如果正常行為是學出來的,判斷標準本身也可能被污染

前言 D14 我把 legitimacy_reference 拆成四種可能的參照來源:政策標準、流程模型、歷史行為與任務目的。那篇最後留下的問題是,執行環境即使...

2026-09-08 ‧ 由 tdoh_ray 分享
DAY 16

Day 16|Runtime 對惡意指示有了反應後,這個反應本身也成了攻擊面

前言 前面把授權從「這個 Agent 有沒有權限」往執行脈絡延伸之後,問題就不只剩下「怎麼判斷這一步合不合理」。 執行環境真的判斷出偏離之後,接下來要做什麼?...

2026-09-09 ‧ 由 tdoh_ray 分享
DAY 17

Day 17|什麼是Confused Deputy?要怎麼去確認與優化Agent的決策正確性?

前言 這個系列寫到現在,我一直在同一個假設底下討論:有一個 Agent 代表某位使用者行事,而我要判斷它的每一步動作能不能發生。前面談過的能力(Capabili...

2026-09-10 ‧ 由 tdoh_ray 分享
DAY 18

Day 18|開始分析 utility 與 security 之前:先檢查 Harness 修改與基礎設施錯誤

前言 Day 16 處理了 AgentDojo 的 Utility 與 Security 怎麼解讀,也談到模型回應可能帶來的可用性成本。但在真正拿這兩個數字做比...

2026-09-11 ‧ 由 tdoh_ray 分享
DAY 19

Day 19|Security=False 的意義是什麼?透過AgentDojo實戰與分析結果

前言 今天終於要實際以 AgentDojo 進行測試攻擊產生、環境注入、模型執行以及最後的判定函式了。 通常一個評測單元正常結束後,我們會好奇紀錄中的 se...

2026-09-12 ‧ 由 tdoh_ray 分享
DAY 20

Day 20|任務的可行性檢查的是什麼作用?為什麼它不會改變攻擊成功率?

前言 這幾次跑完 AgentDojo 的整輪攻擊評測之後,輸出大概都長這樣: Results for suite workspace Average utili...

2026-09-13 ‧ 由 tdoh_ray 分享