iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

CaMeL 動態重擬定:讓 Agent 邊讀邊決定 系列

Agent 呼叫工具(寄信、讀檔、上網)時,讀進外部可竄改內容可能被挾持執行惡意行為,CaMeL 用雙模型分工與 capability 標記擋下直接劫持,但代價是計畫一旦定案就不能因讀到的內容而調整,任務完成率因此下降。本系列以 CaMeL 為起點,設計並實作一個「受限訊號+判讀關卡」機制,被隔離模型讀完不受信任資料後,只能送出型別受限、可稽核的訊號,由判讀關卡決定放不放行,讓計畫能有限度調整,同時不動搖 CaMeL 原本的安全保證,我們將在30 天內完成一個簡單架構的 demo,並在 AgentDojo 上驗證任務完成率與安全性的變化。

參賽天數 2 天 | 共 2 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文 團隊四點還吃牛肉man
DAY 1

Day 1|Agent執行期最容易被忽略的風險:控制流被劫持

前言 大家好,我是jerry,接下來30天聚焦將聚焦在被隔離模型讀完不受信任的資料後,能不能送出一個受限訊號,讓模型判斷只在信任結構前提下進行,決定要不要根據過...

2026-08-25 ‧ 由 jerry940917 分享
DAY 2

Day 2|CaMeL怎麼設計來擋這個問題:雙模型分工與capability機制

今天延伸昨天所講的,分別說明CaMeL如何把「決定做什麼」和「讀外部資料」拆給兩個分工的模型,看它實際上是怎麼運作的,這也是接下來要加以修改的部分,機制細節先了...

2026-08-26 ‧ 由 jerry940917 分享