AI Security
CaMeL 動態重擬定:讓 Agent 邊讀邊決定
Agent 呼叫工具(寄信、讀檔、上網)時,讀進外部可竄改內容可能被挾持執行惡意行為,CaMeL 用雙模型分工與 capability 標記擋下直接劫持,但代價是計畫一旦定案就不能因讀到的內容而調整,任務完成率因此下降。本系列以 CaMeL 為起點,設計並實作一個「受限訊號+判讀關卡」機制,被隔離模型讀完不受信任資料後,只能送出型別受限、可稽核的訊號,由判讀關卡決定放不放行,讓計畫能有限度調整,同時不動搖 CaMeL 原本的安全保證,我們將在30 天內完成一個簡單架構的 demo,並在 AgentDojo 上驗證任務完成率與安全性的變化。