Agent 呼叫工具(寄信、讀檔、上網)時,讀進外部可竄改內容可能被挾持執行惡意行為,CaMeL 用雙模型分工與 capability 標記擋下直接劫持,但代價是計畫一旦定案就不能因讀到的內容而調整,任務完成率因此下降。本系列以 CaMeL 為起點,設計並實作一個「受限訊號+判讀關卡」機制,被隔離模型讀完不受信任資料後,只能送出型別受限、可稽核的訊號,由判讀關卡決定放不放行,讓計畫能有限度調整,同時不動搖 CaMeL 原本的安全保證,我們將在30 天內完成一個簡單架構的 demo,並在 AgentDojo 上驗證任務完成率與安全性的變化。
前言 大家好,我是jerry,接下來30天聚焦將聚焦在被隔離模型讀完不受信任的資料後,能不能送出一個受限訊號,讓模型判斷只在信任結構前提下進行,決定要不要根據過...
今天延伸昨天所講的,分別說明CaMeL如何把「決定做什麼」和「讀外部資料」拆給兩個分工的模型,看它實際上是怎麼運作的,這也是接下來要加以修改的部分,機制細節先了...
昨天留了兩個疑點:P-LLM規劃階段本質上看不到資料,跟任務完成率掉下來,是不是同一件事;還有檢查時機是不是太晚,今天把「代價」這件事攤開來講清楚,探討代價到底...
PS:感覺前幾天好嚴肅,和朋友討論之後希望接下來能帶向較輕快的節奏~ 接下來看看控制流的說法,它借自傳統軟體資安裡的Control-Flow Integrity...
昨天把CFI這個詞的出處講清楚了。今天正式進ControlValve的原文,看它具體怎麼把「控制流圖」這個抽象概念,變成一套真的能跑在多agent系統上的機制。...
昨天判斷「結構化的窄判斷」跟「開放式的alignment判斷」風險本質不同,今天用論文裡的Slack案例,把這個判斷放到具體攻擊上檢驗一遍。 攻擊長什麼樣子 說...
在前面幾天我們整理了CaMeL是管資料流,而ControlValve是管控制流,今天將進入研究CXI(Context-to-Execution Integrit...
一篇從高處批評的論文 在Intent-to-Execution Integrity這篇中主張安全漏洞的本質是執行結果沒有保留住使用者的意圖,運用語意保留(sem...
CaMeL自己怎麼定義這類失敗 CaMeL論文把這類失敗定名為「Data requires action」,採取什麼行動,取決於還沒讀到的資料。論文舉的官方例子...
這個系列好難啊,是個好新的主題,感覺光是整理資料就有夠多了,希望接下來的實作來得及XD 今天要開始設計解法,看被Q-LLM讀完資料之後,能不能送出一個「受限的訊...