iT邦幫忙

2026 iThome 鐵人賽

DAY 28
0
AI Engineering

3分鐘 AI Agent導論系列 第 28

[3分鐘 AI Agent導論] Day28 -- 護欄與安全性 (1)

  • 分享至 

  • xImage
  •  

周末的內容感覺有點生硬,大家看看就好,可以了解查找資料時Agent是如何運作背後的邏輯。

護欄(Guardrails)構成了保障Agent行為安全可控的分層防線,可用於管理數據隱私風險(ex.防止系統提示洩漏)或聲譽風險(ex.確保模型行為與品牌形象一致)。實踐中可以先針對已識別的風險設置護欄,再發現新漏洞時逐步添加。本層只作高層次的概覽,確立統一的分層骨架。

單個護欄不太可能提供足夠的保護,多個專門的護欄組合使用,才能構建出更有韌性的Agent系統。

護欄也存在另一類失敗:誤拒絕。為了降低危險請求被放行的概率,模型可能同時拒絕一部份合法但形式敏感的任務,例如經過授權的安全測試、模型蒸餾實驗。因此,護欄評估不能只測試"應該拒絕的請求是否被攔截",還需要測試"明確允許的請求是否能夠正常完成"。

護欄類型

按防護位置可以分成3層:上下文層、執行層、數據層。這3層不是按請求處理的先後順序排的,而是按被繞過的難度排的 -- 越靠下的層越不依賴模型的判斷,因此越難被一次成功的攻擊穿透,我們的討論也聚焦於此。

上下文層護欄管的是模型能看到什麼,在內容進入上下文之前攔截,通常包含4種機制。
1.相關性分類器 - 標記偏離主題的查詢,例如.寫碼助手收到"101有多高?"這種無關的問題。
2.安全分類器 - 檢測越獄(Jailbreak,即誘導模型繞過安全限制)和提示注入(prompt injection,即在輸入中嵌入惡性指令)。兩者的關鍵區別是:越獄是用戶試圖繞過模型的安全限制,提示注入則是攻擊者通過外部數據(ex.網頁、文件)間接操控模型行為。
3.內容審核 - 標記有害或不當的輸入,如暴力、歧視性內容。
4.基於規則的保護 - 採用確定性措施,包括黑名單、輸入長度限制、正則表達式過濾器,用以防範sql注入等已知威脅。來源標註與"指令/數據"分離也屬於這一層。

上下文層護欄的一個代表性工業實踐是 Anthropic 的 Constitutional Classifiers。核心有3,1.規則驅動 --用自然語言寫成的規則(明確規範那些內容允許/禁止)生成合成訓練數據,訓練輸入輸出分類器; 2.上下文聯合判斷 --新一代系統把用戶提問和模型回答放在一起檢查,因為有些回答單獨看沒問題(ex.如何使用食品調味料),只有對照提問才能發現"食品調味料"其實是化學試劑的暗語; 3.兩級篩查 --先用一個輕量級的探針(直接讀取模型內部激活、幾乎零成本)檢查所有對話,發現可疑之處再交給更強的分類器複審,而不是直接拒絕。這樣一來,第一級即使誤報較多也不影響體驗,成本大大降低。

但這一層有個結構性上限:處在同個上下文的Agent,很難判斷自己是否已經被注入。所以上下文層只能降低攻擊的成功率,給不出保證--也是有下面兩層的原因。

執行層護欄管的是"模型能做甚麼",在動作真正生效之前驗證。核心為工具風險評級:根據操作是否可逆、權限等級、財務影響,為每個工具標註風險等級(低/中/高),高風險操作需要額外審查或人工確認。關鍵在於這類複核必須由"上下文之外"的機制一起完成 --獨立的審查過程、最小權限憑證、沙盒隔離、人在迴路--否則它會和被注入的Agent一起淪陷。返回給用戶的回覆本身也是一次動作,因此"輸出檢查"同樣屬於這一層:PII過濾器審查輸出中的個人訊息(ex.身分證字號、手機號碼),防止不必要的暴露; 輸出驗證則通過內容檢查確保回覆與品牌價值一致。

一周前(9 月 2 日)Meta 剛發布新一代專門針對長時間軟體工程與自主工作流打造的旗艦模型 Muse Spark 1.3 後,Meta 首席 AI 官、Scale AI 創辦人 Alexandr Wang 今日在社群平台 X 上正式宣布:具備最強極限推理模式的頂規旗艦版「Muse Spark 1.3 Max」正式解除合作夥伴限定預覽,向所有開發者全面公開!
https://www.aiposthub.com/meta-muse-spark-1-3-max-public-release-alexandr-wang/


上一篇
[3分鐘 AI Agent導論] Day27 -- RAG - Sparse Embedding
下一篇
[3分鐘 AI Agent導論] Day29 -- 護欄與安全性 (2)&Harness複習
系列文
3分鐘 AI Agent導論32
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言