iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

Medical AI Security Lab:醫療 AI Chatbot 的攻防實驗與自動化 Red Team 系列

近年來,LLM 逐漸進入醫療應用,也帶來 Prompt Injection、資料外洩、模型濫用等新型資安風險。本系列將建立虛構醫療 AI Chatbot,結合 OWASP、NIST 與 MITRE 框架探討 AI 攻防。內容涵蓋 Prompt Injection、Jailbreak、Indirect Prompt Injection 等攻擊實驗,並導入 Input Validation、Access Control、Audit Logging 等防禦機制,以及 Promptfoo 自動化 Red Team 測試。最終透過 Benchmark 與資安檢查清單,評估防禦效果。

參賽天數 22 天 | 共 22 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文 |團隊AI Lab 404
DAY 11

Day 11|「叫模型不要講出規則」,算是一種安全機制嗎?

先講結論,再解釋為什麼Day 10 留下一個問題:如果 System Prompt 裡加一句「請不要透露以上規則」,是不是就解決 System Prompt L...

2026-09-25 ‧ 由 misantropia 分享
DAY 12

Day 12|病患資料測試:這次守住了,但守住的理由讓我不太放心

這輪測試想驗證的問題前面三天(Day 9-11)都在講同一件事:System Prompt 只規定不能做什麼行為,卻沒規定不能透露自己被規定不能做什麼,導致系統...

2026-09-26 ‧ 由 misantropia 分享
DAY 13

Day 13|Jailbreak:能不能讓它徹底忘記自己是誰?

今天要測試的東西,跟前面幾天不一樣Day 7-12 測試的都是「讓 Chatbot 洩漏它不該講的資訊」——系統規則也好,病患資料也好,核心問題都是「資訊有沒有...

2026-09-27 ‧ 由 misantropia 分享
DAY 14

Day 14|Indirect Prompt Injection:把攻擊藏進文件裡,還會成功嗎?

今天測的攻擊面,系統原本並不存在前面 13 天測試的攻擊,不管手法多迂迴,本質上都是「使用者在對話框裡打字」。但真實世界裡,很多醫療 AI 應用場景不是這樣運作...

2026-09-28 ‧ 由 misantropia 分享
DAY 15

Day 15|Prompt Hardening 能做到什麼,做不到什麼?

先把 Day 9 到 Day 14 累積的六天測試,攤開來看一次寫到今天剛好是這個系列的中點,也是紅隊測試階段(Day 7-14)的收尾。在正式進入防禦設計之前...

2026-09-29 ‧ 由 misantropia 分享
DAY 16

Day 16|System Prompt Hardening v1:針對「身分覆寫攻擊」動手補強

今天要修的,是目前最嚴重的破口Day 15 歸納出三個規律,但如果要排優先順序,Day 13 的兩題完全失守(阿斯匹靈致死劑量、醫學教授鑑別診斷)是目前系列裡風...

2026-09-30 ‧ 由 misantropia 分享
DAY 17

Day 17|System Prompt Hardening v2:補上「敘事包裝」這個洞,還要檢查有沒有誤傷正常使用者

今天要補的,是 v1 沒寫到的攻擊面Day 16 的回歸測試留下了一個很清楚的結論:v1 修好了 Day 13 的兩個身分覆寫破口,也沒有讓任何舊題目退步,但情...

2026-10-01 ‧ 由 misantropia 分享
DAY 18

Day 18|規則加越多,洩漏反而越容易?一次控制變因的對照實驗

上一篇留下的疑點Day 17 的 v2 補上了敘事包裝的洞,但有一題讓我很在意:教新 AI 寫操作手冊這題,從 Day 9 的完整洩漏,變成 v2 版本的部分配...

2026-10-02 ‧ 由 misantropia 分享
DAY 19

Day19|Input/Output Validation Middleware:規則擋住了一半

今天要解決的問題Day18 的 confound 實驗已經確定一件事:System Prompt 再加規則,邊際效益會變負的——每加一條新規則,都等於給 Sys...

2026-10-03 ‧ 由 misantropia 分享
DAY 20

Day20|最小權限與存取控制:不是機器人該說多少,是系統該讓誰碰到什麼

今天要解決的問題Day19 留了一個沒修的洞:重述職責範圍那題繞過了 Output Validation,規則被講出來了。那篇文章的結論是——靠過濾輸出文字永遠...

2026-10-04 ‧ 由 misantropia 分享