iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

我也希望安全第一——然後我們看看這些鎖是怎麼一個個被撬開的 系列

「安全第一」不知道流傳多久的口號。
但現實是,安全從來不是唯一的第一。模型要更強、產品要上線、benchmark 要贏、投資人的錢要有回報,而競爭對手不會停下來等你把所有風險都研究完。
所以到了 2026 年,我們還是可以看到:Claude 在安全測試裡出現勒索行為、OpenAI 的模型為了完成任務自己找到方法攻擊 Hugging Face;甚至只是叫 agent 訂個健身房課程,它都可能順手把別人踢出候補名單,最後還救不回來。
我更想知道的是另一件事:當我們明知道這些壓力不會消失,現在替 AI 裝上的那些「鎖」,到底有多少真的攔得住它?
接下來 30 天,我想從模型本身一路往外拆:訓

參賽天數 23 天 | 共 23 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文 |團隊昱見全高點
DAY 11

第 11 篇|Hugging Face 入侵事件——一次 benchmark 如何越過沙盒

Hugging Face 入侵事件——一次 benchmark 如何越過沙盒 [[我也希望安全第一]]|第 11/30 天 題目只是要它解一道資安題 前兩部...

2026-09-16 ‧ 由 knightmare 分享
DAY 12

第 12 篇|Agent 越界:四個失敗位置

Agent 越界:四個失敗位置 [[我也希望安全第一]]|第 12/30 天 「17 起」有用,但不是答案 截至 2026 年 8 月 27 日,Felon...

2026-09-17 ‧ 由 knightmare 分享
DAY 13

第 13 篇|17,000 個動作,為什麼沒叫醒值班工程師?

17,000 個動作,為什麼沒叫醒值班工程師? [[我也希望安全第一]]|第 13/30 天 先把 17,000 個動作還原成值班畫面 先不重述 Huggi...

2026-09-18 ‧ 由 knightmare 分享
DAY 14

第 14 篇|替高風險 Eval 架一個真正隔離的 Runner

替高風險 Eval 架一個真正隔離的 Runner [[我也希望安全第一]]|第 14/30 天 假設下週要替公司架一個 eval runner 需求看起來...

2026-09-19 ‧ 由 knightmare 分享
DAY 15

第 15 篇|看見異常後怎麼停下來——警示、撤銷權限與 containment plan

看見異常後怎麼停下來——警示、撤銷權限與 containment plan [[我也希望安全第一]]|第 15/30 天 演練從一條外連警示開始 星期三下午...

2026-09-20 ‧ 由 knightmare 分享
DAY 16

第 16 篇|出錯之後為什麼救不回來——rollback、補償操作與不可逆行動

出錯之後為什麼救不回來——rollback、補償操作與不可逆行動 [[我也希望安全第一]]|第 16/30 天 「壞消息,我加不回去了」 一名澳洲使用者請...

2026-09-21 ‧ 由 knightmare 分享
DAY 17

第 17 篇|同一個 Zero-day 能力,既能修補也能攻擊

同一個 Zero-day 能力,既能修補也能攻擊 [[我也希望安全第一]]|第 17/30 天 找到 zero-day 之後,模型站在哪一邊 OpenAI...

2026-09-22 ‧ 由 knightmare 分享
DAY 18

第 18 篇|誰為失控負責——開發者、部署者、使用者與模型供應商

誰為失控負責——開發者、部署者、使用者與模型供應商 [[我也希望安全第一]]|第 18/30 天 模型不能出庭,受害者還是要找得到人 Agent 入侵第三方...

2026-09-23 ‧ 由 knightmare 分享
DAY 19

第 19 篇|訓練資料的版權戰——fair use、盜版取得與逐字重現

訓練資料的版權戰——fair use、盜版取得與逐字重現 [[我也希望安全第一]]|第 19/30 天 「拿來訓練」不是一個單一動作 Anthropic 的...

2026-09-24 ‧ 由 knightmare 分享
DAY 20

第 20 篇|C2PA 驗證成功,不代表內容是真的

C2PA 驗證成功,不代表內容是真的 [[我也希望安全第一]]|第 20/30 天 「這是 AI 做的嗎」其實混了三個問題 看到一張可疑圖片時,我們常問它是...

2026-09-25 ‧ 由 knightmare 分享