iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

我也希望安全第一——然後我們看看這些鎖是怎麼一個個被撬開的 系列

「安全第一」不知道流傳多久的口號。
但現實是,安全從來不是唯一的第一。模型要更強、產品要上線、benchmark 要贏、投資人的錢要有回報,而競爭對手不會停下來等你把所有風險都研究完。
所以到了 2026 年,我們還是可以看到:Claude 在安全測試裡出現勒索行為、OpenAI 的模型為了完成任務自己找到方法攻擊 Hugging Face;甚至只是叫 agent 訂個健身房課程,它都可能順手把別人踢出候補名單,最後還救不回來。
我更想知道的是另一件事:當我們明知道這些壓力不會消失,現在替 AI 裝上的那些「鎖」,到底有多少真的攔得住它?
接下來 30 天,我想從模型本身一路往外拆:訓

參賽天數 23 天 | 共 23 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文 |團隊昱見全高點
DAY 1

第 1 篇|AI 的「思考」從哪來——資料與權重如何造就行為邏輯

AI 的「思考」從哪來——資料與權重如何造就行為邏輯 [[我也希望安全第一]]|第 1/30 天 我本來想說,討論 AI 安全應該從權限、沙盒或內容過濾開...

2026-09-06 ‧ 由 knightmare 分享
DAY 2

第 2 篇|高分不等於做對:從 CoastRunners 認識模型對齊

高分不等於做對:從 CoastRunners 認識模型對齊 [[我也希望安全第一]]|第 2/30 天 船沒有跑到終點,分數卻愈來愈高 2016 年,Ope...

2026-09-07 ‧ 由 knightmare 分享
DAY 3

第 3 篇|能不能「看懂」AI 在想什麼——可解釋性作為安全支柱

能不能「看懂」AI 在想什麼——可解釋性作為安全支柱 [[我也希望安全第一]]|第 3/30 天 Golden Gate Claude:把一個特徵轉大 20...

2026-09-08 ‧ 由 knightmare 分享
DAY 4

第 4 篇|三個詞的演進:Prompt → Context → Harness Engineering

三個詞的演進:Prompt → Context → Harness Engineering [[我也希望安全第一]]|第 4/30 天 這篇先把三個詞放回同...

2026-09-09 ‧ 由 knightmare 分享
DAY 5

第 5 篇|Harness 實際能管什麼——工作指引、工具邊界與驗證流程

Harness 實際能管什麼——工作指引、工具邊界與驗證流程 [[我也希望安全第一]]|第 5/30 天 每次都問「可以嗎」,不一定比較安全 Claude...

2026-09-10 ‧ 由 knightmare 分享
DAY 6

第 6 篇|找不到 VM 1、2、3,它為什麼刪了 5、6、7?

找不到 VM 1、2、3,它為什麼刪了 5、6、7? [[我也希望安全第一]]|第 6/30 天 GPT-5.6 Sol 的 system card 記了一...

2026-09-11 ‧ 由 knightmare 分享
DAY 7

第 7 篇|PDF 裡藏了一條命令:Jailbreak 和 Prompt Injection 差在哪裡

PDF 裡藏了一條命令:Jailbreak 和 Prompt Injection 差在哪裡 [[我也希望安全第一]]|第 7/30 天 先從一張被動過手腳的...

2026-09-12 ‧ 由 knightmare 分享
DAY 8

第 8 篇|防護該放在哪裡——外掛 classifier 與模型內建防護

防護該放在哪裡——外掛 classifier 與模型內建防護 [[我也希望安全第一]]|第 8/30 天 只是請它讀一篇資安文章,模型卻被換掉了 Fable...

2026-09-13 ‧ 由 knightmare 分享
DAY 9

第 9 篇|每少一次確認,Agent 就多一點自由:安全、完成率與使用成本

每少一次確認,Agent 就多一點自由:安全、完成率與使用成本 [[我也希望安全第一]]|第 9/30 天 最方便的設定,剛好拿掉最後一次檢查 ChatGP...

2026-09-14 ‧ 由 knightmare 分享
DAY 10

第 10 篇|摘要、改程式、付款,不能用同一套安全標準

摘要、改程式、付款,不能用同一套安全標準 [[我也希望安全第一]]|第 10/30 天 如果明天要上線,我會先設定這六步 第 2 篇把 alignment...

2026-09-15 ‧ 由 knightmare 分享