iT邦幫忙

2026 iThome 鐵人賽

DAY 28
0
AI Security

《30 天從零打造資安語言模型:從微調到 Agent 落地》系列 第 28 篇

Day 28|人審閘道不是限制,是設計

  • 分享至 

  • xImage
  •  

回到那句定調句

從 Day 2 到現在,這句話出現過很多次:

初稿必經人工審核,這是設計,不是限制。

今天要完整論證它,並且回答一個我被問過很多次的問題:那什麼時候可以拿掉?

三個層次的理由

第一層:責任歸屬

這些文件會影響客戶的決策——停不停機、通不通報、買不買設備。當決策出錯,必須有一個具名的人為它負責。

而 AI 無法承擔責任。 這不是能力問題,是結構問題。責任需要一個可被追究、可被究責、有執業身分的主體。

所以問題不是「AI 夠不夠準」,而是「誰簽名」。只要輸出需要有人簽名,就需要有人看過。

第二層:專業信任與商業模式

MSSP 賣的是專業判斷。這是它的定價基礎。

如果客戶知道報告是全自動產生、沒有人看過,那這個服務就從「專業服務」變成「軟體訂閱」,定價會塌一個量級。

人審不只是品質控制,它是這個服務之所以值那個價的原因。

我看過一種說法:「等 AI 夠好了,就能全自動,成本降到零,利潤最大化。」

這個推論有問題。如果服務可以全自動,客戶為什麼要透過你? 他可以自己買同樣的工具。MSSP 的護城河從來不是工具,是那些會看、會判斷、會承擔的人。

AI 讓這些人的產能變成三倍,這是好生意。AI 把這些人拿掉,那是把自己的護城河填了。

第三層:回饋迴路

Day 19 講過:人審是這個系統唯一的學習來源。

沒有審核就沒有修改紀錄,沒有修改紀錄就沒有六類修改分類,沒有分類就沒有改進方向,也沒有訓練資料。

一個拿掉人審的系統,會停止進步。 它會停在拿掉的那一天的水準,然後隨著環境變化慢慢劣化,而且沒有人會發現。

那到底什麼可以放行?

論證完了為什麼要保留,現在講什麼可以動。

我的立場不是「永遠所有東西都要人審」,而是「放行必須按風險分級,而且有些格子永遠不放行」。

分級的兩個維度:輸出的影響力 × 內容的確定性。

高確定性 低確定性
低影響力 🟢 可考慮自動放行 🟡 抽樣審核
高影響力 🟡 快速審核 🔴 完整審核,永不放行

對應到實際的東西:

🟢 低影響力 × 高確定性 — 可考慮自動放行

  • 月報中純統計數字的部分(數字是程式算的,敘述是模板化的)
  • 新人訓練的批改回饋(解析在出題時已審核過,批改只是取用)
  • 內部使用的摘要與索引

🟡 中間地帶 — 抽樣或快速審核

  • 顧問問答的快路徑(歷史回答已核可,但要確認時效與脈絡)
  • 低嚴重性事件的報告
  • 月報的趨勢敘述段落

🔴 高影響力 × 低確定性 — 永不放行

  • 任何高嚴重性事件的報告
  • 任何涉及法規合規的回覆
  • 任何建議客戶採取重大行動的內容(停機、隔離、通報主管機關)
  • 任何跨客戶或涉及第三方的內容

那條紅線的判準

紅色格子的共同特徵是什麼?我用三個問題判斷:

  1. 這個輸出如果錯了,會不會造成不可逆的後果?(停機、通報、資料外洩)
  2. 這個錯誤有沒有人會在後續流程中發現?(如果沒有下一道防線,就不能放行)
  3. 這個內容有沒有專業或法律上的效力?(合規回覆有,內部摘要沒有)

任一為是,就是紅色。

這三個問題跟 Day 26 的缺陷分級是同一套邏輯——看的是「防線還在不在」,不是「看起來多嚴重」。

放行的路線圖

實際要放行一個格子,我的順序是:

階段一:影子模式。 系統照常產出,人照常審核,但同時記錄「如果自動放行會發生什麼」。累積足夠樣本後,統計自動放行的話會有多少次錯誤逃逸。

階段二:抽樣審核。 從全審改成抽樣(例如 30%),但抽樣結果持續監測。如果抽樣發現的錯誤率上升,退回全審。

階段三:條件式自動放行。 只在滿足明確條件時自動放行(例如:嚴重性為低、且事實回溯率 100%、且無降級標記)。不滿足條件的仍走全審。

階段四:定期複審。 即使自動放行,仍定期抽樣回頭檢查。這一階段永遠不會結束。

注意這四個階段沒有「完全不審」的終點。 最終狀態是「大部分自動放行,但持續抽樣監測」,不是「不看了」。

一個我要提醒的心理陷阱

Day 19 提過自動化偏誤,這裡再說一次,因為它在放行的過程中最危險。

當審核者連續看到一百份都沒問題的初稿,第一百零一份他會看得比第一份草率。

這是人的天性,不是失職。而它的後果是:你的人審閘道會在你不知不覺中失效,即使制度上它還在。

我的三個對策:

  1. 在初稿中主動標示不確定的部分(Day 17 的「待補充」、Day 16 的信心標記)——把審核者的注意力導向該看的地方
  2. 在介面中顯示來源(Day 19 的「此回答來自 QA-XXXX」)——讓審核者知道這不是新產生的
  3. 定期插入已知有問題的樣本——測的不是系統,是審核流程本身還有沒有在運作

第三項有點爭議,因為它等於在測試自己的同事。我的做法是公開這件事——事先告知會有這樣的機制,說明它測的是流程不是人,而且結果只看整體不看個人。

明天講整個系列的收斂:模型可換,治理不變。


🛡️Instagram: @aid3fend — AI 資安實戰紀錄,歡迎追蹤交流。



上一篇
Day 27|Prompt Injection 測試守則:能測什麼、不能測什麼
下一篇
Day 29|模型可換,治理不變
系列文
《30 天從零打造資安語言模型:從微調到 Agent 落地》 共 29 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言