金融法務部門是機構內個資密度最高的單位——契約、判決書、客訴信裡不只有身分證字號,還有大量第 6 條特種個資。當這些文件要交給 LLM 處理,「不能外洩」就從原則變成架構問題。
這 30 天會完整走一遍 LLM 個資防護閘的設計:PII 偵測的規則層與語意層、去識別化三種手法的取捨(只有一種可逆)、Token Vault 的隔離與可控還原、OCR 與非結構化文件的處理,最後用紅隊驗證整套架構。
一個很容易被排在最後面的部門 當一家金融機構開始導入 LLM,優先順序通常長這樣:客服(有明確 KPI)、行銷(有明確產出)、程式開發(工程師自己就會偷用)。法...
先畫圖,再選工具 我看過不少 AI 資料防護的提案,第一頁就是產品架構圖:左邊一個 Guardrail 方塊、右邊一個 LLM 方塊,中間一條箭頭。這種圖的問題...
一個常見的誤判 當我跟金融機構討論 LLM 資料防護時,最常被問的第一個問題是:「你們怎麼防止駭客從 ChatGPT 那邊把我們的資料撈出來?」 這個問題的預設...
個資不是一個型別,是一個光譜 很多團隊做 PII 偵測的第一步是打開文件、開始寫 regex。這會做出一個看起來能動、但不知道自己漏了什麼的系統。 正確的第一步...
先承認規則式的價值 在講它的問題之前先說清楚:規則式偵測不能不做。 它快、可解釋、可稽核、不需要 GPU、結果穩定可重現。對於格式明確的直接識別碼,它的精確度比...
為什麼要自己訓模型 昨天列出的三個天花板——無格式識別碼、敘述性特種個資、人名——共同點是它們需要理解上下文。這是 NER(Named Entity Recog...
內建 infoType 的覆蓋範圍 Google Cloud 的 Sensitive Data Protection(原名 Cloud DLP)內建了大量 in...
一個資安場景特有的不對稱 機器學習的標準做法是看 F1 score,也就是 Precision 跟 Recall 的調和平均。這個指標的前提是兩種錯誤同等重要。...
三種手法的本質差別 偵測完之後,要決定怎麼處理。三種主要手法: 遮罩(Masking/Redaction) A123456789 → **********...
從一個實際問題開始 昨天說 Token 要「同型替換」。但為什麼?直接用一個隨機 UUID 當 Token 不是更安全嗎? A123456789 → 550...