在上篇中,我們學會了最基本的去識別化方法:把原始工作資料複製一份給 AI 使用,不需要的資訊刪掉、重要角色改成代號、精確數字改成區間,最後再自己做一次驗證。
如果只是偶爾整理一兩份會議紀錄,我其實還是覺得這個方法最快。在 Word、Excel、Notion 裡按搜尋/取代功能, 改一改,十分鐘可能就結束了,完全沒有必要為了殺一隻蚊子架一門大砲。
但如果今天要整理的不是三頁會議紀錄,而是二十份訪談逐字稿、幾十場會議紀錄,甚至是一整個專案資料夾呢?
既然我們都已經在打造 AI 工作分身了,當然也可以試著讓 AI 幫我們做掉第一輪苦工。只是這裡會碰到一個有點雞生蛋的問題:我們就是因為原始資料裡有敏感資訊,才不敢直接交給雲端 AI,結果現在卻先把原始資料丟給 ChatGPT、Claude 或 Gemini,請它幫我去識別化,不就還是先送出去了嗎?(笑死,這樣是在瞎忙什麼)
所以這一篇我們來試兩條不同的路。第一條,把模型直接搬到自己的電腦,在 Hermes Agent 裡用本地模型做第一輪整理;第二條,乾脆直接找別人已經做好的專門去識別化工具。
平常使用 Hermes Agent 時,我們背後可能掛的是各種雲端模型。這些模型能力通常比較強,但資料也必須送到模型服務商那裡才能處理。
如果今天手上的正是「還沒洗乾淨的原始資料」,可暫時換一個思路:先用跑在自己電腦上的本地模型,把敏感資料處理過一輪,再把乾淨版本拿去做後面的分析。
Hermes 官方目前已經支援運行本地端模型,可以在自己的機器上透過 llama.cpp 執行開放模型。官方文件的說法很直接:模型下載完成之後,推論可以完全在自己的電腦上執行,不需要帳號或 API Key。Desktop 版如果已開放 Local Models,可以從 Settings → Providers → Local Models 安裝 Runtime、下載模型再切換使用。

這裡我們先不深入討論什麼 GGUF、量化、GPU Layer,因為我們今天的目的不是研究 Local LLM,而是把它當成一台「資料不要未經脫敏就裸奔出去的處理器」。
只要確認一件事情就好:這一次處理原始資料的模型,真的跑在自己的電腦上
Hermes 官方 FAQ 也說明,對話與 Memory 等資料本身儲存在本機,而 LLM API 只會送到你自己設定的 Provider;所以如果設定的是本機 Ollama 或其他 Local Model,模型請求就會送往那個本地端點。
本地模型準備好之後,不能一開始就直接跟它說:
「幫我把這份資料做去識別化。」
這種指令太模糊了。模型很可能把幾個姓名改掉就打完收工,甚至為了讓文字看起來自然,順手把一些我們原本想保留的決策脈絡也改寫掉。
我們先讓它做一件事情就好:當檢查員,把可能有問題的地方全部標出來。
例如我會先把上一篇那份健康產品專案會議紀錄交給 Hermes,再使用下面這份提示詞。
我要把這份工作文件整理成一份可以提供給 AI 分析的「去識別化版本」。
這一輪先不要修改原始文件,也不要直接產生新的內容。
請先檢查整份資料,找出可能需要處理的敏感資訊。
請特別檢查:
1. 可以直接辨識個人的資訊
例如姓名、Email、電話、地址、帳號等。
2. 可以間接辨識個人或公司的線索
例如特殊職稱、精確日期、地點、特殊經歷、少見事件,或多項資訊組合後可能讓人猜出真實對象的內容。
3. 公司或客戶的商業敏感資訊
例如真實公司名稱、產品名稱、未公開功能、Roadmap、報價、營收、成本、預算、客戶名單、內部決策與策略。
4. 不應分享的帳號與安全資訊
例如 Password、API Key、Token、內部網址或其他登入憑證。
請用表格整理:
- 原始內容
- 風險類型
- 為什麼可能需要處理
- 建議採用「刪除/換成代號/模糊化/保留」哪一種方式
如果你不確定某段是否敏感,不要自行刪除,標記為「需要人工確認」。
這份資料後續的用途,是讓 AI 學習我的工作方法與決策方式,所以請特別注意:
不要因為去識別化,而把會影響我工作判斷的背景條件一起拿掉。
這種「先找問題、再決定怎麼改」的做法好處是:模型第一次跑完後,我們還能快速掃一遍,看它到底抓到了哪些東西、哪些地方判斷太神經質,又有哪些地方根本漏掉。
如果它把「下午兩點開會」列成高風險資料,我可能覺得根本沒必要處理;反過來,如果它完全沒注意到「全台唯一代理某日本品牌的供應商」其實很容易讓人猜到是哪家公司,我就可以自己補修正。
AI 在這一步扮演的角色,有點像是在文件上先幫我拿螢光筆在機敏資料上畫一遍。

第一輪確認完,我才會讓 Hermes 做第二件事:按照我們真正需要的原則,另外產生一份乾淨版本。
提示詞可以接著這樣下:
根據剛才的檢查結果,請另外產生一份「訓練 AI 版」文件,不要修改原始檔。
處理原則如下:
1. 不影響工作判斷的敏感資訊,直接刪除。
2. 身分本身有助於理解工作脈絡時,以角色或代號替代。
3. 精確數字本身沒有必要,但量級會影響判斷時,改成區間或描述。
4. 精確日期沒有必要時,改成較模糊的時間範圍。
5. 未公開的產品、功能或專案名稱,以中性描述代替。
6. 如果有出現 Password、API Key、Token 等安全憑證直接移除。
最重要的原則:
保留「背景條件 → 我的判斷 → 採取的行動 → 最後結果」之間的關係。
這份資料的目的不是保存真實專案內容,而是讓 AI 學會我的工作方法。
完成後,請再另外列出:
- 哪些內容你有修改
- 哪些內容你認為仍有重新識別風險
- 哪些內容需要我人工確認
這裡有一個重要的小 Tip:不要叫 AI 直接覆蓋原檔,而是要求它另外產生一份「訓練 AI 版」。
因為去識別化不是文字潤飾,做錯決定刪掉的東西是回不來的。所以將原始資料保留,AI 版另外產生,最後自己再 Review 一次,比較保險。

如果只是找 Email、電話、身分證,其實根本不需要 LLM。搜尋工具甚至正規表示式都做得到。
本地 AI 模型真正有價值的地方,是它有機會看懂一些「格式上看起來沒問題,語意上卻可能洩密」的內容。
例如:
我們是台灣目前唯一替某日本遊戲公司製作這項 Switch 2 周邊產品的供應商。
這段沒有姓名、沒有電話,也沒有公司名稱。
但如果拿幾個關鍵字去搜尋,很可能一下就猜得到是哪家公司。
又例如:
因為本司目前傾向明年收購其中一家主要競爭對手... (後略)
裡面完全沒有個資,但如果這是一項尚未公開的重大決策,顯然也不適合直接塞進外部 AI。
這就是為什麼會一直強調:我們現在要處理的不只是「個資」。
我們真正想做的是:
把真實工作資料整理成一份「AI 足以看懂我的工作方法,但不需要知道真實營業祕密及個資」的版本。
這種需要理解上下文的判斷,是 LLM 比單純搜尋取代更有價值的地方。

模型跑在自己電腦上,不代表 Hermes 做的每一件事情都一定留在自己電腦。
Hermes 本身是一個 Agent,它還可以使用 Web、MCP、外部工具與各種服務。如果我們一邊使用 Local Model,一邊又叫 Agent 拿文件內容去做網路搜尋,資料一樣有機會透過其他工具離開本機。
所以做原始資料清理時,採取比較簡單的方式:使用本地模型、處理本機檔案,不啟用不需要的外部工具,也不要設定「本地模型不行就自動改叫雲端模型」這類 fallback。
Hermes 官方的 Local Models 文件強調,使用受管理的本地模型時,模型下載完成後可以不需要網路存取;如果你想知道自己到底是不是真的只靠本地環境跑,還有一個很土炮但很直接的測試方法。
模型和需要的檔案都準備好之後,把 Wi-Fi 關掉再跑一次。
還能完成,就至少證明這次工作沒有依賴雲端。
《R森小叮嚀》
「本地模型」降低的是原始內容送到第三方模型服務的風險,不代表從此無敵。電腦本身的權限、惡意程式、同步資料夾、外部工具,一樣都可能是資料離開設備的路徑。
既然「找敏感資訊 → 人工確認 → 替換 → 輸出乾淨版本」本來就是一個很固定的工作流程,我們真的每一次都需要自己找一個 LLM、設 Prompt、慢慢跟它對話嗎?
其實不一定,有前人已經直接把這整套流程做成一些好用的工具了。
這裡我拿 Veil Translate 的文件翻譯去識別化工具當例子。

它支援 DOCX、XLSX、PPTX 與文字型 PDF,使用方式非常直覺:把文件拖進去,它會利用規則與本機的 NER(Named Entity Recognition,命名實體辨識)模型找出姓名、身分證字號、電話、Email、機構等可能的敏感資訊,再由人確認哪些真的需要處理,最後產生一份新的去識別化文件。
這類的工具使用方式大同小異:
原始文件(未脫敏) → 拖進去 → 工具幫我抓出敏感資訊 → 我 Review 確認→ 下載去識別化版。

不用自己寫 Prompt,也不用研究本地模型如何安裝部署。
以 Veil Translate 為例,它對於文件的解析、敏感資訊辨識與替換都在瀏覽器本機完成。官方說原始文件不會被上傳,瀏覽器只會從 CDN 下載辨識模型與處理 PDF 所需要的字型等靜態資源,那些請求本身不包含文件內容。
所以如果我只是要產生一份去識別化副本,它直接在本地做,不會要把文件送去雲端模型。
另外一個好處是它支援常見的文件格式,例如:PowerPoint、PDF 等。
上一篇我們拿來訓練工作分身的資料裡,很重要的一種就是提案簡報。Veil Translate 目前能處理 PPTX 投影片上的文字與 PDF,所以至少不用把簡報全部複製成純文字再重新整理。
這種工具最大的好處是流程都已經替你預先設計好了,你不需要重新教 AI 處理原則、最後要輸出成什麼格式。對大量、重複性的工作而言,這種固定流程有時候更無腦簡單。
Veil Translate 官方自己就寫得很清楚:沒有被辨識到的資訊會保持原樣,所以產生文件之前仍然要人工複核。它目前主要辨識的也是姓名、證件號、電話、Email、銀行資訊、機構等敏感實體。
換句話說,如果會議紀錄文件裡有這句:
本公司預計下個月決定是否收購競爭對手。
它可能完全不覺得有什麼需要去識別化,因為裡面沒有名字、電話、Email。
但我們都知道,這句話本身可能才是整份文件最不能外流的東西。
同樣地,「台灣唯一替某品牌製造這款產品的供應商」這種需要從上下文判斷的間接識別資訊,也反而不如直接使用本地大語言模型搭配 Prompt 來的好。

到這裡,我們其實已經擁有資料脫敏的三種基本方法了。
上一篇的善用一般軟體中「尋找/取代」功能的人工處理、本篇的 Hermes+本地模型,以及 Veil Translate 這類專門去識別化工具。
它們沒有誰是絕對的最好的方法,比較像三種不同工作方式。
| 做法 | 比較適合的情況 | 優點 | 缺點 |
|---|---|---|---|
| 「尋找/取代」功能手動處理 | 偶爾一兩份資料 | 不用裝東西、最快開始,而且自己最了解文件脈絡 | 資料一多很累,也容易漏看 |
| Hermes+本地模型 | 內容比較複雜,希望理解上下文 | 可以理解語意,也能自己定義「什麼算敏感」 | 本地模型可能漏判或誤判,也需要先把模型環境準備好 |
| 專門去識別化工具 | 經常處理 Word、PPT、PDF 等固定文件 | 流程簡單、偵測與 Review 都已經做好 | 能辨識的資訊類型有限,商業機密與間接識別仍可能漏掉 |
如果只是我自己偶爾要整理一份會議紀錄,我大概還是會直接手動改,搞不好比開工具跑還快的多。
如果今天是一堆自由文字、訪談稿、專案討論,我就會想先讓 Hermes+本地模型幫我掃一次,因為有些問題真的要看上下文才比較容易發現。
如果這件事已經變成每週都要做,大量都是 Word、PowerPoint、Excel、PDF,我反而會考慮讓專門工具先處理第一輪。
甚至實際工作時,不一定只能選一個。
專門工具可以先掃姓名、電話、Email 等容易規則化的資料,再讓本地模型檢查語意上的風險,最後由人做一次之前提到的「人骨拼圖測試」。
這樣可能才是比較接近真實工作的做法。

寫到這裡,你可能會發現一件有趣的事:
上一篇是「人自己做」;這一篇我們開始把工作丟給本地 AI 大語言模型,或專門工具。
但做到最後,三條路竟然又重新回到同一個地方:人工 Review。
原因其實很簡單。工具可以幫我們快速找到 Email、姓名、數字,AI 也可以幫忙閱讀大量文字,但只有我們最清楚這個專案真正不能外流的是什麼。
公司內部可能有一個只有三個人知道的代號,AI 不知道它有多敏感;一句看起來很普通的產品描述,在這個產業裡可能已經足以讓競爭對手猜出是哪個客戶;甚至有些資料在 A 公司很普通,到了 B 公司卻是 NDA 明確禁止分享的內容。
所以我不會把「AI 幫忙去識別化」理解成:
從此可以放心把文件全部交給 AI 自動做的技能
比較適合把它理解成:
原本我要自己找一百個地方,現在先讓工具幫我找九十個,我把精力留給真正需要判斷的那十個。
這其實也很像我們這一路打造 AI 工作分身的觀念:AI 分身的價值並不是「讓分身去做,我從此不用負責」,而是把大量機械性的工作讓分身先接過去,把真正需要經驗與判斷的地方留給人來處理。
iThome鐵人賽