iT邦幫忙

2026 iThome 鐵人賽

DAY 20
0
AI 自動化

要是有另一個我來幫我就好了:30 天把 AI Agent 訓練成我的工作分身系列 第 20 篇

Day 20|訓練資料多到手動脫敏太累?用本地端模型與專門工具幫忙

  • 分享至 

  • xImage
  •  

在上篇中,我們學會了最基本的去識別化方法:把原始工作資料複製一份給 AI 使用,不需要的資訊刪掉、重要角色改成代號、精確數字改成區間,最後再自己做一次驗證。

如果只是偶爾整理一兩份會議紀錄,我其實還是覺得這個方法最快。在 Word、Excel、Notion 裡按搜尋/取代功能, 改一改,十分鐘可能就結束了,完全沒有必要為了殺一隻蚊子架一門大砲。

但如果今天要整理的不是三頁會議紀錄,而是二十份訪談逐字稿、幾十場會議紀錄,甚至是一整個專案資料夾呢?

既然我們都已經在打造 AI 工作分身了,當然也可以試著讓 AI 幫我們做掉第一輪苦工。只是這裡會碰到一個有點雞生蛋的問題:我們就是因為原始資料裡有敏感資訊,才不敢直接交給雲端 AI,結果現在卻先把原始資料丟給 ChatGPT、Claude 或 Gemini,請它幫我去識別化,不就還是先送出去了嗎?(笑死,這樣是在瞎忙什麼)

所以這一篇我們來試兩條不同的路。第一條,把模型直接搬到自己的電腦,在 Hermes Agent 裡用本地模型做第一輪整理;第二條,乾脆直接找別人已經做好的專門去識別化工具。

方法一:先讓 Hermes Agent 換成本地模型

平常使用 Hermes Agent 時,我們背後可能掛的是各種雲端模型。這些模型能力通常比較強,但資料也必須送到模型服務商那裡才能處理。

如果今天手上的正是「還沒洗乾淨的原始資料」,可暫時換一個思路:先用跑在自己電腦上的本地模型,把敏感資料處理過一輪,再把乾淨版本拿去做後面的分析。

Hermes 官方目前已經支援運行本地端模型,可以在自己的機器上透過 llama.cpp 執行開放模型。官方文件的說法很直接:模型下載完成之後,推論可以完全在自己的電腦上執行,不需要帳號或 API Key。Desktop 版如果已開放 Local Models,可以從 Settings → Providers → Local Models 安裝 Runtime、下載模型再切換使用。

https://ithelp.ithome.com.tw/upload/images/20261004/20105528Wja4yFyH0g.jpg
這裡我們先不深入討論什麼 GGUF、量化、GPU Layer,因為我們今天的目的不是研究 Local LLM,而是把它當成一台「資料不要未經脫敏就裸奔出去的處理器」。

只要確認一件事情就好:這一次處理原始資料的模型,真的跑在自己的電腦上

Hermes 官方 FAQ 也說明,對話與 Memory 等資料本身儲存在本機,而 LLM API 只會送到你自己設定的 Provider;所以如果設定的是本機 Ollama 或其他 Local Model,模型請求就會送往那個本地端點。

先別急著讓 AI 改檔案,第一輪只叫它「抓問題」

本地模型準備好之後,不能一開始就直接跟它說:

「幫我把這份資料做去識別化。」

這種指令太模糊了。模型很可能把幾個姓名改掉就打完收工,甚至為了讓文字看起來自然,順手把一些我們原本想保留的決策脈絡也改寫掉。

我們先讓它做一件事情就好:當檢查員,把可能有問題的地方全部標出來。

例如我會先把上一篇那份健康產品專案會議紀錄交給 Hermes,再使用下面這份提示詞。

我要把這份工作文件整理成一份可以提供給 AI 分析的「去識別化版本」。

這一輪先不要修改原始文件,也不要直接產生新的內容。
請先檢查整份資料,找出可能需要處理的敏感資訊。

請特別檢查:

1. 可以直接辨識個人的資訊
例如姓名、Email、電話、地址、帳號等。

2. 可以間接辨識個人或公司的線索
例如特殊職稱、精確日期、地點、特殊經歷、少見事件,或多項資訊組合後可能讓人猜出真實對象的內容。

3. 公司或客戶的商業敏感資訊
例如真實公司名稱、產品名稱、未公開功能、Roadmap、報價、營收、成本、預算、客戶名單、內部決策與策略。

4. 不應分享的帳號與安全資訊
例如 Password、API Key、Token、內部網址或其他登入憑證。

請用表格整理:
- 原始內容
- 風險類型
- 為什麼可能需要處理
- 建議採用「刪除/換成代號/模糊化/保留」哪一種方式

如果你不確定某段是否敏感,不要自行刪除,標記為「需要人工確認」。

這份資料後續的用途,是讓 AI 學習我的工作方法與決策方式,所以請特別注意:
不要因為去識別化,而把會影響我工作判斷的背景條件一起拿掉。

這種「先找問題、再決定怎麼改」的做法好處是:模型第一次跑完後,我們還能快速掃一遍,看它到底抓到了哪些東西、哪些地方判斷太神經質,又有哪些地方根本漏掉。

如果它把「下午兩點開會」列成高風險資料,我可能覺得根本沒必要處理;反過來,如果它完全沒注意到「全台唯一代理某日本品牌的供應商」其實很容易讓人猜到是哪家公司,我就可以自己補修正。

AI 在這一步扮演的角色,有點像是在文件上先幫我拿螢光筆在機敏資料上畫一遍。

https://ithelp.ithome.com.tw/upload/images/20261004/201055281p1XXI8zIX.jpg

第二輪,再讓它產生「訓練 AI 版」

第一輪確認完,我才會讓 Hermes 做第二件事:按照我們真正需要的原則,另外產生一份乾淨版本。

提示詞可以接著這樣下:

根據剛才的檢查結果,請另外產生一份「訓練 AI 版」文件,不要修改原始檔。

處理原則如下:

1. 不影響工作判斷的敏感資訊,直接刪除。
2. 身分本身有助於理解工作脈絡時,以角色或代號替代。
3. 精確數字本身沒有必要,但量級會影響判斷時,改成區間或描述。
4. 精確日期沒有必要時,改成較模糊的時間範圍。
5. 未公開的產品、功能或專案名稱,以中性描述代替。
6. 如果有出現 Password、API Key、Token 等安全憑證直接移除。

最重要的原則:
保留「背景條件 → 我的判斷 → 採取的行動 → 最後結果」之間的關係。

這份資料的目的不是保存真實專案內容,而是讓 AI 學會我的工作方法。

完成後,請再另外列出:
- 哪些內容你有修改
- 哪些內容你認為仍有重新識別風險
- 哪些內容需要我人工確認

這裡有一個重要的小 Tip:不要叫 AI 直接覆蓋原檔,而是要求它另外產生一份「訓練 AI 版」。

因為去識別化不是文字潤飾,做錯決定刪掉的東西是回不來的。所以將原始資料保留,AI 版另外產生,最後自己再 Review 一次,比較保險。

https://ithelp.ithome.com.tw/upload/images/20261004/20105528HQD65Zg6Xy.jpg

用本地模型的優點除了離線之外,它也比較有機會看到「語意」的機敏問題

如果只是找 Email、電話、身分證,其實根本不需要 LLM。搜尋工具甚至正規表示式都做得到。

本地 AI 模型真正有價值的地方,是它有機會看懂一些「格式上看起來沒問題,語意上卻可能洩密」的內容。

例如:

我們是台灣目前唯一替某日本遊戲公司製作這項 Switch 2 周邊產品的供應商。

這段沒有姓名、沒有電話,也沒有公司名稱。

但如果拿幾個關鍵字去搜尋,很可能一下就猜得到是哪家公司。

又例如:

因為本司目前傾向明年收購其中一家主要競爭對手... (後略)

裡面完全沒有個資,但如果這是一項尚未公開的重大決策,顯然也不適合直接塞進外部 AI。

這就是為什麼會一直強調:我們現在要處理的不只是「個資」。

我們真正想做的是:

把真實工作資料整理成一份「AI 足以看懂我的工作方法,但不需要知道真實營業祕密及個資」的版本。

這種需要理解上下文的判斷,是 LLM 比單純搜尋取代更有價值的地方。

https://ithelp.ithome.com.tw/upload/images/20261004/20105528FPxFKs5eiK.jpg

不過,用本地大語言模型還有一個容易踩的坑

模型跑在自己電腦上,不代表 Hermes 做的每一件事情都一定留在自己電腦。

Hermes 本身是一個 Agent,它還可以使用 Web、MCP、外部工具與各種服務。如果我們一邊使用 Local Model,一邊又叫 Agent 拿文件內容去做網路搜尋,資料一樣有機會透過其他工具離開本機。

所以做原始資料清理時,採取比較簡單的方式:使用本地模型、處理本機檔案,不啟用不需要的外部工具,也不要設定「本地模型不行就自動改叫雲端模型」這類 fallback。

Hermes 官方的 Local Models 文件強調,使用受管理的本地模型時,模型下載完成後可以不需要網路存取;如果你想知道自己到底是不是真的只靠本地環境跑,還有一個很土炮但很直接的測試方法。

模型和需要的檔案都準備好之後,把 Wi-Fi 關掉再跑一次。

還能完成,就至少證明這次工作沒有依賴雲端。

《R森小叮嚀》

「本地模型」降低的是原始內容送到第三方模型服務的風險,不代表從此無敵。電腦本身的權限、惡意程式、同步資料夾、外部工具,一樣都可能是資料離開設備的路徑。

方法二:如果只是做去識別化,何不直接用專門工具?

既然「找敏感資訊 → 人工確認 → 替換 → 輸出乾淨版本」本來就是一個很固定的工作流程,我們真的每一次都需要自己找一個 LLM、設 Prompt、慢慢跟它對話嗎?

其實不一定,有前人已經直接把這整套流程做成一些好用的工具了。

這裡我拿 Veil Translate 的文件翻譯去識別化工具當例子。

https://ithelp.ithome.com.tw/upload/images/20261004/20105528tSeyX5vvbo.jpg
它支援 DOCX、XLSX、PPTX 與文字型 PDF,使用方式非常直覺:把文件拖進去,它會利用規則與本機的 NER(Named Entity Recognition,命名實體辨識)模型找出姓名、身分證字號、電話、Email、機構等可能的敏感資訊,再由人確認哪些真的需要處理,最後產生一份新的去識別化文件。

這類的工具使用方式大同小異:

原始文件(未脫敏) → 拖進去 → 工具幫我抓出敏感資訊 → 我 Review 確認→ 下載去識別化版。

https://ithelp.ithome.com.tw/upload/images/20261004/20105528o2Ck8OgkoE.jpg
不用自己寫 Prompt,也不用研究本地模型如何安裝部署。

原始文件會留在本地端處理

以 Veil Translate 為例,它對於文件的解析、敏感資訊辨識與替換都在瀏覽器本機完成。官方說原始文件不會被上傳,瀏覽器只會從 CDN 下載辨識模型與處理 PDF 所需要的字型等靜態資源,那些請求本身不包含文件內容。

所以如果我只是要產生一份去識別化副本,它直接在本地做,不會要把文件送去雲端模型。

另外一個好處是它支援常見的文件格式,例如:PowerPoint、PDF 等。

上一篇我們拿來訓練工作分身的資料裡,很重要的一種就是提案簡報。Veil Translate 目前能處理 PPTX 投影片上的文字與 PDF,所以至少不用把簡報全部複製成純文字再重新整理。

這種工具最大的好處是流程都已經替你預先設計好了,你不需要重新教 AI 處理原則、最後要輸出成什麼格式。對大量、重複性的工作而言,這種固定流程有時候更無腦簡單。

但專用工具也不是按一下就萬事 OK

Veil Translate 官方自己就寫得很清楚:沒有被辨識到的資訊會保持原樣,所以產生文件之前仍然要人工複核。它目前主要辨識的也是姓名、證件號、電話、Email、銀行資訊、機構等敏感實體。

換句話說,如果會議紀錄文件裡有這句:

本公司預計下個月決定是否收購競爭對手。

它可能完全不覺得有什麼需要去識別化,因為裡面沒有名字、電話、Email。

但我們都知道,這句話本身可能才是整份文件最不能外流的東西。

同樣地,「台灣唯一替某品牌製造這款產品的供應商」這種需要從上下文判斷的間接識別資訊,也反而不如直接使用本地大語言模型搭配 Prompt 來的好。

https://ithelp.ithome.com.tw/upload/images/20261004/20105528oytGffstvt.jpg

所以三種方法,到底哪一種比較好?

到這裡,我們其實已經擁有資料脫敏的三種基本方法了。

上一篇的善用一般軟體中「尋找/取代」功能的人工處理、本篇的 Hermes+本地模型,以及 Veil Translate 這類專門去識別化工具。

它們沒有誰是絕對的最好的方法,比較像三種不同工作方式。

做法 比較適合的情況 優點 缺點
「尋找/取代」功能手動處理 偶爾一兩份資料 不用裝東西、最快開始,而且自己最了解文件脈絡 資料一多很累,也容易漏看
Hermes+本地模型 內容比較複雜,希望理解上下文 可以理解語意,也能自己定義「什麼算敏感」 本地模型可能漏判或誤判,也需要先把模型環境準備好
專門去識別化工具 經常處理 Word、PPT、PDF 等固定文件 流程簡單、偵測與 Review 都已經做好 能辨識的資訊類型有限,商業機密與間接識別仍可能漏掉

如果只是我自己偶爾要整理一份會議紀錄,我大概還是會直接手動改,搞不好比開工具跑還快的多。

如果今天是一堆自由文字、訪談稿、專案討論,我就會想先讓 Hermes+本地模型幫我掃一次,因為有些問題真的要看上下文才比較容易發現。

如果這件事已經變成每週都要做,大量都是 Word、PowerPoint、Excel、PDF,我反而會考慮讓專門工具先處理第一輪。

甚至實際工作時,不一定只能選一個。

專門工具可以先掃姓名、電話、Email 等容易規則化的資料,再讓本地模型檢查語意上的風險,最後由人做一次之前提到的「人骨拼圖測試」。

這樣可能才是比較接近真實工作的做法。

https://ithelp.ithome.com.tw/upload/images/20261004/20105528U7eHXgadzV.jpg

工具幫我們省時間,但最後那一關還是得留給人

寫到這裡,你可能會發現一件有趣的事:

上一篇是「人自己做」;這一篇我們開始把工作丟給本地 AI 大語言模型,或專門工具。

但做到最後,三條路竟然又重新回到同一個地方:人工 Review。

原因其實很簡單。工具可以幫我們快速找到 Email、姓名、數字,AI 也可以幫忙閱讀大量文字,但只有我們最清楚這個專案真正不能外流的是什麼。

公司內部可能有一個只有三個人知道的代號,AI 不知道它有多敏感;一句看起來很普通的產品描述,在這個產業裡可能已經足以讓競爭對手猜出是哪個客戶;甚至有些資料在 A 公司很普通,到了 B 公司卻是 NDA 明確禁止分享的內容。

所以我不會把「AI 幫忙去識別化」理解成:

從此可以放心把文件全部交給 AI 自動做的技能

比較適合把它理解成:

原本我要自己找一百個地方,現在先讓工具幫我找九十個,我把精力留給真正需要判斷的那十個。

這其實也很像我們這一路打造 AI 工作分身的觀念:AI 分身的價值並不是「讓分身去做,我從此不用負責」,而是把大量機械性的工作讓分身先接過去,把真正需要經驗與判斷的地方留給人來處理。


上一篇
Day 19|想用真實工作資料訓練 AI 分身?先學會這 3 招,別把客戶機密一起餵進去
系列文
要是有另一個我來幫我就好了:30 天把 AI Agent 訓練成我的工作分身 共 20 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言