把資料交給 AI,就是把資料送出去。
不管那個服務多大牌、條款寫得多好、宣稱不會拿去訓練——資料離開了你的電腦,這是事實。剩下的都是信任問題,不是技術問題。
對一般人來說,這件事的風險是自己承擔。但在學校、公部門或任何管理他人資料的單位工作,那些資料不是你的——是學生的、是同仁的、是來洽公的民眾的。你不能預設他們同意你把資料交給第三方,要先看單位的規定。
所以這一篇談的不是技術,是責任。
我把手邊的資料分成三類:
這一類我的判斷是:問這份資料如果被公開,會不會有人受影響。會,就當第三類處理。
Day 7 的課程盤點,我把全校的課程資料交給 Gemini 篩選。那張表裡有「授課老師」這一欄。
名字是個資,這點沒有疑問。但我當時判斷這批資料可以交出去,理由是:課表上的授課教師,本來就公開在學校的課程查詢系統上,任何人都查得到誰開什麼課;而我拿它做的課程盤點,也沒有超出這份資料被公開的用途。
所以問題不在「它算不算個資」,而在「這樣用有沒有超出它本來的用途」。如果把一份公開的名單拿去做跟原本無關的事——例如跟其他名單交叉比對——就算每一筆都查得到,也不該做。
反過來,如果因為「有名字」就把這類資料全擋下來,那是另一種錯:過度保守。它不會造成外洩,但會讓你把時間花在本來不必自己做的事情上,而且會讓真正該守的那條線變得模糊——如果什麼都是機密,那就等於什麼都不是機密。
Day 11 我把會議錄音和簽到表交給 Google 的 NotebookLM 做逐字稿。那篇也提醒過,這幾樣都是敏感資料。那為什麼還是送了?
我的依據有兩個:
反過來,如果是不會公開的會議——閉門討論、人事案、還沒定案的事——這兩條都不成立,那就是第三類。
所以同樣是「會議錄音」,有的可以送、有的不行。界線不在資料的種類,在這份資料本來會不會公開、出去之後有沒有人把關。
一、預設不送,要送先問一次。
不是每次都要糾結,而是養成一個一秒鐘的反射動作:這裡面有沒有可以識別到某個人的東西? 沒有就送,有就停下來想。
二、需要測試就用假資料。
這是 Day 19 講過的。有一份格式一樣、內容是假的資料放著,就不會因為方便而拿真的來用。
三、把私人的和工作的分開。
如果你用 AI 工具連接自己的筆記或雲端空間,要注意授權的範圍——有些服務的授權範圍是「整個空間」,不是「某幾份文件」——用之前要看清楚實際的授權設定。
我自己的做法是把要給 AI 讀的內容和不給的分開放,而不是靠自己每次記得選對範圍。能用結構解決的事,不要靠意志力。
這件事是我寫這個系列的時候才具體撞到的。
我做了十幾張配圖,結果沒有一張是真實系統的截圖。
不是我偷懶。是每一張真截圖都會帶出不該公開的東西:
十幾張裡,能照實截的只有終端機的訊息和本機設定檔那幾張,畫面上沒有任何人。後來我連那幾張也改成照實際輸出重建的圖,訊息原文照錄,省掉每張都要判斷一次能不能截、要遮哪裡。
所以我的做法是:把「畫面」和「資料」拆開。 版面照實際的做、邏輯用原本那套程式跑,只把資料換成假的;真的不能重建的(像後台),就照著實際操作畫一張示意圖,並在圖上標明「這不是截圖」。
這件事值得先知道,因為它會改變你對外分享的方式。在公部門工作,我做出來的東西常常不能直接拿出來給人看 —— 不是成果不好,是成果上面沾著別人的資料。
而這正是「要送出去之前先問一次」的延伸:貼一張截圖,就是把畫面上所有東西都送出去,包括你沒注意到的那個角落。
版本控制(我用的是 git,一套會幫你記住「每個檔案在每個時間點長什麼樣」的工具,改壞了可以退回去)的特性是留下歷史:事後刪掉檔案,歷史裡還在。
Day 19 寫過:我專案裡那份真實名冊,六月建立專案時就跟著整個資料夾被收進版控了。
這篇的初稿卻寫成「如果哪天不小心加進版控,名冊就會被記錄進去」,好像這件事還沒發生。原因是幫我記事的 AI,筆記裡還留著更早以前「名冊沒進版控」的舊紀錄,寫稿時照著舊筆記寫了。Day 19 已經查出來的事,到了 Day 27 又被寫回去。
這次一併處理了:讓版控以後不再追蹤這份名冊,檔案留在原地照常用。AI 第一次下的指令看起來成功,回頭確認才發現名冊還在追蹤清單上,重做一次才真的拿掉。六月那份副本還留在歷史裡,要清掉得改寫整個歷史,那是不可逆的操作,我評估之後先不做。發文前也回頭查證過:名冊沒有被送到任何網路上的空間。
這段想說的是:筆記不會自己更新。「我記得是這樣」不算檢查,打開來看才算——不管那份筆記是人寫的還是 AI 寫的。
要記得自己送過什麼。
哪些資料交給過哪個服務、什麼時候、為什麼——這件事最好有紀錄。因為將來如果有人問「這些資料曾經流出去嗎」,「我不記得了」是最糟的答案。
Day 28:行政檔案的真實樣貌——那些讀不開、打開是亂碼、看起來正常但其實有問題的檔案。