你買了企業版,合約上寫明不拿你的資料訓練。這句話解決的是資料流出的其中一種面向。另外還有四種,你需要自己判斷。
Day 14 講的是人繞過公司,把東西貼進不該貼的地方。今天繼續講資料進了該進的地方,也就是你已經付錢簽約買企業版了,但還是擋不住資料流出去。
多數公司在買企業版的時候,看的是那一句「不會用你的資料訓練模型」。這句話是真的,三家主流廠商的商用條款都這樣寫。問題是資料出去的路不只一條,訓練只是其中一條,而且是最容易被合約關掉的那一條。
把五條路攤開來看。
訓練(training)。企業版與 API 預設不拿去訓練,這一條不用擔心。
留存(data retention)。企業版的對話不是用完就消失。不特別要求的話,預設狀態是會保留 30 到 90 天,用途是濫用監控(abuse monitoring)。以 OpenAI 為例,API 的輸入輸出留至多三十天,之後刪除,除非法律要求保留;要做到零留存(zero data retention,ZDR),得另外申請,而且要廠商核准。Anthropic 的商用條款也是 30 天內刪除,但有例外:執行使用政策與法律要求。Google 同樣預設為濫用監控留 prompt log,標準模型留至多 90 天,要零留存得申請例外。會超過這個期限的有兩種情況:法律要求,以及被安全機制標記。
出境與落地(data residency/region)。這一條要拆成兩件事:資料存放在哪個國家(靜態駐留,data residency),跟模型在哪個國家處理你的請求(推論區域,inference),合約寫了前者不代表包含後者。兩者三家都有得選,但預設不一定是你要的地方,要你自己開、自己選;若有資料完全不出境的需求,得透過雲端服務商部署設定,AWS Bedrock、Vertex AI、Azure OpenAI 都能把存放與推論綁在指定區域內,這部分你要自己管理。
人工審閱(human review)。這是最容易產生誤會的一條。預設是沒有人看你的對話。但預設不代表絕對,例外掛在濫用監控與法律要求上:Google Cloud 的文件把整條鏈寫出來,分類器標記的 prompt 由授權員工看,還可能回頭聯絡你;OpenAI 的企業隱私頁也寫得很清楚,能接觸到存在他們系統上的商業資料的,除了負責工程支援、調查濫用、法遵的授權員工,還有受保密與資安義務約束的特定第三方承包商(third-party contractors),僅為審查濫用與誤用。也就是說,為了審查濫用,會有人看你的對話,而且不一定是廠商自己的人。看哪些、怎麼挑,條款沒寫;平台文件只在特例裡提到「分類器偵測到疑似違規」才留下人工審閱。Anthropic 的商用頁沒有寫到人,只寫被標記(flagged)的對話會留到兩年、信任與安全分類分數留到七年。
子處理商(sub-processors)。原本合作的 SaaS 服務商推出 AI 功能時,它是怎麼與模型供應商(model provider)對接的?你的合約是跟 SaaS 服務商簽的,你公司內標準的資料留存與落地規範,它跟模型廠商之間有沒有使用同樣的標準,它接的是企業版還是一般 API?你的 AI 有幾層、每一層在誰手上,Day 19 繼續。
五條攤開,合約真正替你關掉的只有訓練;留存與落地要你開口才會動;人工審閱你開口也未必動得了;子處理商則要看你簽約的對象是誰。
還有一條路,合約管不到:法院。
2025 年 5 月,紐約南區聯邦法院在紐約時報告 OpenAI 的著作權訴訟裡,命令 OpenAI 保存並隔離所有原本會被刪除的 ChatGPT 輸出紀錄,包含使用者已經刪掉的對話。範圍涵蓋 Free、Plus、Pro、Team,以及沒有簽零留存的 API 使用者;企業版與教育版這一次被排除在外。OpenAI 提出重審,5 月 16 日被駁回。到 9 月底,往後的保存義務才終止,但四月到九月間已經隔離下來的資料仍然要留著。
這件事是法院找廠商要。另一頭是法院直接找使用者要。2026 年 5 月,美國康乃狄克聯邦法院在一件環保訴訟裡,命令原告交出專家證人用來篩文件的 AI prompts。專家用的是私有部署的 GPT-4o,原告主張那只是搜尋關鍵字、不是 prompts,法院不接受:專家的方法本來就可以被對方要求揭露,用 AI 把文件篩成子集是方法的一部分;要說沒有,得由負責的人簽名保證,日後被證明不實有制裁。這件被引為第一件聯邦法院命令交出專家 AI prompts 的裁定,原告已提異議,還在訴訟中。
兩件事放在一起看,跟你買的是不是企業版沒有關係,連模型部署在地端也一樣。三家的商用條款本來就寫著法律要求時會保留、會提供,合約給你的只有事前通知和配合縮小範圍。合約約束的是對方答應什麼,不是這件事有沒有能力發生。只要用了,法院要求,就得提供。
台灣也一樣,而且更直接。廠商雖然都在境外,但資料在你手上。民事訴訟法規定,跟案件有關的文書,法院命你提出就得提出;沒有正當理由不交,法院可以直接認定對方說的為真,等於你替對方作證。
前面五條路加一個法院,沒有一條是靠「信任」關掉的:能關的靠合約,關不掉的只能連送都不要送。留存多久、存在哪個區域、底下接了誰的模型,這三條 CTO 跟法務能去談。但談完之後還有一個問題:哪些資料就算三條全寫進合約也不該進任何 AI。這不是信不信任廠商的問題,是你經得起哪些資料流出去。回到 Day 6 那句:一端是你花錢買它的原因,另一端是你最不想發生的事;到底是哪些事,每家公司都不一樣。
這條線畫在哪,決定了後面幾篇要談的權限、留痕、閘門守的到底是什麼。線沒畫,後面每一道護欄都不知道自己在守什麼。線畫好之後的事,線下的資料分幾級、跟廠商要談哪幾條、哪一小片值得自己架,才有依據。資料出去是一種風險;資料沒出去、AI 自己寫下的推測被當成事實讀回來,是另一種,後面接著說。
一句話帶走:資料一旦送出去,就不再只屬於你。