用 AI 工作時怎麼避免資料外洩¶
把工作內容貼進 AI 已經是日常操作,貼之前多數人不會停下來想那段文字接下來會經過誰。前半處理個人操作:貼進去之後發生什麼、哪些內容不該貼、哪些內容你沒貼也送出去了、貼之前可以怎麼處理。後半是本地模型、團隊政策,以及該問供應商的問題。
貼進去之後發生什麼¶
供應商看得到內容¶
雲端 AI 服務要處理你的輸入才能回應,所以內容在供應商那端是明文。傳輸過程有 TLS 加密,但 TLS 只擋路徑上的第三方,擋不到服務本身。這跟端對端加密的通訊工具是不同的模型,見 端對端加密如何運作。
會不會被拿去訓練,取決於你用的是哪一版¶
這是「工作使用」最關鍵的一條分界,主要商業服務目前的通則相近:
- 個人版與免費版:輸入內容可能被用於改進模型,通常提供關閉的設定
- 企業版、團隊版與 API:預設不用於訓練,並且有資料處理協議可簽
以三家公開政策為例,OpenAI 說明消費者服務的內容可能用於訓練,而 ChatGPT Team、Enterprise 與 API 預設不訓練2。Anthropic 的商業服務(Claude for Work、API)不使用輸入與輸出訓練模型,消費者服務則由使用者選擇是否提供3。Google 的 Gemini Apps 有自己的活動與改進設定4。
用公司帳號登入企業版,跟用私人帳號登入免費版,是兩件事。前者你的雇主有合約保障,後者沒有。
刪除對話不等於資料消失¶
最容易被誤解的一項。刪除對話紀錄只清掉你看得到的那一份,已經進入其他流程的副本不受影響:
- Google 說明被人工審查過的對話(以及語言、裝置類型、位置資訊等相關資料)不會因為你刪除活動而被刪除,最長保留三年4
- Anthropic 說明使用者選擇提供資料後,去識別化的內容在模型訓練管線中最長可保留五年3
- 已經進入訓練的資料無法追溯抽回,關閉設定只對之後的內容生效
關閉訓練設定要盡早做,等到貼了敏感內容才想起來就來不及了。
人工審查是常態¶
品質評估與濫用偵測通常包含人工環節。Google 明確說明有一部分對話由人工審查者(含受訓的服務供應商)檢視,送出前會與帳號脫鉤4。安排本身合理,但「只有機器看得到」的假設不成立。
企業版的紀錄,你的雇主看得到¶
企業版解決的是供應商不拿去訓練,沒有解決你在公司內部的可見度。管理者通常可以存取使用紀錄,對合規是必要的,對你個人則是另一種暴露面。用公司的 AI 帳號處理私事,跟用公司電腦處理私事是同一類問題。
中國境內的 AI 服務是另一套框架¶
DeepSeek、豆包、Kimi、通義等在中國境內提供的生成式 AI 服務,受《生成式人工智慧服務管理暫行辦法》規範,前面那套「看你用哪一版」的判斷方式在這裡不適用。本節的「境內」、「境外」都以中國為界。
該辦法 2023 年 8 月 15 日施行,由網信辦會同六個部門發布1,跟工作使用直接相關的規定有:
- 使用者要實名。服務提供者須驗證使用者身分,你在這些服務上的提問不是匿名的
- 輸入與輸出都要留存。法規要求保存使用者輸入與生成內容的紀錄,這跟境外服務「你可以關掉訓練」的設定是不同性質的事,那是產品選項,這是法定義務
- 具輿論屬性或社會動員能力的服務要做安全評估與演算法備案,內容審核內建在服務裡
要問的問題因此往前一步。中國境外的服務問的是會不會拿去訓練、保留多久,中國境內的服務要先問自己願不願意讓一段內容跟實名綁在一起長期保存。企業版與資料處理協議在境外能解決供應商訓練的問題,在境內解決不了法定留存與可調取。
另外要區分服務與模型。DeepSeek 這類同時提供境內服務也公開模型權重,用它的線上服務跟把權重下載到自己機器上執行,是完全不同的兩件事。
還有一個容易漏掉的入口,中國境內平台附帶的 AI 功能同樣適用上面的規則,包括辦公軟體、瀏覽器裡的助手,以及輸入法。輸入法的暴露面比其他項高一個量級,它看得到的是你在所有 app 裡打的每一句話,而雲端聯想多半預設開啟。
三條路,各自的門檻¶
判斷完之後通常剩三個選項,沒有一條是沒有代價的:
| 路徑 | 主要門檻 |
|---|---|
| 繼續用中國境內服務 | 實名、法定留存、內容審核內建。不敏感的日常工作可以接受 |
| 改用中國境外服務 | 需要規避工具才連得上。個人翻牆在境內屬違法灰色地帶,2025 年底國安部公開警告會究責。註冊多半需要境外門號與境外付款方式,兩者本身也留下紀錄 |
| 本地模型或自架 | 內容不離開裝置,但模型權重的主要來源在境內連不上,自架伺服器落在備案範圍內,硬體門檻見下方的本地模型一節 |
能連上不等於沒有風險。 長期翻得過去容易讓人把問題當成解決了。可達性是對方可以單方面改變的,今天通不代表明天通,而長期沒有被阻斷也不等於沒有被記錄。連線特徵本身就是一種紀錄,在某些情境下,使用規避工具這個行為比查詢內容更引人注意。
「敏感」的認定也要調整。中國境外多半由你自己判斷什麼算敏感,中國境內是事後由他人認定,範圍比上面那份不該貼的清單更寬,政治話題、跨境往來、勞資爭議、宗教都可能落進去。
哪些內容不該貼¶
- 未公開的商業資訊:未發布的財務數字、併購案、產品規格、內部策略文件
- 憑證與金鑰:API key、密碼、連線字串、憑證檔。貼進去就要當作已經外洩,回頭作廢舊的、換一組新的
- 客戶與同事的個人資料:姓名、身分證字號、電話、地址、病歷、金融紀錄
- 他人託付給你的內容:最常被忽略的一項。你可以決定自己的資料要不要交出去,但你沒有代替第三方同意的權利。消息來源、當事人、受訪者、求助者的內容尤其不行
- 受法律或契約保護的資料:病歷、法律卷宗、簽了保密協議的材料
- 可以拼出身分的組合:單獨看沒問題的幾項資訊,湊在一起就足以指認特定的人
記者、社工、醫療、法律工作者要特別注意「他人託付給你的內容」與「可以拼出身分的組合」兩項。相關的判斷方式見 記者保護消息來源 的來源意願一節。
貼之前可以怎麼處理¶
去識別化¶
多數工作情境需要的是結構與邏輯,不是真實的識別資訊:
- 真名換成代號,公司名換成產業描述
- 具體金額換成量級或比例
- 精確日期換成相對時間(上季、去年同期)
- 地址換成城市或區域層級
- 程式碼裡的 endpoint、金鑰、內部主機名先清掉
處理完之後回頭看一次,確認剩下的內容還能不能反推出來源。要記得去識別化處理的是內容,你的帳號沒有變,供應商仍然知道是誰在問這個問題,提問的主題本身也是資訊。
只貼需要的那一段¶
整份文件貼上去比較快,代價是把不需要的部分一起送出。多數任務只需要相關的段落。
一個判斷題¶
貼之前問自己:如果這段內容明天出現在公開的搜尋結果裡,會有什麼後果。答案是「沒什麼」就貼,答案是「會出事」就先去識別化或改用別的方式處理。
你沒有主動貼,但也送出去了¶
更常見的洩漏來自你沒有意識到正在送出的那些:
- 瀏覽器的 AI 外掛:多數需要讀取當前頁面才能運作,你打開的內部系統、客戶資料、後台頁面都在範圍內
- 編輯器與 IDE 的 AI 助手:預設把周邊程式碼甚至整個專案當成脈絡送出,一支寫死金鑰的設定檔就足夠外洩一整組憑證
- 會議轉錄與摘要工具:一旦開啟就錄下整場對話。在場其他人未必同意被錄
- 輸入法的 AI 功能:雲端聯想與改寫會把你打的字送到伺服器
- 辦公軟體內建的助手:文件、郵件、試算表的內容成為預設輸入
處理的方式落在設定上。第一步是先去看已經裝了什麼:瀏覽器的擴充功能清單、編輯器的外掛清單、以及帳號授權過的第三方應用。多數瀏覽器 AI 外掛可以把網站權限從「所有網站」改成「點擊時才啟用」,敏感的專案與網域個別停用,開會前則先問過在場的人。組織盤點時,這類工具比員工手動貼上更值得優先處理。
本地模型¶
在自己的機器上執行模型,內容不離開裝置,是敏感工作的可行選項。取捨很清楚:
- 值得的情況:處理客戶個資、未公開材料、消息來源相關內容,或者所在環境本身不適合把資料送出境
- 成本:需要足夠的硬體,實務上記憶體是主要門檻,一般筆電能執行的小型模型品質也低於同期的大型商業模型,設定與維護要自己來
- 注意:本地執行不等於自動安全。對話紀錄仍在你的機器上,裝置被搜或被入侵時一樣暴露。全碟加密與裝置管理仍然需要
介於兩者之間的選項是自架或由組織託管的服務,可信任範圍從外部供應商收回到自己的維運團隊。
團隊與組織¶
- 先承認大家已經在用。禁止而不提供替代方案,結果是員工改用自己的私人帳號,資料流向更難掌握
- 提供一個核准的入口。企業版帳號加上清楚的使用範圍,比全面禁止有效
- 政策要具體。「請謹慎使用」沒有人知道怎麼執行,改成列出不能貼的類別(客戶個資、憑證、未公開財務)
- 說明可見度。讓同事知道管理者看得到企業版的使用紀錄
- 納入既有流程。AI 服務屬於第三方處理者,該走的資安評估與資料處理協議跟其他雲端服務一樣
該問服務供應商的問題¶
政策每隔幾個月就變,提問清單比答案撐得久。要用某個服務處理工作內容前,先查:
| 要問的 | 去哪裡查 |
|---|---|
| 我用的方案,輸入會不會用於訓練 | 供應商的資料使用政策頁 |
| 關閉訓練的設定在哪,關閉後對已送出的內容有沒有效 | 同上,通常在資料控制或隱私設定 |
| 對話紀錄保留多久,刪除後真的刪了嗎 | 資料保留政策 |
| 哪些情況會有人工審查,審查過的內容保留多久 | 同上 |
| 資料存在哪個法域,有沒有跨境傳輸 | 資料處理協議或子處理者清單 |
| 有沒有企業版與資料處理協議可簽 | 商業條款頁 |
三家主要服務的官方入口:OpenAI 的資料使用政策、Anthropic 隱私中心、Gemini Apps 隱私中心。其他服務找對應的政策頁,找不到公開說明本身就是一個訊號。
AI 會編造,也是安全問題¶
資料外洩之外,錯誤資訊也會造成傷害。語言模型很會用肯定的語氣說錯的事,尤其是電話號碼、法條編號、資費、緊急聯絡管道這類細節。把回答當成「接下來該查哪些東西」的清單,逐項回到一手來源核對。出國前數位安全:用 AI 自助產生目的地概況 有更完整的說明與可複製的提問範例。
本頁會過期¶
AI 服務的條款與設定介面變動很快,本頁的查證日是 2026 年 8 月。上面描述的機制與提問清單設計成能撐久一點,具體的政策內容請以各家官方頁當下的版本為準。發現本頁描述與現況不符,歡迎到 社群 Matrix 公開 room 回報。
接下來¶
- 出國前數位安全:用 AI 自助產生目的地概況:把該問的問題打包成 prompt,帶回去問你自己信任的 AI
- 端對端加密如何運作:為什麼「有加密」不代表服務端看不到內容
- 威脅模型如何建立:先判斷對手是誰,再決定要用哪一種 AI 服務
- 社群平台怎麼收集你的資料:同一套「這些資料流向誰」的問法,用在社群平台上
-
Interim Measures for the Management of Generative Artificial Intelligence Services - China Law Translate 的法規英譯。2023 年 8 月 15 日施行,網信辦會同六部門發布,含實名驗證、輸入與輸出紀錄留存、具輿論屬性服務的安全評估與演算法備案。查證日 2026-08。 ↩
-
How your data is used to improve model performance - OpenAI。說明消費者服務與商業服務(ChatGPT Team、Enterprise、API)在訓練使用上的差別,以及資料控制設定的位置。查證日 2026-08。 ↩
-
Anthropic Privacy Center - Anthropic。商業服務不使用輸入與輸出訓練模型,消費者服務由使用者選擇。選擇提供後,去識別化內容在訓練管線中最長保留五年。查證日 2026-08。 ↩↩
-
Gemini Apps Privacy Hub - Google。說明人工審查的範圍與帳號脫鉤處理,以及被人工審查過的對話最長保留三年、不隨活動刪除而移除。查證日 2026-08。 ↩↩↩