跳转至

用 AI 工作时怎么避免数据外泄

把工作内容贴进 AI 已经是日常操作,贴之前多数人不会停下来想那段文字接下来会经过谁。前半处理个人操作:贴进去之后发生什么、哪些内容不该贴、哪些内容你没贴也送出去了、贴之前可以怎么处理。后半是本地模型、团队政策,以及该问供应商的问题。

贴进去之后发生什么

供应商看得到内容

云端 AI 服务要处理你的输入才能回应,所以内容在供应商那端是明文。传输过程有 TLS 加密,但 TLS 只挡路径上的第三方,挡不到服务本身。这跟端对端加密的通讯工具是不同的模型,见 端对端加密如何运作

会不会被拿去训练,取决于你用的是哪一版

这是「工作使用」最关键的一条分界,主要商业服务目前的通则相近:

  • 个人版与免费版:输入内容可能被用于改进模型,通常提供关闭的设定
  • 企业版、团队版与 API:默认不用于训练,并且有数据处理协议可签

以三家公开政策为例,OpenAI 说明消费者服务的内容可能用于训练,而 ChatGPT Team、Enterprise 与 API 默认不训练2。Anthropic 的商业服务(Claude for Work、API)不使用输入与输出训练模型,消费者服务则由使用者选择是否提供3。Google 的 Gemini Apps 有自己的活动与改进设定4

用公司账号登入企业版,跟用私人账号登入免费版,是两件事。前者你的雇主有合约保障,后者没有。

删除对话不等于数据消失

最容易被误解的一项。删除对话记录只清掉你看得到的那一份,已经进入其他流程的副本不受影响:

  • Google 说明被人工审查过的对话(以及语言、装置类型、位置信息等相关数据)不会因为你删除活动而被删除,最长保留三年4
  • Anthropic 说明使用者选择提供数据后,去识别化的内容在模型训练管线中最长可保留五年3
  • 已经进入训练的数据无法追溯抽回,关闭设定只对之后的内容生效

关闭训练设定要尽早做,等到贴了敏感内容才想起来就来不及了。

人工审查是常态

品质评估与滥用侦测通常包含人工环节。Google 明确说明有一部分对话由人工审查者(含受训的服务供应商)检视,送出前会与账号脱钩4。安排本身合理,但「只有机器看得到」的假设不成立。

企业版的记录,你的雇主看得到

企业版解决的是供应商不拿去训练,没有解决你在公司内部的可见度。管理者通常可以存取使用记录,对合规是必要的,对你个人则是另一种暴露面。用公司的 AI 账号处理私事,跟用公司电脑处理私事是同一类问题。

中国境内的 AI 服务是另一套框架

DeepSeek、豆包、Kimi、通义等在境内提供的生成式 AI 服务,受《生成式人工智能服务管理暂行办法》规范,前面那套「看你用哪一版」的判断方式在这里不适用。

该办法 2023 年 8 月 15 日施行,由网信办会同六个部门发布1,跟工作使用直接相关的规定有:

  • 使用者要实名。服务提供者须验证使用者身份,你在这些服务上的提问不是匿名的
  • 输入与输出都要留存。法规要求保存使用者输入与生成内容的记录。境外服务的「关掉训练」是产品选项,境内的留存是法定义务,两者性质不同
  • 具舆论属性或社会动员能力的服务要做安全评估与算法备案,内容审核内建在服务里

要问的问题因此往前一步。境外服务问的是会不会拿去训练、保留多久,境内服务要先问自己愿不愿意让一段内容跟实名绑在一起长期保存。企业版与数据处理协议在境外能解决供应商训练的问题,在境内解决不了法定留存与可调取。

另外要区分服务与模型。DeepSeek 这类同时提供境内服务也公开模型权重,用它的线上服务跟把权重下载到自己机器上执行,是完全不同的两件事。

还有一个容易漏掉的入口,境内平台附带的 AI 功能同样适用上面的规则,包括办公软件、浏览器里的助手,以及输入法。输入法的暴露面比其他项高一个量级,它看得到的是你在所有 app 里打的每一句话,而云端联想多半默认开启。

三条路,各自的门槛

判断完之后通常剩三个选项,没有一条是没有代价的:

路径 主要门槛
继续用境内服务 实名、法定留存、内容审核内建。不敏感的日常工作可以接受
改用境外服务 需要规避工具才连得上。个人翻墙在境内属违法灰色地带,2025 年底国安部公开警告会究责。注册多半需要境外号码与境外付款方式,两者本身也留下记录
本地模型或自架 内容不离开设备,但模型权重的主要来源在境内连不上,自架服务器落在备案范围内,硬件门槛见下方的本地模型一节

能连上不等于没有风险。 长期翻得过去容易让人把问题当成解决了。可达性是对方可以单方面改变的,今天通不代表明天通,而长期没有被阻断也不等于没有被记录。连接特征本身就是一种记录,在某些情境下,使用规避工具这个行为比查询内容更引人注意。

「敏感」的认定也要调整。境外多半由你自己判断什么算敏感,境内是事后由他人认定,范围比上面那份不该贴的清单更宽,政治话题、跨境往来、劳资争议、宗教都可能落进去。

哪些内容不该贴

  • 未公开的商业信息:未发布的财务数字、并购案、产品规格、内部策略文件
  • 凭证与密钥:API key、密码、连接字串、凭证档。贴进去就要当作已经外泄,回头作废旧的、换一组新的
  • 客户与同事的个人资料:姓名、身份证号、电话、地址、病历、金融记录
  • 他人托付给你的内容:最常被忽略的一项。你可以决定自己的数据要不要交出去,但你没有代替第三方同意的权利。消息来源、当事人、受访者、求助者的内容尤其不行
  • 受法律或合约保护的数据:病历、法律卷宗、签了保密协议的材料
  • 可以拼出身份的组合:单独看没问题的几项信息,凑在一起就足以指认特定的人

记者、社工、医疗、法律工作者要特别注意「他人托付给你的内容」与「可以拼出身份的组合」两项。相关的判断方式见 记者保护消息来源 的来源意愿一节。

贴之前可以怎么处理

去识别化

多数工作情境需要的是结构与逻辑,不是真实的识别信息:

  • 真名换成代号,公司名换成产业描述
  • 具体金额换成量级或比例
  • 精确日期换成相对时间(上季、去年同期)
  • 地址换成城市或区域层级
  • 程序码里的 endpoint、密钥、内部主机名先清掉

处理完之后回头看一次,确认剩下的内容还能不能反推出来源。要记得去识别化处理的是内容,你的账号没有变,供应商仍然知道是谁在问这个问题,提问的主题本身也是信息。

只贴需要的那一段

整份文件贴上去比较快,代价是把不需要的部分一起送出。多数任务只需要相关的段落。

一个判断题

贴之前问自己:如果这段内容明天出现在公开的搜寻结果里,会有什么后果。答案是「没什么」就贴,答案是「会出事」就先去识别化或改用别的方式处理。

你没有主动贴,但也送出去了

更常见的泄漏来自你没有意识到正在送出的那些:

  • 浏览器的 AI 外挂:多数需要读取当前页面才能运作,你打开的内部系统、客户数据、后台页面都在范围内
  • 编辑器与 IDE 的 AI 助手:默认把周边代码甚至整个项目当成脉络送出,一支写死密钥的配置文件就足够外泄一整组凭证
  • 会议转录与摘要工具:一旦开启就录下整场对话。在场其他人未必同意被录
  • 输入法的 AI 功能:云端联想与改写会把你打的字送到服务器
  • 办公软件内建的助手:文件、邮件、试算表的内容成为默认输入

处理的方式落在设定上。第一步是先去看已经装了什么:浏览器的扩展清单、编辑器的插件清单、以及账号授权过的第三方应用。多数浏览器 AI 外挂可以把网站权限从「所有网站」改成「点击时才启用」,敏感的项目与网域个别停用,开会前则先问过在场的人。组织盘点时,这类工具比员工手动贴上更值得优先处理。

本地模型

在自己的机器上执行模型,内容不离开装置,是敏感工作的可行选项。取舍很清楚:

  • 值得的情况:处理客户个资、未公开材料、消息来源相关内容,或者所在环境本身不适合把数据送出境
  • 成本:需要足够的硬件,实务上内存是主要门槛,一般笔电能执行的小型模型品质也低于同期的大型商业模型,设定与维护要自己来
  • 注意:本地执行不等于自动安全。对话记录仍在你的机器上,装置被搜或被入侵时一样暴露。全盘加密与装置管理仍然需要

介于两者之间的选项是自架或由组织托管的服务,可信任范围从外部供应商收回到自己的维运团队。

团队与组织

  • 先承认大家已经在用。禁止而不提供替代方案,结果是员工改用自己的私人账号,数据流向更难掌握
  • 提供一个核准的入口。企业版账号加上清楚的使用范围,比全面禁止有效
  • 政策要具体。「请谨慎使用」没有人知道怎么执行,改成列出不能贴的类别(客户个资、凭证、未公开财务)
  • 说明可见度。让同事知道管理者看得到企业版的使用记录
  • 纳入既有流程。AI 服务属于第三方处理者,该走的信息安全评估与数据处理协议跟其他云端服务一样

该问服务供应商的问题

政策每隔几个月就变,提问清单比答案撑得久。要用某个服务处理工作内容前,先查:

要问的 去哪里查
我用的方案,输入会不会用于训练 供应商的数据使用政策页
关闭训练的设定在哪,关闭后对已送出的内容有没有效 同上,通常在数据控制或隐私设定
对话记录保留多久,删除后真的删了吗 数据保留政策
哪些情况会有人工审查,审查过的内容保留多久 同上
数据存在哪个法域,有没有跨境传输 数据处理协议或子处理者清单
有没有企业版与数据处理协议可签 商业条款页

三家主要服务的官方入口:OpenAI 的数据使用政策Anthropic 隐私中心Gemini Apps 隐私中心。其他服务找对应的政策页,找不到公开说明本身就是一个讯号。

AI 会编造,也是安全问题

数据外泄之外,错误信息也会造成伤害。语言模型很会用肯定的语气说错的事,尤其是电话号码、法条编号、资费、紧急联络管道这类细节。把回答当成「接下来该查哪些东西」的清单,逐项回到一手来源核对。出国前数字安全:用 AI 自助生成目的地概况 有更完整的说明与可复制的提问范例。

本页会过期

AI 服务的条款与设定界面变动很快,本页的查证日是 2026 年 8 月。上面描述的机制与提问清单设计成能撑久一点,具体的政策内容请以各家官方页当下的版本为准。发现本页描述与现况不符,欢迎到 社群 Matrix 公开 room 回报。

接下来


  1. Interim Measures for the Management of Generative Artificial Intelligence Services - China Law Translate 的法规英译。2023 年 8 月 15 日施行,网信办会同六部门发布,含实名验证、输入与输出记录留存、具舆论属性服务的安全评估与算法备案。查证日 2026-08。 

  2. How your data is used to improve model performance - OpenAI。说明消费者服务与商业服务(ChatGPT Team、Enterprise、API)在训练使用上的差别,以及数据控制设定的位置。查证日 2026-08。 

  3. Anthropic Privacy Center - Anthropic。商业服务不使用输入与输出训练模型,消费者服务由使用者选择。选择提供后,去识别化内容在训练管线中最长保留五年。查证日 2026-08。 

  4. Gemini Apps Privacy Hub - Google。说明人工审查的范围与账号脱钩处理,以及被人工审查过的对话最长保留三年、不随活动删除而移除。查证日 2026-08。