对话数据的去向
网页版、API、企业版,三种形态的数据去向不一样。
网页版、API、企业版,三种形态的数据去向不一样。「我的对话数据会去哪?」答案不是一句话,而是取决于你用的是哪种形态。网页版、API、企业版,同一家厂商的承诺可能完全不同。
你会遇到的现象:
- 同事在网页版里贴了客户信息,事后才担心去向
- 技术方案里写了「数据不会用于训练」,但没人核过条款原文
- 要做合规的 AI 功能,不知道该怎么选接入形态
三种形态
**网页版 / App(个人产品)。**面向普通用户的免费或订阅产品。这类产品的数据政策通常最宽松:对话内容可能被用于改进模型,人工审核者可能看到部分对话。这是个人使用最方便的形态,也是贴敏感信息最不该用的形态。
API(开发者接入)。你调用接口来构建自己的应用。这类通常默认不用于训练(多数主流厂商如此),但会有数据留存期限、以及是否在途加密等细节。以 OpenAI 为例,其企业隐私说明里写明:2023 年 3 月之后来自 API 的数据默认不用于训练,输入输出最多保留 30 天。openai-data 这是绝大多数「做个 AI 功能」场景的默认选择。选哪家厂商、走哪条渠道,条款都不一样。
企业版 / 商业协议。面向组织的形态,通常明确承诺不用于训练、可签保密协议、可约定数据驻留。价格最贵,但这是唯一能把「数据使用边界」写进合同里的形态。涉及客户数据、医疗、金融等合规场景,几乎必须走这条。Anthropic 的隐私政策也把个人产品与商业服务分开陈述,方便你对照自己的接入形态。anthropic-privacy
一个常见误区:以为「同一家公司,政策都一样」。错。同一家公司三种形态的承诺可以差异很大。按你实际要用的那个产品去查它的条款,不要类推。
关键条款怎么看
看条款,抓三个问题:
**一、数据会不会被用于训练?**这是最核心的一条。注意措辞是「默认」还是「承诺」:默认不用于训练,意味着你要主动选择退出或开启;承诺不用于训练,才是合同级别的保证。
**二、数据保留多久?**对话记录存多久、何时删除、删除有没有延迟窗口。你作为产品方,要知道用户的数据在你背后留了多久。
**三、有没有人工可见?**有些形态会注明「人工审核可能抽查对话」。这对隐私敏感场景是致命细节,条款里可能藏在很后面。
另外,厂商的条款会更新。你上线时看了一遍,半年后它改了,你的合规假设就过期了。把「定期复查条款」写进维护流程。
作为产品方
如果你是做 AI 产品的,要承担三件事:
一、给用户说清楚。「你的对话会不会被用于训练、数据留多久、怎么删除」——这些要写进你的隐私政策,用用户能看懂的话。让用户从猜测变成知情,是基本底线。
**二、别替用户做主。**你选择了「数据用于训练」的通道,等于把用户的数据转交给了第三方训练——用户没有同意这件事。做这个决定前,确认你的条款允许、用户知情。
**三、数据最小化。**不发送不必要的内容。只把「完成任务需要的那部分」发给模型,其余留在自己手里。这也是判断边界的一部分。
最后记住那条红线:**数据一旦进了第三方用于训练,几乎不可能撤回。**文件还能删,权重里学到的东西删不掉。所以在「发出去」之前看清路,比事后补救重要得多。
